解决什么问题
很多制造企业的图纸、工艺、合同、客户资料不允许出网,但员工又已经在用手机上的 DeepSeek、豆包处理这些资料——这本身就是泄露。私有化部署解决的是:把模型放到你内网的一台机器上,员工像用网页版一样提问,数据不离开公司。
它不解决「本地模型比云端更聪明」——正相反,同等价位下本地模型比云端大模型弱。我们的实测(2026 年 9 月,同一批 24 份资料、同一套检索配置):云端 DeepSeek 三道现场问题全对,本地 80 亿参数模型一对两部分对。选私有化,是因为资料不能出网,不是因为它更准。
怎么交付
- 硬件先定档:无独立显卡的办公机能跑 80 亿参数量化模型,一个问题 3~5 分钟,适合自用验证;要 10 秒内出答案,需要 12 GB 显存以上的显卡跑 140 亿参数模型;更大的模型按并发人数配多卡。我们先问你有什么机器,再定模型,不反过来。
- 安装包与权重提前下好:模型权重从 ModelScope 下(实测每秒 3~4 MB,是 GitHub 的三十多倍),安装包与权重一律优盘带到现场,现场不依赖网络。
- 交付物:一台配好的机器(或你的机器上装好的一套服务)、内网访问地址、管理员手册、一键启动脚本、交接清单(包括「首次向导不要点下一步」这类踩过的坑)。
- 周期:单机部署从拿到机器到能用,我们自己第一次做用了约 4.5 小时(其中近 1 小时在等下载),第二次预计 1.5 小时。多机、多用户权限、与知识库联动另计。
不适合谁
- 资料不涉密、问题是一次性的:直接用云端网页版更快也更准,不要花这个钱。
- 指望本地小模型替代云端大模型做「抓重点」「多文件综合判断」的工作:本地 8B 会漏关键句、会把「M2×4」写成「M24」,这类任务需要 14B 以上或走接口。
- 只有几台老办公机、又要求秒回:硬件不够,先补硬件或走接口。
常见问题
模型私有化部署需要什么配置的机器?
取决于你要多快。无独立显卡、16 GB 内存的办公电脑能跑 80 亿参数的 4 位量化模型,纯 CPU 生成速度约每秒 6 个 token,一句 100 字的回答约 20 秒;接上知识库后因为要先处理检索片段,一个问题 3 到 5 分钟。要 10 秒内出答案,需要 12 GB 显存以上的显卡跑 140 亿参数模型。
私有化部署的模型和 DeepSeek 网页版差多少?
差在生成层。2026 年 9 月实测同一批 24 份资料、相同检索配置:云端 DeepSeek 三道现场问题全对,每题 14 到 20 秒;本地 Qwen3-8B 一对两部分对,错在丢规格符号和漏关键句,每题 3 到 5 分钟。资料涉密才选本地,并配带显卡的机器。
私有化部署的模型权重从哪里下载?
从 ModelScope 下,不从 HuggingFace 或 GitHub。实测 ModelScope 每秒 3 到 4 MB,5 GB 的 Qwen3-8B 约 26 分钟;海外源只有每秒 60 到 100 KB,且中途会卡死。去现场前一律优盘携带。
私有化部署后模型能联网吗?
默认不联网,这是私有化的意义。需要联网查资料的场景可以配一个受控出口,但要单独评估哪些数据允许出去。
私有化部署以后怎么升级模型?
换模型文件、改启动脚本里的路径、重启服务,十分钟内完成。我们交付的启动脚本里模型路径是显式参数,不藏在界面里。
私有化部署要多久?
单机从拿到机器到能用约半天,其中下载占近一小时;提前把安装包和权重准备好可以压到一个半小时。多机、多用户权限、与知识库联动另算。