一份三方协议,分担比例 34%、42%、21%。
加起来 97%。
三方盖章,修订版,签了一个半月,没人发现。发现它的不是律师,是一台 16 GB 内存、没有独立显卡的办公本。
上周我们把一个仪器研发项目的 24 份资料装进了这台机器:用户手册、六份会议纪要、需求清单、这份协议、电源管理需求。然后问它三个现场真会问的问题。第三题问「三方各负责什么、垫资期限多久」,云端 DeepSeek 在思考过程里顺嘴把那三个比例读了出来。
不是它聪明。是它把 7800 字里最枯燥的一句读了,而人从来不读那句。
同一批资料,本地模型和云端各答三题
两个组,检索层完全一样,只换答题的模型。
| 本地 Qwen3-8B | 云端 DeepSeek | |
|---|---|---|
| 三题 | 1 对,2 部分对 | 3 对 |
| 错在哪 | 把「M2×4」写成「M24」;漏了「首选方案一」 | 无 |
| 每题用时 | 3 到 5 分钟 | 14 到 20 秒 |
| 资料出网 | 不出 | 检索到的段落出网 |
三题里检索层都命中了正确文件,本地组错的两处全在「写答案」那一步:符号丢了、关键句漏了。
所以分界线不是本地还是云端,是问题类型。照抄型的问题(谁负责什么、参数多少)本地小模型够用;要抓重点的问题(怎么取舍)它会漏。 涉密资料本地问,不涉密的问题走接口,两条腿分开走。
两个坑,不做知识库也用得上
带修订痕迹的 Word,抽出来的文字是新旧拼在一起的。 那份协议直接抽文本,比例那句读出来是「4334%、424%、2113%」。你用任何工具批量处理合同之前,先「接受所有修订」另存。这条和 AI 没关系,和 Word 有关系。
标着「资料」的目录不一定是资料。 一个叫「传感器资料」的目录,425 个文件,打开是 SDK 源码和 dll。真正的文档在另外三个目录,一共 24 份。先盘点再动手,十分钟省几百份垃圾。
什么情况下别做
没显卡又要秒回,做不到。资料全是扫描件没做 OCR,做了也是空的。没人负责往里喂新资料,三个月后它就是个摆设。
最后
(实测于 2026 年 9 月 13 日,Windows 办公本 16 GB 内存无独显;AnythingLLM 桌面版 + llama.cpp,模型 Qwen3-8B Q4 与 bge-m3,对照组 deepseek-v4-pro。全部过程与坑的记录见《制造业本地知识库落地实录》。)
那个 97%,三方现在要补一份更正。
知识库替你读的,是你签了字却没读过的那一句。
相关页面:本地知识库