上周我们把一个仪器研发项目的 24 份资料装进了一台办公本:用户手册、六份会议纪要、需求清单、一份三方物料协议、电源管理需求、光路说明。然后问了它三个现场真会问的问题。
第三个问题问的是那份三方协议里谁负责什么、垫资期限多久。本地模型答对了。云端的 DeepSeek 也答对了。但 DeepSeek 在思考过程里顺嘴读出了一句:三方的损失分担比例是 34%、42%、21%。
加起来 97%。
打开 Word 原件,开了「显示标记」,盯着那句看了一分钟。协议本身就是这么写的。三方签字的修订版,比例不足 100%,从签的那天起没人发现。
这不是 AI 多聪明。它只是把一份 7800 字的协议里最枯燥的一句话读出来了,而人不会去读那句。
下面是这次落地的全过程,包括踩的坑,以及本地模型和云端模型在同一批资料上的对照。数字都是实测的。
先说机器:16 GB 内存,没有独立显卡
多数中小制造企业的办公机就是这个配置,所以故意没用带显卡的机器。
结果是:本地跑一个 80 亿参数的模型(Qwen3-8B,4 位量化),裸测每秒 6.1 个 token。接上知识库以后,每次提问要先把检索到的四段资料喂给模型处理,每秒掉到 2.2 到 2.8 个 token。一个问题从提交到答完,3 到 5 分钟。
同样三个问题给 DeepSeek 云端,每秒 87 个 token,14 到 20 秒一题。
这是第一个要老实说的短板:没显卡的机器上,本地知识库是「能用」,不是「好用」。 你问一句,可以去倒杯水。
知识库是四层,坏的通常不是模型那层
行业里把这类东西叫 RAG,检索增强生成。它不是把资料「教」给模型,而是每次提问时先在资料里找出最相关的几段,再让模型照着那几段回答。四层:
- 文档解析:PDF、Word 变成文字
- 切块与嵌入:文字切成几百字一块,每块算成一个向量
- 检索:找出和问题最像的几块
- 生成:模型读着那几块写答案
这次的三个问题,前三层全部命中:本地组和云端组检索到的前四段完全相同,正确的那份文件都排在第一,相似度 0.71 到 0.77。
差别全在第四层。本地 8B 模型:
- 第一题把「M2×4 热熔螺母、M2×8 螺钉」写成了「M24」「M28」。原文 PDF 抽出来是「M2 4」中间带空格,大模型补回了乘号,小模型没有。
- 第二题问三个电源方案怎么取舍。它把九条充电细节全列对了,却漏掉了「首选方案一、备选方案二」这句,而问题问的恰恰是取舍。
- 第三题全对。
云端 DeepSeek 三题全对。
所以结论不是「本地不行」。是:照抄型问题(谁负责什么、参数是多少)本地小模型够用;抓重点型问题(怎么取舍、结论是什么)和符号敏感的规格,它会漏。 这条分界线比「本地 vs 云端」有用得多,因为它告诉你什么问题该问哪个。
跟直接把文件扔给 DeepSeek 有什么区别
先说对我们不利的那半边。
如果你的资料不涉密、总量不大、问题都是一次性的,那你不需要这套东西。DeepSeek、豆包、Kimi 的网页版都能传文件,答得比本地 8B 好,还不用等 3 分钟。这次三题合计一万六千个 token,按公开价折算不到一角钱。
本地方案赢在两件事上,而且只赢在这两件事上:
一是资料不出网。这次喂进去的有三方协议、内部定价政策、带客户名的会议纪要。这类东西传公有云,不是「敢不敢」的问题,是很多客户的合规部门直接说不。
二是资料是积累的。网页版每次上传是一次性的,下次还得再传。知识库是一个越喂越厚的东西,第二周问的问题能用到第一周的资料。
至于企业微信、飞书自带的 AI 知识库:资料同样在对方服务器上,我们没有实测它们在这批资料上的表现,不评价。
13 个坑里最值钱的 5 个
按发生顺序。
坑 1:带修订痕迹的 Word 会把新旧数字拼在一起。 那份协议是修订版,直接抽文本,6.4 条读出来是「4334%、424%、2113%」,修订前后的数字连成了一串。不清洗就喂进去,模型会一本正经地答一个不存在的数。合同、规范类文件几乎都带修订,喂之前先「接受所有修订」另存一份。而且清洗完还要人核一遍关键数字,97% 那句就是这么核出来的。
坑 2:资料目录名不等于内容。 标着「传感器资料」的目录有 425 个文件,打开一看是传感器 SDK 的源码和 dll。真正的文档在项目管理、硬件设计、会议记录三个目录里,一共 24 份。盘点花了十分钟,省掉了几百份垃圾进库。
坑 3:海外源慢到不可用。 知识库软件的安装包和模型运行时,官方源、GitHub、两个国内代理实测都是每秒 60 到 100 KB,1.3 GB 的安装包要三个多小时。模型权重换到 ModelScope,每秒 3.7 MB,5 GB 的模型 26 分钟。去客户现场之前,安装包和权重一律优盘带好,现场不指望网络。
坑 4:切块参数两头要对齐。 嵌入模型默认一次最多吃 2048 个 token,知识库软件默认把整篇当一块,四篇长文直接报错。改成 800 字一块、重叠 80 字,24 份切成 76 块,入库 25 秒。
坑 5:软件的首次向导会覆盖配置并清空向量库。 用接口把模型配好、资料喂完、三题跑完,然后犯了个低级错误:没关向导就把机器交出去了。别人打开界面顺手点了一遍「下一步」,配置被改回内置模型,向量库被清空,还开始从国外拉一个没人要的默认模型。这锅是我们的,向导是软件的。文档还在,重新入库一分钟恢复。但这条一定要写进交接清单:第一次打开界面直接关掉向导。
什么情况下不要做
- 资料以扫描件为主,没做 OCR:解析层出来是空的,后面三层再好也没用
- 只有一台无显卡机器,又要求秒回:做不到,要么加一张 12 GB 显存的卡跑 14B 模型,要么接受走接口
- 没有人负责喂资料:知识库上线那天最差,靠使用者每周往里加东西才变好。没有这个人,三个月后它就是个摆设
一句话
资料出不出网是合规决定的,模型选本地还是云端是问题类型决定的,这两件事别混在一起做决策。
(本文所有数字来自 2026 年 9 月 13 日在一台 16 GB 内存无独显 Windows 办公本上的实测记录;软件为 AnythingLLM 桌面版 + llama.cpp,模型 Qwen3-8B Q4_K_M 与 bge-m3,对照组 deepseek-v4-pro。逐条问答版见《制造业本地知识库落地:常见问题》,服务说明见本地知识库。)
这次最有价值的产出不是知识库本身,是那个 97%。
知识库替你读的,是你签了字却没读过的那一句。
相关页面:本地知识库