解决什么问题
手里几百份文档,找一句话要翻半天;又不敢把资料传到公有云。本地知识库做的事是:先在你的文档里检索相关段落,再让模型照着段落回答,并标出引用来源。资料不出网,而且是累积的,不用每次重传。
我们先在自己公司跑了一轮:24 份项目资料(会议纪要、硬件需求、商务协议)、三道现场会问的问题。检索层三题都把正确文件排在第一位;差别全在生成层——本地小模型会漏关键句,云端大模型三题全对。这轮还顺手替我们发现了一份签了字的协议里比例加起来只有 97%。
怎么交付
- 先盘资料再喂:资料目录名不等于内容。我们盘点时发现一个「光谱仪资料」目录里 425 份文件是传感器 SDK 源码,真正的文档在别处。盘点 10 分钟,省下几百份无关文件。
- 清洗:带修订痕迹的 Word 会把新旧数字粘在一起(「34%」抽出来变成「4334%」),喂之前要接受所有修订另存;空文件、0 字节文件按抽出字数过滤后人工看一眼;合同类文件的关键数字条款由人对一遍。
- 底座:自用最省事是 AnythingLLM 加 llama-server,两个安装包不需要 Docker;给客户交付更常用 MaxKB 或 FastGPT,界面和权限更像成品;扫描件和复杂表格多的用 RAGFlow。整套配置可以脚本化,不用在界面上一格一格点。
- 交付物:装好的知识库、清洗后的资料副本、三道验收问题及标准答案(喂入前由人先写下,不让模型自证)、交接清单。
- 周期:第一轮从盘点资料到能问,我们自己用了约 4.5 小时。
不适合谁
- 无显卡办公机上本地 8B 模型一问要 3~5 分钟,等不了这个时间又不肯配显卡的。
- 要求本地小模型不漏关键句、不写错规格符号的:实测它会把「M2×4」写成「M24」、会漏掉「首选方案一、备选方案二」这种取舍结论。这类问题要 14B 以上模型或走接口。
- 资料不涉密、问题一次性:直接传给云端网页版更快更准。
常见问题
制造业本地知识库和把文件传给 DeepSeek 有什么区别?
只有两点:资料不出网,以及资料是累积的而不是每次重传。如果资料不涉密、问题一次性,网页版更快也更准。2026 年 9 月实测同一批 24 份资料,DeepSeek 云端三题全对、每题 14 到 20 秒;本地 8B 模型一对两部分对、每题 3 到 5 分钟。
没有显卡的办公电脑能跑本地知识库吗?
能跑,但慢。实测 16 GB 内存、Intel 核显的办公本,Qwen3-8B 4 位量化裸测每秒 6.1 个 token,接上知识库后降到每秒 2.2 到 2.8 个,一个问题 3 到 5 分钟。要 10 秒内回答需要 12 GB 显存以上的显卡跑 14B 模型,或改走云端接口。
本地知识库用什么软件搭最省事?
自用第一轮用 AnythingLLM 桌面版加 llama.cpp 的 llama-server,两个安装包、不需要 Docker。给客户交付更常用 MaxKB 或 FastGPT,要先装 Docker。资料以扫描件和复杂表格为主时用 RAGFlow。
喂资料之前要做什么清洗?
三件事:接受所有修订另存(否则新旧数字粘在一起);按抽出字数过滤空文件和 0 字节文件;合同类文件的关键数字条款由人对一遍。我们第一轮就靠这一步发现一份协议的比例加起来只有 97%。
本地知识库检索准不准?
检索层比生成层可靠得多。实测三道问题正确文件都排第一,相似度 0.71 到 0.77,本地与云端两组完全相同。答错的部分全在生成层的小模型。
本地知识库能同时给多少人用?
取决于显卡。无显卡机器只适合一两个人自用;多人并发要按人数配显存,我们按你的人数和响应要求定档。