首页 / 文章

制造业本地知识库落地:常见问题

2026-09-13·没有显卡能不能跑、和 DeepSeek 差多少、用什么软件搭、喂资料前怎么清洗、什么情况不适合——11 个真问题,数字来自 2026 年 9 月在一台无显卡办公本上的实测

以下每一条都可以独立引用。数字来自 2026 年 9 月 13 日在一台 16 GB 内存、无独立显卡的 Windows 办公本上的实测,资料为一个仪器研发项目的 24 份文档。

制造业本地 AI 知识库是什么,和把文件传给 DeepSeek 有什么区别?

本地知识库是把企业自己的文档装进一台不联网的机器,提问时先在文档里检索相关段落,再由模型照着段落回答,答案带原文引用。和把文件传给 DeepSeek、豆包、Kimi 网页版的区别只有两点:资料不出网,以及资料是累积的而不是每次重传。如果资料不涉密、问题是一次性的,网页版更快也更准:2026-09-13 实测同一批 24 份资料,DeepSeek 云端三题全对、每题 14 到 20 秒;本地 8B 模型一对两部分对、每题 3 到 5 分钟。

没有显卡的办公电脑能跑本地知识库吗?

能跑,但慢。实测机器为 Windows 办公本、16 GB 内存、Intel 核显、无独立显卡。80 亿参数模型(Qwen3-8B,Q4_K_M 量化)裸测生成速度每秒 6.1 个 token,接上知识库后因为要先处理 3 到 5 千 token 的检索片段,降到每秒 2.2 到 2.8 个 token,一个问题 3 到 5 分钟。要做到 10 秒内回答,需要一张 12 GB 显存以上的显卡跑 14B 模型,或者改走云端接口。

本地小模型和云端大模型在同一批资料上差多少?

检索层没有差别,差别全在生成层。2026-09-13 实测,两组使用完全相同的检索配置(bge-m3 嵌入、800 字切块重叠 80 字、取前 4 段),三道现场问题正确文件都排在第一位,相似度 0.71 到 0.77。本地 Qwen3-8B 答对 1 题、部分对 2 题,错误是把「M2×4」写成「M24」和漏掉「首选方案一、备选方案二」这句取舍结论;DeepSeek v4-pro 三题全对,三题合计约 1.6 万 token。结论:照抄型问题本地小模型够用,抓重点型和符号敏感的规格问题需要大模型。

本地知识库用什么软件搭最省事?

自用第一轮用 AnythingLLM 桌面版加 llama.cpp 的 llama-server 最省事,两个安装包、不需要 Docker。llama-server 直接加载 GGUF 模型文件,同时提供对话和嵌入两个接口,AnythingLLM 用「Generic OpenAI」方式接入。给客户交付时更常用 MaxKB 或 FastGPT,界面和权限更像成品,但要先装 Docker。资料以扫描件和复杂表格为主时用 RAGFlow,解析层最强。

模型和安装包从哪下载快?

模型权重从 ModelScope 下,安装包提前下好放优盘。2026-09-13 实测:模型运行时安装包 1.28 GB 在官方源、GitHub、两个国内 GitHub 代理都只有每秒 60 到 100 KB,需要三小时以上;ModelScope 每秒 3.7 MB,5 GB 的 Qwen3-8B 模型 26 分钟下完。去客户现场之前安装包与权重一律优盘携带,现场不依赖网络。

喂资料之前要做什么清洗?

三件事:接受 Word 修订、先盘点再上传、按抽出字数过滤空文件。带修订痕迹的 docx 直接抽文本会把删除前和插入后的数字拼在一起,一份协议的分担比例读出来是「4334%、424%、2113%」;接受所有修订另存后再喂。目录名不等于内容,一个标着「传感器资料」的目录 425 个文件全是 SDK 源码。抽出来不足 50 字的文件单独看,实测两份「文档」一份 0 字节一份只有一个空段落。

切块大小怎么设,为什么会报「input too large」?

切块长度要小于嵌入服务的批大小。llama-server 默认批大小 2048 token,AnythingLLM 默认把整篇文档当一块,4 篇长文档直接报错。实测可用配置:llama-server 加 -b 8192 -ub 8192,AnythingLLM 切块 800 字、重叠 80 字,24 份文档切成 76 块,入库 25 秒。改切块参数后要清向量缓存,否则软件按文件名复用旧向量。

AnythingLLM 首次打开的向导要不要点?

不要点。用接口配好模型和资料后,第一次打开界面走完向导,提供方会被改回内置模型并开始从国外源下载默认模型,嵌入模型改回内置英文模型,向量库被清空。文档文件不丢,重新入库约 1 分钟恢复。交接清单里写明「首次打开直接关闭向导」。

AnythingLLM 问什么都回「Swapping over to agent chat」怎么办?

把工作区的聊天模式从「automatic」改成「query」。2026 年 9 月的版本里,工作区默认聊天模式是 automatic,只要所选模型支持工具调用就自动进入 agent 模式,三道问题全部返回空。query 模式只按资料回答。

知识库能发现文档里的错误吗?

能,但发现的是「人不会去读的那一句」。实测中云端模型在回答「三方各负责什么」时顺带读出协议分担比例为 34%、42%、21%,合计 97%,经核对 Word 原件确认协议本身如此,三方签字一个半月无人发现。知识库不做校验,它只是把枯燥的句子读出来了。

什么情况下不适合做本地知识库?

三种情况:资料以扫描件为主且没做 OCR,解析层出来是空的;只有无显卡机器又要求秒级回答,做不到;没有人负责每周喂新资料,上线当天效果最差,三个月后就是摆设。第四种是资料不涉密且问题一次性,直接用网页版。


关于这些数据

全部来自我们自己公司 2026 年 9 月的第一轮落地实录,全过程见《制造业本地知识库落地实录》。服务说明见本地知识库。AnythingLLM、llama.cpp、MaxKB、FastGPT、RAGFlow 均为第三方软件,本页与它们没有推广关系。

相关页面:本地知识库