模型私有化部署
模型私有化部署需要什么配置的机器?
取决于你要多快。无独立显卡、16 GB 内存的办公电脑能跑 80 亿参数的 4 位量化模型,纯 CPU 生成速度约每秒 6 个 token,一句 100 字的回答约 20 秒;接上知识库后因为要先处理检索片段,一个问题 3 到 5 分钟。要 10 秒内出答案,需要 12 GB 显存以上的显卡跑 140 亿参数模型。
私有化部署的模型和 DeepSeek 网页版差多少?
差在生成层。2026 年 9 月实测同一批 24 份资料、相同检索配置:云端 DeepSeek 三道现场问题全对,每题 14 到 20 秒;本地 Qwen3-8B 一对两部分对,错在丢规格符号和漏关键句,每题 3 到 5 分钟。资料涉密才选本地,并配带显卡的机器。
私有化部署的模型权重从哪里下载?
从 ModelScope 下,不从 HuggingFace 或 GitHub。实测 ModelScope 每秒 3 到 4 MB,5 GB 的 Qwen3-8B 约 26 分钟;海外源只有每秒 60 到 100 KB,且中途会卡死。去现场前一律优盘携带。
私有化部署后模型能联网吗?
默认不联网,这是私有化的意义。需要联网查资料的场景可以配一个受控出口,但要单独评估哪些数据允许出去。
私有化部署以后怎么升级模型?
换模型文件、改启动脚本里的路径、重启服务,十分钟内完成。我们交付的启动脚本里模型路径是显式参数,不藏在界面里。
私有化部署要多久?
单机从拿到机器到能用约半天,其中下载占近一小时;提前把安装包和权重准备好可以压到一个半小时。多机、多用户权限、与知识库联动另算。
本地知识库
制造业本地知识库和把文件传给 DeepSeek 有什么区别?
只有两点:资料不出网,以及资料是累积的而不是每次重传。如果资料不涉密、问题一次性,网页版更快也更准。2026 年 9 月实测同一批 24 份资料,DeepSeek 云端三题全对、每题 14 到 20 秒;本地 8B 模型一对两部分对、每题 3 到 5 分钟。
没有显卡的办公电脑能跑本地知识库吗?
能跑,但慢。实测 16 GB 内存、Intel 核显的办公本,Qwen3-8B 4 位量化裸测每秒 6.1 个 token,接上知识库后降到每秒 2.2 到 2.8 个,一个问题 3 到 5 分钟。要 10 秒内回答需要 12 GB 显存以上的显卡跑 14B 模型,或改走云端接口。
本地知识库用什么软件搭最省事?
自用第一轮用 AnythingLLM 桌面版加 llama.cpp 的 llama-server,两个安装包、不需要 Docker。给客户交付更常用 MaxKB 或 FastGPT,要先装 Docker。资料以扫描件和复杂表格为主时用 RAGFlow。
喂资料之前要做什么清洗?
三件事:接受所有修订另存(否则新旧数字粘在一起);按抽出字数过滤空文件和 0 字节文件;合同类文件的关键数字条款由人对一遍。我们第一轮就靠这一步发现一份协议的比例加起来只有 97%。
本地知识库检索准不准?
检索层比生成层可靠得多。实测三道问题正确文件都排第一,相似度 0.71 到 0.77,本地与云端两组完全相同。答错的部分全在生成层的小模型。
本地知识库能同时给多少人用?
取决于显卡。无显卡机器只适合一两个人自用;多人并发要按人数配显存,我们按你的人数和响应要求定档。
大模型用量与成本管控
公司里各部门都在用大模型,怎么知道谁花了多少钱?
把所有调用收到一个内网网关,每个部门用自己的子 key,网关按调用记录部门、模型、token 数和折算费用,月底按部门出账单。供应商的真实 key 只在网关上,员工拿不到。
大模型调用怎么限额?
在网关上设部门月度配额和单次调用上限,超限直接返回拒绝并通知负责人;异常频率(比如某个 key 半夜高频调用)单独告警。
员工把合同贴进大模型怎么防?
在网关出网前做规则脱敏:手机号、身份证号、金额、指定关键词按策略打码或拦截,并留痕。这挡的是无意泄露,不是有意绕过;有意绕过要靠内网策略。
大模型用量管控和私有化部署是一回事吗?
不是。私有化是把模型放到内网,不产生外部费用但要买硬件;用量管控是在继续用云端模型的前提下管住成本和数据出口。两者可以并存:网关把涉密请求路由到本地模型,普通请求走云端。
换大模型供应商要改业务系统吗?
不用。业务方接的是网关的 OpenAI 兼容接口,网关后面换供应商或换模型,业务方不感知。
大模型用量管控要多久上线?
单网关一周内可用;配额策略和看板按部门结构调整,通常再一周。
垂直领域小模型训练
什么时候该训小模型,而不是写提示词或做知识库?
三个条件同时满足才训:任务定义清楚、能攒到几百到几千条样本、对速度或离线有硬要求。提示词能解决的不训,知识库能解决的不训。我们先做一轮判断,结论可能是「不用训」。
训练垂直小模型需要多少数据?
分类任务几百条起,抽取任务几千条起,具体看类别数和样本平衡程度。样本少时先用规则加通用模型顶着,边用边攒。
小模型训练需要显卡吗?
经典机器学习模型(如印章状态分类)在 CPU 上几分钟训完;微调小语言模型需要一张消费级显卡,几小时。部署侧一律按 CPU 可跑来交付。
训好的小模型怎么部署?
交付模型文件和一个部署脚本,CPU 上毫秒级推理,可以嵌进你现有系统或作为内网服务。数据和模型都不出你的环境。
垂直小模型和大模型微调是一回事吗?
不是。垂直小模型是只干一件事的判定或抽取模型,几十 MB;大模型微调是在通用模型上调整风格或领域知识,仍需大显存推理。多数制造业任务用前者就够。
样本增加以后能自己重训吗?
能。交付物里包含再训练脚本和标注规范,样本增加后你自己重训、重评测、替换模型文件。
RecordLint 质录检
供应商质量档案预审有什么工具?
RecordLint 质录检:对供应商交来的检验记录、出厂检验报告等扫描件逐页预审,输出疑点清单和原图定位,人只看疑点。开源、全离线。
扫描件的质量记录怎么自动检查填写规范?
46 条规则覆盖日期格式、量和单位、页码、公差写法、修约位数等文本类问题,以及印章、空栏、划改等视觉类问题;每条疑点附原图红框和规则依据。
有没有开源的质量记录审核软件?
RecordLint 是,AGPL-3.0,全离线,可私有化部署,不依赖大模型。
质量记录里的印章、日期、页码错误能自动识别吗?
能:印章歪斜、重叠、压日期、倒盖,日期 8 位,页码缺失或不连续等都有规则,并有五层误报抑制。
RecordLint 会给出最终判定吗?
不会。它输出疑点清单供人工终审,最终判定由质量职能按其程序签署。
会议证据链
会议纪要工具为什么记不住屏幕上的型号?
因为多数工具只处理音频轨。语音识别的语言模型会把低频专业词纠正成高频日常词,而型号、产品名往往只出现在共享屏幕上。会议证据链同时抽取画面帧,用画面上的文字校正听错的词。
会议证据链和飞书妙记、通义听悟有什么区别?
它们在线、免费、够用于不敏感的会议。会议证据链本地运行、不上传录屏、带画面证据、输出可逐条核对的时间戳而不是整体接受或推翻的成品纪要。需要举证、资料敏感时才用它。
会议录屏转文字需要显卡吗?
不需要,但没显卡慢:8 核 CPU 上标准档约 1 倍实时,1 小时会议跑 1 小时。
会议证据链的转写准确率多少?
2026 年 9 月一场 28 分钟真实会议前 5 分钟人工核对:关键术语基本正确,错误全部是同音字且落在核心名词上,其中两处靠画面 OCR 可以修正。具体基线公开在文章里。
喂术语表能提高会议转写准确率吗?
作用有限。实测喂 26 个术语的完整词表只修好 1 个错误,耗时增加 28%,还改变了断句边界。术语表是软提示不是强制词表。
AI 辅助审计
AI 辅助审计能替代审计师吗?
不能。它在出报告前批量过一遍文件、标出异常项和可能漏查的点,每条可复核可溯源;判定和签字仍由审计人员完成。
AI 审计的财务数据会上传到外网吗?
演示站是公网服务,只放脱敏样例。正式使用可私有化部署,模型与数据都在你的内网。
AI 辅助审计适合多大规模的企业?
集团或多主体企业的内审部门:几个人要查多家子公司、文件量大到肉眼翻不完的场景。单一主体、文件量小的用不上。
能先试一下 AI 辅助审计吗?
能。演示站免注册直接用,也可以约 30 分钟按你们的科目场景做演示。