解决什么问题
通用大模型什么都会一点,但在你那个具体任务上——判断一枚印章是不是倒盖、把检验记录里的量和单位抽出来、给客诉分类——它又贵又慢,还不稳定。小模型训练做的是:用你积累的样本,训一个只回答这一个问题的模型,几十 MB、CPU 上毫秒级、结果可复现。
我们自己的例子:RecordLint 质录检里「印章清晰完整」「印章倒盖」两条规则是模型驱动的,使用方在界面里标注自己的印章样本、训练、上线;模型只回答「这枚章是什么状态」,判不判违规仍由规则决定。训练依赖 sklearn,部署侧推理只用 numpy。
怎么交付
- 先判该不该训:提示词能解决的不训;知识库能解决的不训;只有当任务定义清楚、样本能攒到几百到几千条、且对速度或离线有硬要求时才训。我们会先做一轮判断,结论可能是「不用训」。
- 数据:你提供样本,我们提供标注规范和标注工具;样本量门槛按任务定(分类几百条起,抽取几千条起)。数据不出你的环境。
- 训练与评测:留出测试集,报告准确率、召回率、误报类型;对比一个「提示词 + 通用大模型」的基线,训出来的模型必须在你的测试集上明显更好或明显更快,否则不交付。
- 交付物:模型文件、评测报告(含测试集与错误样本)、部署脚本(CPU 可跑)、再训练脚本(样本增加后你自己能重训)。
不适合谁
- 任务本身说不清楚判据、两个人标注结果都不一致的:先统一口径,再谈模型。
- 样本不到一百条又不愿意攒的:用提示词加通用模型。
- 期望「训一个自己的 ChatGPT」的:那是通用大模型的预训练,不是垂直小模型,成本不在一个量级。
常见问题
什么时候该训小模型,而不是写提示词或做知识库?
三个条件同时满足才训:任务定义清楚、能攒到几百到几千条样本、对速度或离线有硬要求。提示词能解决的不训,知识库能解决的不训。我们先做一轮判断,结论可能是「不用训」。
训练垂直小模型需要多少数据?
分类任务几百条起,抽取任务几千条起,具体看类别数和样本平衡程度。样本少时先用规则加通用模型顶着,边用边攒。
小模型训练需要显卡吗?
经典机器学习模型(如印章状态分类)在 CPU 上几分钟训完;微调小语言模型需要一张消费级显卡,几小时。部署侧一律按 CPU 可跑来交付。
训好的小模型怎么部署?
交付模型文件和一个部署脚本,CPU 上毫秒级推理,可以嵌进你现有系统或作为内网服务。数据和模型都不出你的环境。
垂直小模型和大模型微调是一回事吗?
不是。垂直小模型是只干一件事的判定或抽取模型,几十 MB;大模型微调是在通用模型上调整风格或领域知识,仍需大显存推理。多数制造业任务用前者就够。
样本增加以后能自己重训吗?
能。交付物里包含再训练脚本和标注规范,样本增加后你自己重训、重评测、替换模型文件。