解决什么问题
大模型接口按 token 计费,一次调用几分钱,看起来不贵;但各部门各自申请 key、各自接工具,三个月后没人说得清账单里哪笔是谁的、哪个自动化脚本在半夜跑、哪份合同被谁贴进了提示词。
用量与成本管控解决的是把所有调用收到一个出口:一个内网网关,员工和系统都通过它访问模型,网关记录每次调用的部门、用途、token 数、费用,按部门设配额,超了就拦,敏感内容按规则告警。
怎么交付
- 统一接入口:内网部署一个 OpenAI 兼容的网关,各部门拿到的是网关地址和自己的子 key,真正的供应商 key 只在网关上。换供应商、换模型不用改业务方。
- 按部门计量:每次调用落库(时间、部门、应用、模型、输入输出 token、折算费用)。月底一张按部门的账单,和供应商账单对得上。
- 配额与告警:部门月度配额、单次调用上限、异常频率告警(比如某个 key 半夜每秒十次)。
- 内容留痕与脱敏:提示词与回复可按策略留存或只留摘要;手机号、身份证号、合同金额这类字段可在出网前打码。
- 交付物:网关服务、看板、配额策略文档、各部门接入说明。周期:单网关一周内可用,策略与看板按你的部门结构调整。
不适合谁
- 全公司只有两三个人用、一个 key 就够的:直接在供应商后台看账单即可。
- 要求网关能「审核回答对不对」的:它记录和限额,不判断内容质量。
- 所有调用都已经在本地私有化模型上、不产生外部费用的:需要的是监控而不是成本管控,见私有化部署一页。
常见问题
公司里各部门都在用大模型,怎么知道谁花了多少钱?
把所有调用收到一个内网网关,每个部门用自己的子 key,网关按调用记录部门、模型、token 数和折算费用,月底按部门出账单。供应商的真实 key 只在网关上,员工拿不到。
大模型调用怎么限额?
在网关上设部门月度配额和单次调用上限,超限直接返回拒绝并通知负责人;异常频率(比如某个 key 半夜高频调用)单独告警。
员工把合同贴进大模型怎么防?
在网关出网前做规则脱敏:手机号、身份证号、金额、指定关键词按策略打码或拦截,并留痕。这挡的是无意泄露,不是有意绕过;有意绕过要靠内网策略。
大模型用量管控和私有化部署是一回事吗?
不是。私有化是把模型放到内网,不产生外部费用但要买硬件;用量管控是在继续用云端模型的前提下管住成本和数据出口。两者可以并存:网关把涉密请求路由到本地模型,普通请求走云端。
换大模型供应商要改业务系统吗?
不用。业务方接的是网关的 OpenAI 兼容接口,网关后面换供应商或换模型,业务方不感知。
大模型用量管控要多久上线?
单网关一周内可用;配额策略和看板按部门结构调整,通常再一周。