首页 / 文章

准确率 98%,型号全错。

2026-09-12·一个会议纪要工具说「准确率 98%」时没告诉你的事:错的那 2% 几乎全落在型号、金额、人名上。一场 28 分钟真实会议的实测,以及术语表为什么救不回来

一个语音转写工具告诉你「识别准确率 98%」的时候,它没告诉你的是:那错掉的 2%,几乎全部落在型号、金额和人名上。

因为语音识别的错误从来不是随机分布的。这篇讲它为什么必然如此——以及我为此跟甲方吵了一架。


做一个 UWB 电子标签的项目。需求沟通会开了 28 分钟。

三个月后验收,甲方技术负责人说:我没要求过三色屏。

我说您要求了。他说没有。

会议录屏我留着。28 分钟的录屏,我翻了四十分钟——比这场会本身还久,才找到那一句:他说的是「墨水屏」

那我为什么记成三色屏?因为会后我用转写工具整理了纪要,纪要上写的是「山色屏」。我当时看了一眼,心想大概是三色屏吧,就这么记下来了。

一个字之差,三个月后变成两个人对着桌子说「你说过」「我没说过」。

一、98% 的准确率,和「那句话对不对」,是两个指标

人工逐句核对前 5 分钟:8 处错误,全落在专业名词上

我去查了几家纪要工具的公开说法。有的官网写着识别准确率 98%,还专门提到能听懂「芯片架构」「金融合规」这类行业术语。

这个数字大概率是真的。问题是它和你关心的事不是一件事。

98% 的字准确率,意思是一百个字里错两个。如果这两个字随机分布,那确实没什么影响——错在「的」「了」「这个」上面,你一眼就跳过去了。

但语音识别的错误从来不是随机分布的。它高度集中在低频词上。而你开会时真正要记住的东西——型号、参数、规格、人名、金额——恰恰全是低频词。

所以完全可能出现这种情况:整篇转写 98% 的字是对的,而每一个型号都是错的。这是推论,不是我那场会的实测结论;我那场会里,四个产品型号压根没人念出来过(它们只在屏幕上)。

我那场会的实测错误就在上面那张图里:前 5 分钟人工逐句核对,8 处错误,没有一个是虚词。

二、为什么偏偏是专业词:模型有两层,第二层在帮倒忙

语音识别的两层结构:第二层把对的改成错的

这件事的机制值得讲清楚,因为它不是哪家做得不够好,是这类模型的结构决定的。

语音识别大致分两层。第一层是声学模型。 它听声音,输出可能的音节。这一层对「屏」和「瓶」是没有区别的——普通话里同音。第二层是语言模型。 它在若干个同音候选里挑一个最像人话的,依据是训练语料里的出现频率。

「墨水瓶」在通用中文语料里的出现频率,比「墨水屏」高得多。前者是一个存在了几百年的日常词,后者是最近十几年才有的显示技术。于是第二层把对的改成了错的

越是通用的语言模型,越会把低频的专业词「纠正」成高频的日常词。 它不是没听清,它是听清了之后主动改的,而且改得理直气壮——从语言统计上看,它的选择完全合理。同样的道理解释了「三色屏」输给「山色屏」、「续航」输给「讯号」。

三、我试过术语表。结果是反教程的

26 个术语写进术语表,8 处错误只修对 1 处,耗时 +28%

绝大多数教程都会告诉你:把专业术语做成词表喂进去(Whisper 里叫 initial_prompt),就能解决这个问题。

我信了,认真做了一份,26 个术语,全是这个项目会反复出现的型号和名词。结果:

第三条最要命。断句是很多下游处理的基本单位:你按段落去定位、去截片段、去做人工校对。断句一变,之前所有基于段落的标注全部失配。 所以还有一条推论:术语表不能中途改。改了就必须整段重转。

为什么没用?因为 initial_prompt软提示,不是强制词表。它只是给模型一个语境暗示,大致相当于跟它说「接下来可能会聊电子标签」。模型听不听,看它自己。这一条我在多数教程里没见人说,以我这次实测为准,你可以自己复现。

四、真正有效的东西,藏在会议录屏里

同一场会,屏幕上有、嘴上没说的东西:四个产品型号与尺寸

回到开头。为什么我翻了四十分钟就确定他说的是「墨水屏」?因为那一刻他正在共享屏幕,屏幕上是一份产品 PDF,写着 KINEXON ePaper Tag。ePaper,电子纸,就是墨水屏。

那句话的关键信息,根本不在音频里。 它在画面上。在座的人当时都看见了,所以没人纠正他——大家默认「屏幕上写着呢」。

我把那 28 分钟的录屏按画面变化抽了帧:场景变化 36 帧 + 每 30 秒兜底 57 帧,去重后 85 帧。对这 85 帧做 OCR,出来 2957 个文本块,没有一帧是空的。里面有四个产品型号 MT420A / MT750A / MT1020A / MT1330A,还有尺寸 x85x13x121x13这些东西,音频里一个都没有。

于是纠错有了依据。ConexionKINEXON 的字形相似度是 0.67,屏幕上第 180 秒那一帧的 OCR 置信度是 0.99,拉丁字母可以直接比对。更有意思的是「讯号」:它和「续航」字形上毫无关系,但同期画面写着 Battery life: up to 5 years,模型把这句英文的语义和中文语境对上了,判定说话人说的是「续航能力」。字形匹配做不到这件事,语义印证可以。

五、写到这儿我得承认,前面四节都在打偏的靶子

上面讲了一堆「工具为什么听错」。但让我赔钱的,其实不是工具听错。是我自己没回去核对。

录屏一直在那儿。屏幕上那行 KINEXON ePaper Tag 从会议第 3 分钟开始就摆着。我三个月后花四十分钟能翻到的东西,会后当天花三分钟也能翻到。我没翻。因为我看了纪要,纪要看起来挺完整的,我就信了。

所以这事的根子不是识别率,是「把纪要当结论」这个习惯。而这个习惯不是懒,是成本问题——回去核对一句话要翻四十分钟录屏,任何人都会选择相信纪要。

想明白这一层,要做的东西就变了:不是把识别率从 98% 做到 99%。是把「回去核对」的成本从四十分钟压到三秒。

真正让我赔钱的不是工具,是我没回去核对

因为 99% 也救不了一个不回头看的人。

六、所以我做了个工具,以及它做不到的事

我把上面这套做成了一个 Windows 上的本地软件:录屏丢进去,转写 + 抽帧 OCR + 交叉校正,出来一份带时间戳的纪要,每条结论点一下就跳到视频那一秒。处理全程在本机,素材不上传。 下面是它做不好的地方,应该在你下载之前说清楚:

一、它分不清谁在说话。 会议录屏是混音单轨。声纹分离第一版把 52 段碎成了 11 个「说话人」,补上四处特征提取的细节之后收敛到 3 个,和实际人数对上了。但两个人抢话时,那一段只会归给其中一个。

二、没有独立显卡的话,一小时的会要跑一小时。 这是本地处理的代价。

三、关于「跟飞书妙记有什么区别」:如果你的会议不敏感、也不需要事后举证,用它们就够了,而且免费额度很大。差别只有两点——素材不出本机,以及会读屏幕。至于它们做不做画面 OCR,我查了公开的功能说明没找到,但没有能力穷举。你要是知道哪家做了,请在页底告诉我,我改这篇文章。

七、如果你只带走一句话

错的那 2%,从来不是随机的 2%。

下次有人跟你说某个识别类工具「准确率 98%」的时候,值得多问一句:错的那部分,落在哪儿? 如果它均匀地落在虚词上,98% 是个好数字。如果它集中落在型号、金额、人名上——那这个 98% 跟你没关系。


工具叫会议证据链,Windows 本地运行。上面所有数字都来自一场 28 分钟真实项目会议的实测。

最后交个底:我自己做的需求调研,结论是红灯——我翻公开渠道找「会议里屏幕上的参数没被记下来」这类抱怨,一条都没找到。所以你要是看完觉得用不上,那大概率是对的。

相关页面:会议证据链