词错误率(WER):核心概念、公式及应用
- 发布时间
- 最近更新
理论上,词错误率(WER)是衡量自动语音识别(ASR)工具准确率的指标。WER 越低,最终转录越准确;错误率越高,说明转录内容偏差越多。
实际应用中,WER 可能决定医疗转录软件记录的是“十五毫克”还是“五十毫克”的处方剂量。它也决定了客服工具能否准确转录客户需求,还是让用户感到困扰。
本文将详细介绍 WER 的定义、计算方法,以及如何用它评估自己的 ASR 供应商。
摘要
- 词错误率统计替换、删除、插入三类错误,并用参考转录文本的总词数作为分母。
- WER 公式为 WER = (S + D + I) / N。
- WER 越低,输出结果越准确。
- WER 低于 5% 是不错的参考标准,但法律或医疗转录可能需要更低的错误率。
- WER 将所有错误视为同等重要,因此并非评估语境的完美指标。新兴指标如语义词错误率(SWER)则尝试通过衡量语句含义是否保留来补充这一点。
什么是词错误率?
词错误率(WER)是衡量文本转语音模型识别准确率的标准指标。它以 0-1 的形式表示(如 0.8 代表 80% 错误率),反映 STT 系统转录时的错误情况,包括替换、删除和插入。
替换指用错词,删除指漏掉词,插入则是多加了原本没说的词。WER 统计这三类错误,再除以正确转录文本的总词数,得到可用于不同供应商对比的数值。
WER 公式如下:
WER = (S + D + I) / N
其中:
- S:替换(词错误)
- D:删除(词缺失)
- I:插入(多余词)
- N:参考转录文本总词数
WER 可用小数或百分比表示。WER 越低,说明模型转录时出错越少,得分越好。
实际中,10% 的 WER 意味着会议转录中大约每 10 个词就有 1 个需要复查。
词错误率为何对语音识别系统重要?
词错误率提供了团队可用于对比不同供应商的客观指标。它能避开营销宣传,清晰反映语音识别模型的准确性。基于数据,企业在评估方案时能直观看到哪些模型表现领先。

来源:Artificial Analysis 访问时间:2026 年 7 月 10 日。
截至 2026 年 7 月,独立研究机构 Artificial Analysis 将 ElevenLabs 的 Scribe v2 评为行业内非流式转录模型在 AA-AgentTalk 数据集上的最低 WER,得分为 1.5%。
除了供应商评估,WER 在产品层面也有实际影响。医疗转录软件若 WER 达到 12%,可能导致患者病历出现严重错误。客服通话中的转录错误也可能引发后续问题,比如情感分析不准或分类错误。
除了这些具体场景,ASR 系统出错时,受影响最大往往是那些只能通过转录文本获取语音内容的人群。万维网联盟 提供了关于无障碍标准的详细文档,供进一步了解。
如何计算词错误率:公式与示例
掌握步骤后,计算词错误率其实很简单。上文提到,公式为 WER = (S + D + I) / N。各项含义如前所述,分别是替换、删除、插入,N 为转录总词数。
计算 WER 的步骤如下:
- 创建参考转录文本: 用人工转录和校对,得到音频片段的准确文本。
- 使用 STT 工具: 用 ASR 平台转录音频片段,生成 AI 转录文本,作为测试对象。
- 对齐两份文本: 用动态规划(如 Levenshtein 算法)找出最少编辑次数。后文会详细介绍该算法。
- 套用公式:统计 AI 版本与人工校对版本的总错误数,然后用 WER = (S + D + I) / N 计算准确的 WER。
纸面上看似复杂,实际操作却很简单。下面用一个例子说明。
参考转录文本:Mrs. Dalloway said she would buy the flowers herself.
ASR 输出:Miss Dalloway said she would buy flowers herself.
统计总错误,有 1 个 S 和 1 个 D,共 9 个词。
代入公式,WER = 2 / 9 = 0.222 = 22.2%。
用 Python 计算词错误率
手动方法虽然可行,但用 python 计算 WER 能节省时间。推荐使用jiwer 库 ,可自动完成所有计算。
参考 jiwer 文档安装该包,专为评估 ASR 系统和生成 WER 等核心指标设计。安装后,可用如下代码快速计算 WER:
在这个例子中,ASR 输出与原始参考文本有两处不同。‘jumps’ 被错转为 ‘leaps’(替换),‘last’ 被插入到 ‘lazy’ 前(插入)。参考文本共 9 个词,出现 2 个错误,WER 为 0.222 或 22.2%。
词错误率与其他识别指标对比
WER 是 ASR 计算准确率的标准指标,但还有其他工具可用。例如:
- 字符错误率(CER): 类似 WER,但在字符级别衡量转录准确率,适用于没有明确分词界限的语言或对拼写敏感的任务。
- 匹配错误率(MER): 衡量转录错误比例,对替换、插入、删除的处理方式与 WER 略有不同,关注句子中错误的比例。
- 词信息丢失率(WIL): 估算转录过程中原始信息的丢失程度,反映可理解性,而非 WER 的直接错误计数。
- 嵌入错误率(EmbER): 对转录文本进行语义分析,超越 WER,衡量正确词与错误转录之间的语义距离。
每种指标适用于不同场景。下表可供参考:
Levenshtein 距离示例:WER 背后的数学原理
词错误率本质上衡量原始文本与假设输出之间的距离。数学上,这一差异用 Levenshtein 距离表示。
Levenshtein 距离统计将一个序列变为另一个序列所需的最少单元编辑次数。对于 WER,具体指替换、插入和删除。例如,将 Cat 变为 Mat,只需将 ‘C’ 替换为 ‘M’,Levenshtein 距离为 1。
CER 计算中会更多用到字符级别,WER 则将 Levenshtein 距离扩展到词级。每个单元是一个完整的词,实际距离反映将 ASR 输出变为准确原文所需的词级编辑数。
我们构建一个矩阵,每个单元格表示原始转录与 ASR 转录之间的总距离。Levenshtein 距离从左上到右下填充矩阵,最后一个单元格给出总词级编辑数。用该数除以 N,即为 WER。
虽然该矩阵通常按字符计算,这里用前述例子的词级版本简化说明。

词错误率常见误区与理解偏差
随着STT API 越来越易用,ASR 软件也成为智能体工具链的常见组成部分,不同工具之间的对比会越来越多。
在自己计算 WER 前,有几个常见问题和误区需要注意。
- 所有错误权重相同: WER 将每个错误都视为同等重要。很多场景下这样没问题,但有些用例则不可接受。例如医院里,5% 的 WER 虽然被认为不错,但一两个错误就可能危及患者安全。这一局限促使了新指标如语义词错误率(SWER)的出现,专门衡量句子含义是否保留,而非每个词是否完全匹配。
- WER 可超过 100%: 前文提到 WER 范围在 0 到 1,但实际可能超过 100%。因为插入错误可能导致转录词数多于原文。例如将 ‘I’m’ 转为 ‘I am’,一个词变成两个。
- WER 越低并非总是更好: 理论上 5% 的 WER 比 10% 更好。但如果 5% 的错误严重改变了句子语境,而 10% 的错误影响不大,实际效果就不同了。语境依然很重要,SWER 等指标正是为捕捉语义影响而设计。
2024 年,Apple 发布了一项有趣的研究,探讨了上述问题。人类评估 9.4% WER 的转录文本是否可读时,给同一段落打出了仅 2.2% 的 WER。在他们测试的例子中,人类认为许多“错误”并不重要,人工 WER 比机器宽容 4 倍以上。
行业 WER 基准
理想的 WER 很大程度取决于所用 ASR 技术的行业或场景。虽然 <5% 是行业参考标准,但医疗、法律等领域要求更低的错误率。
在Artificial Analysis 2026 年 7 月的研究中,ElevenLabs Scribe v2 的 WER 为 1.5%。但需注意,这类统计通常以英语为主。其他语言的 STT 技术可能效果不如英语。
ElevenLabs Docs 详细介绍了通用 WER 区间,涵盖 Scribe v1 和 Scribe v2 支持的所有语言。
用 ElevenAPI 提升识别准确率
开发对转录质量有要求的应用或产品时,选对 ASR API 与一般方案的差距,首先体现在 WER,其次体现在用户体验。
ElevenLabs Scribe 是语音转文本层,可通过ElevenAPI 调用。支持 90 多种语言,WER 行业领先,还具备说话人分离、词级时间戳、关键词提示、实体识别等功能。
访问ElevenLabs Docs 了解更多 ElevenAPI 信息,或立即注册 开始体验。
.webp&w=3840&q=80)


.webp&w=3840&q=80)
