跳至内容

词错误率(WER):核心概念、公式及应用

发布时间
最近更新

收听收听本文

理论上,词错误率(WER)是衡量自动语音识别(ASR)工具准确性的指标。WER 越低,最终转录越准确;错误率越高,则表示转录错误的信息越多。

实际应用中,WER 可能决定医疗转录软件会把患者处方写成需要“15 毫克”还是“50 毫克”。它也决定了客服工具能否准确转录客户需求,还是会让用户感到挫败。

本文将介绍 WER 是什么、如何计算,以及如何用它评估自己的 ASR 服务商。

摘要

  • 词错误率统计替换、删除和插入这 3 类错误,再除以参考转录中的词数。
  • WER 公式为 WER = (S + D + I) / N。
  • WER 分数越低,最终输出越准确。
  • WER 低于 5% 是不错的基准,但法律或医疗转录可能需要更低的词错误率。
  • WER 将所有错误视为同等严重,因此并非衡量上下文可读性的完美指标。语义词错误率(SWER)等新指标尝试通过衡量话语含义是否保留来解决这一问题。

什么是词错误率?

词错误率(WER)是衡量文本转语音模型中语音识别准确性的标准指标。它以 0–1 表示 STT 系统转录出错的程度(0.8 代表 80% 的错误率),并根据替换、删除和插入进行计算。

替换指一个词被错误的词取代。删除指完全漏掉一个词。插入则是转录中出现了从未说出的词。WER 综合这 3 项,再除以正确转录的词数,得到可与其他供应商比较的数值。

WER 公式如下:

WER = (S + D + I) / N

其中:

  • S:替换(词错误)
  • D:删除(词缺失)
  • I:插入(存在额外词)
  • N:参考转录中的总词数

WER 可以用小数或百分比表示。WER 越低,说明模型转录时出错越少,得分越好。

实际中,10% 的 WER 意味着会议转录中大约每 10 个词就有 1 个需要复核。

为什么词错误率对语音识别系统很重要?

词错误率为团队比较不同服务商提供了客观指标。它能排除营销宣传的干扰,清晰展示语音识别模型的准确度。以证据为依据,正在评估方案的企业便能明确了解哪些模型目前处于领先地位。

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

来源:Artificial Analysis,访问于 2026 年 7 月 10 日。

截至 2026 年 7 月,独立研究机构 Artificial Analysis将 ElevenLabs 的 Scribe v2 评为非流式转录模型中,在 AA-AgentTalk 数据集上 WER 最低的行业产品,得分为 1.5%。

除了评估服务商,WER 还会在产品层面带来实际影响。WER 为 12% 的医疗转录软件可能在患者病历中引入关键错误。客户支持通话中的转录错误,可能导致后续故障,例如情感分析不准确或分类不佳。

除这些特定用例问题外,ASR 系统失效时,受影响最大的人往往是只能通过转录内容获取语音信息的人。万维网联盟提供了丰富文档,进一步说明无障碍倡议所要求的最低标准。

如何计算词错误率:公式与示例

了解步骤后,计算词错误率并不复杂。如前所述,公式为 WER = (S + D + I) / N。上文已解释所有术语,简而言之,分别是替换、删除、插入,以及代表转录总词数的 N。

计算 WER 的方法如下:

  1. 创建参考转录:使用人工转录和验证,生成准确的音频片段转录。
  2. 使用 STT 工具:使用 ASR 平台转录音频片段,生成用于测试的 AI 转录。
  3. 对齐两个版本:使用动态规划(具体来说是 Levenshtein 算法)找出最少编辑次数。后文会进一步介绍该算法。
  4. 应用公式:统计 AI 生成版本相对于人工验证版本的总错误数,再用 WER = (S + D + I) / N 算出准确的 WER。

看起来技术性较强,但实际操作简单得多。下面通过一个示例说明。

参考转录:Dalloway 太太说她会亲自买花。

ASR 输出:Dalloway 小姐说她会亲自买花。

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

计算总错误数,可得 9 个词中有 1 个 S 和 1 个 D。

套用公式:WER = 2 / 9 = 0.222 = 22.2%。

使用 Python 计算词错误率

手动方法虽有效,但也可以用 Python 计算 WER 来节省时间。jiwer 库可以完全自动处理这些步骤。

根据 jiwer 文档,可以安装这个专为评估 ASR 系统并生成 WER 等核心指标而构建的软件包。下载后,可用以下代码快速通过 Python 计算 WER:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

注意,此示例中 ASR 输出与原始参考文本有两处不同。“jumps”被错误转录为“leaps”(替换),并且在“lazy”前插入了“last”(插入)。参考转录共 9 个词,出现 2 个错误,因此词错误率(WER)为 0.222,即 22.2%。

比较词错误率与其他识别指标

WER 是计算 ASR 准确性的标准指标,但也可以使用其他工具。例如:

  • 字符错误率(CER):与 WER 类似,它衡量字符层面而非词语层面的转录准确性。最适合没有明确词边界的语言(连续书写)或对拼写敏感的任务。
  • 匹配错误率(MER):衡量转录错误比例,但对替换、插入和删除的处理方式与 WER 略有不同。它关注句子中错误所占的比例。
  • 词信息丢失率(WIL):估算转录过程中丢失的原始信息量,衡量的是可理解性,而非 WER 的直接错误计数。
  • 嵌入错误率(EmbER):对不同转录进行语义分析。它超越 WER,可深入了解正确词与错误转录之间的语义距离。

每项指标都适用于不同场景。可参考下表:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Levenshtein 距离示例:WER 背后的数学原理

词错误率本质上衡量原始文本与假设输出之间的距离。要从数学角度理解这一差异,可以使用 Levenshtein 距离。

Levenshtein 距离计算将一个序列转换为另一个序列所需的最少单元编辑次数。对 WER 而言,具体就是替换、插入和删除操作。例如,若要将 Cat 转换为 Mat,需要将字母“C”改为“M”,因此 Levenshtein 距离为 1。

这在 CER 计算中更常见,但 WER 将 Levenshtein 距离扩展到词语层面。每个单元是完整的词而非字符,实际距离衡量的是将 ASR 输出转换为准确原文所需的词语编辑次数。

我们构建一个矩阵,其中每个单元格表示原始转录与 ASR 转录之间的总距离。Levenshtein 距离从左上角填充到右下角,最后一个单元格给出词语层面的总编辑次数。将该数值除以 N 即为 WER。

该矩阵通常按单个字符计算,为简单起见,下面展示前述示例的扩展版本。

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

词错误率的常见误区与陷阱

随着STT API日益普及,ASR 软件也逐渐成为更广泛智能体技术栈的常见组成部分,我们将看到更多不同工具之间的比较。

在计算自己的词错误率前,需要了解几个常见问题和误解。

  • 所有错误都同等重要:WER 将每个错误视为同等严重。在许多场景中这或许没问题,但某些用例无法接受。例如在医院,5% 的错误率虽可算是不错的 WER,却仍可能令人无法理解,因为哪怕一两个错误都可能让患者面临风险。这一局限促成了语义词错误率(SWER)等新指标的发展,它尝试衡量句子含义是否保留,而非每个词是否完全匹配。
  • WER 可以超过 100%:虽然前面说过 WER 在 0 到 1 之间,但它也可能超过 100%。这是因为插入错误可能使词数超过原始转录总词数。常见例子是将“I’m”转录为“I am”,一个词变成两个词。
  • 从技术上说,WER 越低不一定越好:从表面看,5% 的 WER 优于 10%。但如果造成 5% 的错误显著改变了句子上下文,而 10% 中的错误没有,那么这个指标就无法呈现全貌。上下文依然非常重要,因此开发 SWER 等指标正是为了捕捉这种语义影响。

2024 年,Apple 发表了一项有趣的研究,探讨了上述最后一点。当人们根据 ASR 是否可读来评估 9.4% 的 WER 时,他们给同一段文本评出了仅 2.2% 的 WER。在测试示例中,人们在很多情况下认为这些“错误”并不重要,因此人类 WER 比机器 WER 宽容超过 4 倍。

WER 的行业基准

理想 WER 很大程度取决于使用 ASR 技术的行业或用例。尽管低于 5% 是 WER 的行业基准,但医疗或法律转录等特定行业需要低得多的错误率。

Artificial Analysis于 2026 年 7 月开展的研究中,ElevenLabs 的 Scribe v2 取得了 1.5% 的 WER。不过,需要注意的是,这类统计通常以英语为主要语言开展,其他语言的 STT 技术可能没这么有效。

ElevenLabs 文档详细介绍了通用 WER 分级,涵盖 Scribe v1 和 Scribe v2 支持的所有语言。

使用 ElevenAPI 提升识别准确性

构建重视转录质量的应用或产品时,精心选择的 ASR API 与普通 API 之间的差距,首先会体现在 WER 上,随后体现在用户体验中。

ElevenLabs Scribe 是可通过文本转语音层访问的ElevenAPI。除了支持 90+ 种语言和行业领先的 WER,还提供说话人分离、词级时间戳、关键词提示和实体检测等功能。

查看ElevenLabs 文档,了解更多 ElevenAPI 信息,或立即注册开始使用。

词错误率常见问题

相关内容

用高质量 AI 音频创作