推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

什么是自动语音识别(ASR)?

发布时间
最近更新

收听收听本文

1952 年,世界上最先进的语音识别系统只能准确理解 9 个词。

约 75 年后,自动语音识别(ASR)已能实时转写数十种语言,支持从手机语音助手到直播视频自动字幕等各种应用。

本指南将介绍连接 1952 年技术与现代技术的关键发展,包括 ASR 是什么、如何将语音转为文本,以及它至今仍在如何演进。

摘要:

  • ASR 指自动语音识别,即将语音音频转换为书面文本的技术。
  • 最早的 ASR 出现在 1952 年,深度学习系统在 2010 年代末达到人类基准水平。
  • 现代 ASR 使用基于数百万小时音频训练的端到端神经网络。
  • 词错误率(WER)是标准准确率指标,但在生产级 ASR 中,延迟、说话人分离质量和上下文理解同样重要。
  • ElevenAPI 为开发者提供生产级 ASR,经Artificial Analysis独立评测,词错误率为 2.2%,在其指数中最低(2026 年 7 月)。

什么是自动语音识别(ASR)?

自动语音识别通常简称为 ASR,是指能够监听人类语音并将其转换为准确、机器可读文本的软件。它也常被称为文本转语音和语音识别,有时也称为计算机语音识别。

ASR 已无处不在,你每天都可能在不知不觉中使用它。无论是口述消息、向语音助手提问、观看直播时阅读字幕,还是通过交互式语音应答电话系统导航,都在使用 ASR。

文本转语音与 ASR 常被视为同义词(且密切相关),但两者并不完全相同。ASR 是识别说话内容的技术,STT 则是将该技术作为工具的实际应用。语音识别软件建立在 ASR 之上,用于识别某个词是谁说的,这是说话人分离功能的基础。

这些区别虽小,但如果你想将 ASR/STT/语音识别系统集成到应用或网站中,仍值得了解。

自动语音识别技术简史

自动语音识别技术的历史远比大多数人想象得久远,最早可追溯至 20 世纪 50 年代。自诞生以来的 70 多年间,ASR 经历了多个重要阶段,奠定了其持续进步的基础。

ASR 技术主要经历了以下几个时代:

  • 1952 年与首个 ASR:1952 年,贝尔实验室研发了名为AUDREY的自动数字识别器,用于识别从 1 到 9 的数字。该工具准确率仅约 90%,且只能由其发明者使用,局限性极大。尽管与如今的现代能力相去甚远,但仅能识别 1 至 9 在当时已是令人瞩目的成就。
  • 20 世纪 60 至 70 年代与不断扩大的 ASR 词汇量:随后几十年间,IBM、伦敦大学学院及日本 NEC 等全球实验室都在不同场景中开发出类似 AUDREY 的模型。斯坦福大学来自印度的研究生 Raj Reddy 为博士项目构建了元音识别器,为连续语音识别奠定基础,无需在每个词之间停顿。DARPA(美国国防高级研究计划局)在这一时期资助的研究催生了 Beam Search,这种句子构建和解码方法对识别词汇量的发展至关重要,到 1976 年已可识别超过 1,000 个词。
  • 20 世纪 80 年代至 2010 年代初的统计学进展:1987 年,Raj Reddy 的一名学生(当时已任教授)将隐马尔可夫模型与 Beam Search 结合,使 ASR 无需针对单一说话人训练。这一突破大幅缩短了语音识别系统的训练时间。Dragon Systems 在 1997 年发布首个商业化 ASR 产品 NaturallySpeaking Preferred。它每分钟可识别 100 个词,销售表现良好。
  • 现代时代与深度学习:2010 年代,研究人员证明,在音频和转录文本上端到端训练的单个神经网络,优于纯统计流水线。随着深度神经网络出现,ASR 的错误率可降至 5% 至 10%,达到接近人类的水平。Alexa、Siri 等语音助手也在这一时期进入市场。

自此,ASR 的准确率和普及度持续提升。截至 2026 年 7 月,Artificial Analysis 的独立研究认定 ElevenLabs Scribe v2 的词错误率(WER)仅为 2.2%,处于行业领先水平。

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

ASR 如何工作?文本转语音技术基础

ASR 首先采集音频样本,将其转换为数值表示,再利用训练好的模型预测这些数值最可能对应的词序列。现代 ASR 能在实时场景中完成这一流程,端到端处理时间不足 1 秒。

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

ASR 流水线主要包含 5 个阶段:

  1. 音频采集与预处理:系统录制音频信号、消除背景噪声、降低回声,并标准化音量以提升一致性。具体取决于模型,转录开始前还可能使用语音活动检测(VAD)来区分语音、静音和背景声。
  2. 特征提取:音频会转换为数值表示,通常是频谱图或梅尔频率特征,可精准呈现人类语音中的频率和模式。该步骤本质上是将原始波形转换为机器学习模型能高效处理的数据。
  3. 声学建模:神经网络分析上一步的特征,预测音素或其他语音单元,并学习声学模式与口语之间的关系。现代端到端模型通常将这一步与语言理解联合执行,而非作为完全独立的阶段。
  4. 语言建模与解码:系统根据语法、上下文和数学概率等规则,判断最可能的词序列。后两者尤为关键:两句话的 IPA(国际音标)转写可能相近,但上下文却截然不同。例如,“Recognize Speech”和“Wreck a nice peach”听起来可能相同,含义却完全不同。若仅凭精度无法确定,上下文将帮助系统做出正确判断。
  5. 输出格式化:确定语音内容后,系统会输出带有标点和大小写的最终转录文本。词级时间戳、说话人标签等额外元数据可生成更详细的转录稿。

通过这些主要阶段,模型将输入的音频数据转换为书面转录稿。

传统混合系统与端到端深度学习 ASR

上述流水线说明了 ASR 的工作方式,但其中的中间环节实际上可采用两种技术路线。

传统系统会串联多个组件:编码词语发音方式的词典模型、将音频映射为音素的声学模型,以及预测可能词序列的语言模型。每个组件都需要人工专业知识构建,从手工编写发音词典的语言学家,到将每个词与其音频精确位置对齐的标注人员。

端到端深度学习将所有这些组件整合为一个神经网络。该网络直接将音频映射为文本,并从数百万小时的配对音频和转录文本中隐式理解发音、声学和语言概率统计。

下面来看看传统与现代 ASR 技术方法之间的差异。

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

如何衡量 ASR 准确率:词错误率(WER)基准

在所有文本转语音和 ASR workflow 中,词错误率(WER)是企业使用的主要准确率指标。它将 ASR 生成的机器转录稿与人工验证版本进行比较,主要统计替换、删除和插入 3 类错误。

WER 的计算公式是用错误总数除以参考转录稿中的词数。WER 为 5% 表示系统可准确转录 95% 的文本;如今多数领先模型正将这一数值降至远低于 5%,不断接近完美。

WER 是实用的基准,但评估 ASR 工具效果时还应考虑其他因素:

  • 格式准确率:系统能否正确格式化非标准字符串?例如,$1,225 这样的金额会原样显示,还是拼写为“1,225 美元”?
  • 延迟:准确率固然重要,但若生成一份简单转录稿需要几分钟,工具就无法使用。即便准确率极高,也需要兼顾低延迟,才能提升实用性。
  • 鲁棒性:即使 在浓重口音或嘈杂背景等使用场景中,模型准确率也不应显著下降。
  • 说话人分离质量:多说话人场景依赖于将每个词正确归属给相应说话人。识别不同说话人并准确标记,有助于提升 ASR 效果,尤其适用于法律庭审等多说话人密集的行业。

了解更多,请阅读我们的词错误率完整指南。

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

ASR 为现代企业带来的主要优势

预计到 2030 年,全球语音和声音识别市场规模将超过231.1 亿美元。市场 19.1% 的复合年增长率反映出该技术在商业设备中的广泛普及。每部现代手机都配备听写键盘和语音助手,多数新车都能响应语音指令,智能音箱和助手也已进入世界各地的家庭。

通过语音与技术互动,如今已成为客户的默认选择。对企业而言,ASR 可用于客户通话转录、语音智能体辅助等场景,并能融入业务流程、提升生产力。

以下是 ASR 为现代企业带来的几项主要优势:

  • 更快输入与记录:早在 10 多年前,斯坦福大学发表的一篇论文就证明,语音识别技术比键盘输入快近 3 倍,同时错误率更低。对绝大多数人而言,ASR 可加快转录 workflow 中的文档记录和语音优先笔记记录。
  • 降低运营成本:在许多过去需要数小时人工记录的场景中,ASR 技术可大幅降低高质量转录的成本。如今,法庭案件、呼叫中心、医疗诊所和商务会议都可借助准确的 ASR 系统,生成详细笔记和完整的说话人分离对话转录稿。
  • 提升无障碍体验:世界卫生组织预测,到 2050 年,25 亿人将患有某种形式的听力损失。先进 ASR 工具提供的实时字幕可让数字会议和媒体更易于用户访问。
  • 可搜索的语音数据:使用 ASR 自动转录语音后,每一次客户与企业的互动都会被完整记录。每通销售电话、支持工单、潜在客户通话或会议都会变为可搜索、可审计的文本。尤其在 AI 时代,以机器可读格式呈现上下文有助于构建广泛的知识库。无论出于功能需求还是合规要求,这都有助于让信息保持可见。
  • 全天候客户体验:ASR 是语音智能体的基础技术之一,可支持自动化服务场景,解决客户来电,全年 24/7 不间断服务。

自动语音识别之所以在技术领域如此普及,源于其带来的诸多优势及广泛适用的场景。无论你从事医疗行业,还是希望转录客户通话以进行情感分析,ASR 都是一项会融入并使用的基础技术。

ASR 在各行业的常见应用

自动语音识别是无数 workflow 和产品的核心技术。它已普及到用户往往不会留意自己所用技术中嵌入了它的程度。

以下简要介绍 ASR 在全球的一些常见使用场景。

客户服务与呼叫中心

呼叫中心是较早采用 ASR 的领域之一,利用它转录通话以进行质量保证和合规管理。如今,ASR 可实时运行,在对话中向客服人员提供建议,并将数千次客户互动转化为团队可分析的数据。

媒体与娱乐

广播机构和流媒体平台可利用 ASR 生成对话字幕,其规模远超人工转录人员的能力。它支持实时转录,同时让视频和音频资料库完全可搜索。

医疗保健

临床人员每天有相当多的时间花在文档记录和病历填写上。ASR 可帮助节省这些时间,为医生提供可实时口述笔记的医疗 STT平台。

虚拟会议

会议平台通常提供某种形式的数字笔记功能,可在对话进行时完成转录,让每个人都无需在参与讨论和记录笔记之间取舍。Google Meet 等服务甚至会在每次会议后发送标注行动项的转录稿,帮助创建可搜索的信息索引。

法律与合规

在法律场景中,准确记录说了什么以及谁说的是法庭的核心要求。律师事务所会使用 ASR 平台转录会议、听证会、客户通话和庭审,并提供精确时间戳以供日后查阅。

教育

大学教授可提供讲座录音的转录稿,帮助学生建立所修课程的记录。在理解和记忆信息时,学生可借助这类全面资源开始学习。

ASR 在语音智能体流水线中的位置

ASR 是多种技术部署的标准组成部分。在语音智能体技术中,它是持续循环的 3 个主要阶段中的第一个。

  • 听(ASR):智能体采集传入的音频流并实时将语音转为文本。现代 ASR 会在音频到达时持续处理,过滤背景噪声、处理打断、生成部分转录稿,并识别每个人何时发言。
  • 思考(语言模型):大语言模型解读转录稿,理解用户意图,从连接的工具和知识库中检索信息,维护对话上下文,并确定最合适的回复或操作。
  • 说(文本转语音):一个文本转语音模型将生成的 LLM 回复转换为自然、富有表现力的音频。现代 TTS 系统可在生成音频并将其流式传回给来电者时,调整语速、语调、情绪和重音,无需等待完整回复生成。

对话延迟会在每个阶段累积。为降低延迟,流式 ASR 会在词语说出后立即开始输出,而非等到一句话结束。ElevenAgents将此作为实时语音智能体的标准,帮助打造高效的智能体体验。

ASR 的挑战与技术演进

尽管 ASR 技术自 1952 年诞生以来已取得长足进步,仍有多种挑战可能降低其准确率。

以下是 ASR 工具如今仍会遇到的一些问题:

  • 口音与方言:现有训练数据通常集中于少数语言和口音,因此较少见的口音或使用人数较少的语言,对 ASR 工具而言更具挑战。丰富且多样的训练数据集是解决之道。
  • 背景噪声与说话人重叠:音量变化大或背景噪声较强的环境,会使录音中的单个词更难识别。说话人重叠也可能造成类似影响,降低 ASR 转录准确率。
  • 领域专用词汇:包含特定术语或缩略词的领域,需要领域级词典和参考资料来提升准确率。医疗和法律是 ASR 工具需获得额外支持或接受专项训练的两个领域。
  • 隐私与安全:在许多司法辖区,语音数据属于个人数据。企业需要制定明确的保留政策和防护措施,以保护语音数据处理过程,并确保遵守更广泛的法规。

使用 ASR 技术时,还需更全面地考虑延迟与准确率之间的关系。部分场景需要平衡两者,而医疗等领域通常会将准确率置于首位。

使用 ElevenAPI 开始生产级 ASR 集成

ElevenAPI通过 ElevenLabs 文本转语音模型 Scribe v2,为产品提供生产级自动语音识别。Scribe v2 提供词级时间戳、说话人分离、音频事件标记,以及实时应用所需的准确率和可靠性。

浏览ElevenLabs 文本转语音页面了解更多,或创建免费账户,几分钟内即可启动 API。

ASR 常见问题

相关内容

用高质量 AI 音频创作