跳至内容

什么是自动语音识别(ASR)?

发布时间
最近更新

收听收听本文

1952 年,全球最先进的语音识别系统只能识别 9 个词。

约 75 年后,自动语音识别(ASR)已能实时转录数十种语言,支持从手机语音助手到直播视频字幕等各种功能。

本文将介绍推动 ASR 从 1952 年发展至今的技术:它是什么、如何将语音转为文本,以及至今仍在如何演进。

摘要:

  • ASR 即自动语音识别,是将口语音频转换为书面文本的技术。
  • 最早的 ASR 出现于 1952 年,深度学习系统在 2010 年代末达到人类基准水平。
  • 现代 ASR 使用基于数百万小时音频训练的端到端神经网络。
  • 词错误率(WER)是标准准确率指标,但延迟、说话人分离质量和上下文理解也会影响生产级 ASR。
  • ElevenAPI 为开发者提供生产级 ASR。根据 Artificial Analysis 的独立评测,其词错误率仅为 2.2%,位列其指数最低(2026 年 7 月)。

什么是自动语音识别(ASR)?

自动语音识别通常简称 ASR,指能够监听人类语音并将其转为准确、机器可读文本的软件。它也常被称为 语音转文本、语音识别,有时也称计算机语音识别。

ASR 已无处不在,你可能每天都在使用却未曾察觉。无论是口述消息、向语音助手提问、观看直播字幕,还是通过 交互式语音应答电话 系统导航,都在使用 ASR。

语音转文本和 ASR 虽常被视为同义词(且密切相关),但并不完全相同。ASR 是识别说话内容的底层技术,而 STT 是将这项技术作为工具的应用。语音识别软件则构建在 ASR 之上,用于识别某个词是谁说的,这是 说话人分离 功能的基础。

这些区别虽小,但如果要将 ASR/STT/语音识别系统集成到应用或网站中,仍值得了解。

自动语音识别技术简史

自动语音识别技术比许多人想象得更早,最初的版本可追溯到 20 世纪 50 年代。诞生以来的 70 多年间,ASR 经历了多个重要阶段,奠定了持续进步的基础。

以下是 ASR 技术发展的主要阶段:

  • 1952 年与首个 ASR:1952 年,贝尔实验室开发了自动数字识别器 AUDREY,用于识别 1 到 9 的数字。该工具准确率仅约 90%,而且只有发明者本人使用时才有效,局限性极大。尽管与如今的能力相去甚远,仅能识别 1 到 9 在当时已是一项了不起的成就。
  • 20 世纪 60 至 70 年代与不断扩展的 ASR 词汇量:随后的数十年中,IBM、伦敦大学学院和日本 NEC 等全球实验室,在不同场景中开发出了与 AUDREY 类似的模型。斯坦福大学印度研究生 Raj Reddy 为博士项目构建了元音识别器,为连续语音识别奠定基础,不再需要在每个词之间停顿。DARPA(美国国防高级研究计划局)在这一时期资助的研究促成了 Beam Search——一种句子构建与解码方法,到 1976 年已成为识别超过 1,000 个词的关键技术。
  • 20 世纪 80 年代至 2010 年代初的统计学进展:1987 年,Raj Reddy 的一位学生(当时已任教授)将隐马尔可夫模型与 Beam Search 相结合,令 ASR 无需针对单一说话人训练。这一突破大幅缩短了语音识别系统的训练时间。Dragon Systems 于 1997 年发布首款商用 ASR——NaturallySpeaking Preferred。它每分钟可识别 100 个词,销售表现良好。
  • 现代与深度学习时代:2010 年代,研究人员证明,单个端到端音频与转录文本训练的神经网络优于纯统计流水线。随着深度神经网络问世,ASR 的错误率可降至 5% 到 10%,接近人类水平。Alexa、Siri 等语音助手也在这一时期进入市场。

此后,ASR 的准确率和普及度持续提高。截至 2026 年 7 月,Artificial Analysis 的独立研究 显示,ElevenLabs Scribe v2 的词错误率(WER)仅为 2.2%,处于行业领先水平。

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

ASR 如何工作?语音转文本技术基础

ASR 会捕获音频样本,将其转换为数值表示,再使用训练好的模型预测这些数值最可能对应的词序列。现代 ASR 可在实时场景中运行,不到 1 秒即可完成整个端到端流程。

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

ASR 流水线主要分为 5 个阶段:

  1. 音频采集与预处理:系统录制音频信号,去除背景噪声、减少回声并统一音量,以提高一致性。根据具体模型,转录开始前还可能使用语音活动检测(VAD)区分语音、静音和背景声。
  2. 特征提取:音频会转换为数值表示,通常是频谱图或梅尔频率特征,可精确突出人类语音的频率和模式。这一步本质上是将原始波形转为机器学习模型可高效处理的数据。
  3. 声学建模:神经网络分析上一步的特征,预测音素或其他语音单元,学习声学模式与口语之间的关系。现代端到端模型通常会将这一步与语言理解结合,而不是将其作为独立阶段。
  4. 语言建模与解码:系统根据语法、上下文和数学概率等规则,评估最可能的词序列。后两项尤为关键:两句话的 IPA(国际音标)转写可能相似,但语境完全不同。例如,“Recognize Speech”和“Wreck a nice peach”听起来可能相同,含义却截然不同。当准确度无法确定时,上下文能帮助系统判断正确答案。
  5. 输出格式化:确定语音内容后,系统生成带标点和大小写的最终转录文本。词级时间戳和说话人标签等额外元数据,可生成更详细的转录稿。

模型通过这些主要阶段,将输入的音频数据转换为书面转录稿。

传统混合系统与端到端深度学习 ASR

上述流水线说明了 ASR 的工作原理,但其中的中间环节实际上可采用两种技术路线。

传统系统串联多个组件:编码单词发音的词典模型、将音频映射到音素的声学模型,以及预测可能词序列的语言模型。每个组件都需要人工专业知识,从手工编写发音词典的语言学家,到将每个词与音频精确位置对齐的标注人员。

端到端深度学习将所有组件整合为单一神经网络。该网络直接将音频映射为文本,并从数百万小时配对音频和转录稿中隐式学习发音、声学特征和语言概率统计。

下面来看看传统和现代 ASR 技术方法的区别。

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

如何衡量 ASR 准确率:词错误率(WER)基准

在所有语音转文本和 ASR workflow 中,词错误率(WER)是企业采用的主要准确率指标。它比较 ASR 生成的机器转录稿与人工验证版本,主要统计替换、删除和插入 3 类错误。

WER 的计算公式是用总错误数除以参考转录稿中的词数。WER 为 5% 意味着系统能准确转录 95% 的文本;如今多数领先模型正远低于 5%,不断接近完美。

WER 是很有用的基准,但评估 ASR 工具效果时还应考虑其他因素:

  • 格式准确性:系统能否正确格式化非标准字符串?例如,金额 $1,225 是按原样显示,还是写成“1,225 美元”?
  • 延迟:准确率固然重要,但若生成一份简单转录稿都要几分钟,工具就无法使用。即使准确率极高,也需兼顾低延迟以提升实用性。
  • 鲁棒性:即使在 浓重口音或嘈杂背景等场景中,模型准确率也不应显著下降。
  • 说话人分离质量:多说话人场景依赖于将每个词正确归属到对应说话人。识别不同说话人并正确标记,对 ASR 至关重要,尤其适用于法庭等多说话人密集的行业。

如需了解更多,请阅读我们的 词错误率 完整指南。

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

ASR 为现代企业带来的主要优势

全球语音和声音识别市场预计将在 2030 年达到逾 $231.1 亿。市场 19.1% 的复合年增长率反映出该技术在商用设备中的广泛普及。每部现代手机都配备听写键盘和语音助手,大多数新车支持语音指令,智能音箱和助手也已走入全球家庭。

通过语音与技术交互,如今已成为客户的常规选择。对企业而言,ASR 可用于客户通话转录、语音智能体辅助等,并融入流程、提升生产力。

以下是 ASR 为现代企业带来的几项主要优势:

  • 更快的输入与文档记录:早在 10 多年前,斯坦福发表的一篇论文 就表明,语音识别技术的速度几乎是键盘输入的 3 倍,且错误率更低。对绝大多数人而言,ASR 能加快转录 workflow 中的文档记录和语音优先笔记。
  • 降低运营成本:在许多过去需耗费数小时手动记笔记的场景中,ASR 可大幅降低高质量转录成本。法庭案件、呼叫中心、医疗诊所和商务会议如今均可借助准确的 ASR 系统,生成详细笔记和完整的说话人分离对话转录稿。
  • 提高无障碍性:世界卫生组织预测,到 2050 年,25 亿人 将存在某种形式的听力损失。先进 ASR 工具提供的实时字幕,可让数字会议和媒体 更易被用户使用
  • 可搜索的语音数据:使用 ASR 自动转录语音后,每一次客户与企业的互动都会完整留档。每通销售电话、支持工单、潜在客户通话或会议都会成为可搜索、可审计的文本。尤其在 AI 时代,以机器可读格式提取上下文有助于构建丰富的知识库。无论出于功能还是合规需求,这都能让信息保持可见。
  • 全天候客户体验:ASR 是 语音智能体 的基础技术之一,可支持自动化服务场景,处理客户来电,全年 24 小时不间断。

自动语音识别之所以在技术领域如此普及,是因为它带来诸多优势,并支持广泛的使用场景。无论在医疗领域,还是要转录客户通话以进行情感分析,ASR 都是会用到的基础技术。

ASR 在各行业的热门应用

自动语音识别是无数 workflow 和产品的核心技术。它已如此普及,用户往往不会意识到它如何融入自己使用的技术中。

以下简要介绍全球范围内 ASR 的一些热门应用场景。

客户服务与呼叫中心

呼叫中心是 ASR 的早期采用者,利用它转录通话以进行质量保证和合规管理。如今,ASR 可实时运行,在对话中向客服人员提供建议,并将数千次客户互动转化为团队可分析的数据。

媒体与娱乐

广播机构和流媒体平台可使用 ASR 生成对话字幕,其规模远超人工转录员所能实现。它支持实时转录,也让视频和音频库完全可搜索。

医疗

临床人员每天会花费大量时间撰写文档和病历。ASR 能节省这些时间,为医生提供可实时口述笔记的 医疗 STT 平台。

虚拟会议

会议平台通常提供某种数字笔记功能,可在对话进行时同步转录,无需在参与会议和记笔记之间取舍。Google Meet 等服务还会在会后发送标注行动项的转录稿,帮助构建可搜索的信息索引。

法律与合规

在法律场景中,准确记录说了什么、由谁所说是法庭的核心要求。律师事务所 会利用 ASR 平台转录会议、听证会、客户通话和庭审,并附上精确时间戳以供日后查阅。

教育

大学教授可提供讲座录音的转录稿,帮助学生建立所学课程的记录。在理解和记忆信息时,学生可从这份完整资源开始学习。

ASR 在语音智能体流水线中的位置

ASR 是多种技术部署的标准组成部分。在语音智能体技术中,它是持续循环的 3 个主要阶段中的第一个。

  • 听(ASR):智能体捕获输入音频流,并实时将语音转为文本。现代 ASR 会持续处理到达的音频,过滤背景噪声、处理打断、生成部分转录稿,并识别每个人何时说话。
  • 思考(语言模型):大语言模型解读转录文本,理解用户意图,从已连接的工具和知识库检索信息,维持对话上下文,并决定最合适的回复或行动。
  • 说(文本转语音):文本转语音 模型将生成的 LLM 回复转换为自然且富有表现力的音频。现代 TTS 系统可在音频生成时流式回传给来电者,并调整语速、语调、情感和重音,无需等待完整回复生成。

对话延迟 会在每个阶段累积。流式 ASR 会在说出词语后立即开始输出,而非等待整句话结束,以降低延迟。ElevenAgents 将此作为实时语音智能体的标准,打造高效的智能体体验。

ASR 面临的挑战及技术演进

尽管 ASR 自 1952 年诞生以来已取得长足进步,仍存在多种可能降低准确率的挑战。

以下是 ASR 工具目前仍会遇到的一些问题:

  • 口音与方言:可用训练数据通常集中于少数语言和口音,因此较少见的口音或使用人数较少的语言,对 ASR 工具更具挑战。解决方案是使用丰富、多样的训练数据集。
  • 背景噪声与说话人重叠:音量变化大或背景噪声很强的环境,会使录音中的单个词更难辨识。多人同时说话也会产生类似影响,降低 ASR 转录准确率。
  • 领域专用词汇:包含专业术语或缩写的领域,需要领域级词典和参考资料来提高准确率。医疗和法律是 ASR 工具需要额外支持或专门训练的两个领域。
  • 隐私与安全:在许多司法辖区,语音数据被视为个人数据。企业需制定明确的保留政策和防护措施,以保护语音数据处理过程,并确保符合更广泛的法规要求。

使用 ASR 技术时,还需考虑延迟与准确率之间的平衡。某些场景需要兼顾两者,而医疗等领域通常会将准确率置于首位。

使用 ElevenAPI 开始集成生产级 ASR

ElevenAPI 通过 ElevenLabs 文本转语音模型 Scribe v2,为产品提供生产级自动语音识别。Scribe v2 提供词级时间戳、说话人分离、音频事件标记,以及实时应用所需的准确性和可靠性。

访问 ElevenLabs 文本转语音 页面了解更多,或 创建免费账户,几分钟即可启动 API。

ASR 常见问题

相关内容

用高质量 AI 音频创作