什么是自动语音识别(ASR)?
- 发布时间
- 最近更新
1952 年,全球最先进的语音识别系统只能识别 9 个词。
约 75 年后,自动语音识别(ASR)已能实时转录数十种语言,支持从手机语音助手到直播视频字幕等各种功能。
本文将介绍推动 ASR 从 1952 年发展至今的技术:它是什么、如何将语音转为文本,以及至今仍在如何演进。
摘要:
- ASR 即自动语音识别,是将口语音频转换为书面文本的技术。
- 最早的 ASR 出现于 1952 年,深度学习系统在 2010 年代末达到人类基准水平。
- 现代 ASR 使用基于数百万小时音频训练的端到端神经网络。
- 词错误率(WER)是标准准确率指标,但延迟、说话人分离质量和上下文理解也会影响生产级 ASR。
- ElevenAPI 为开发者提供生产级 ASR。根据 Artificial Analysis 的独立评测,其词错误率仅为 2.2%,位列其指数最低(2026 年 7 月)。
什么是自动语音识别(ASR)?
自动语音识别通常简称 ASR,指能够监听人类语音并将其转为准确、机器可读文本的软件。它也常被称为 语音转文本、语音识别,有时也称计算机语音识别。
ASR 已无处不在,你可能每天都在使用却未曾察觉。无论是口述消息、向语音助手提问、观看直播字幕,还是通过 交互式语音应答电话 系统导航,都在使用 ASR。
语音转文本和 ASR 虽常被视为同义词(且密切相关),但并不完全相同。ASR 是识别说话内容的底层技术,而 STT 是将这项技术作为工具的应用。语音识别软件则构建在 ASR 之上,用于识别某个词是谁说的,这是 说话人分离 功能的基础。
这些区别虽小,但如果要将 ASR/STT/语音识别系统集成到应用或网站中,仍值得了解。
自动语音识别技术简史
自动语音识别技术比许多人想象得更早,最初的版本可追溯到 20 世纪 50 年代。诞生以来的 70 多年间,ASR 经历了多个重要阶段,奠定了持续进步的基础。
以下是 ASR 技术发展的主要阶段:
- 1952 年与首个 ASR:1952 年,贝尔实验室开发了自动数字识别器 AUDREY,用于识别 1 到 9 的数字。该工具准确率仅约 90%,而且只有发明者本人使用时才有效,局限性极大。尽管与如今的能力相去甚远,仅能识别 1 到 9 在当时已是一项了不起的成就。
- 20 世纪 60 至 70 年代与不断扩展的 ASR 词汇量:随后的数十年中,IBM、伦敦大学学院和日本 NEC 等全球实验室,在不同场景中开发出了与 AUDREY 类似的模型。斯坦福大学印度研究生 Raj Reddy 为博士项目构建了元音识别器,为连续语音识别奠定基础,不再需要在每个词之间停顿。DARPA(美国国防高级研究计划局)在这一时期资助的研究促成了 Beam Search——一种句子构建与解码方法,到 1976 年已成为识别超过 1,000 个词的关键技术。
- 20 世纪 80 年代至 2010 年代初的统计学进展:1987 年,Raj Reddy 的一位学生(当时已任教授)将隐马尔可夫模型与 Beam Search 相结合,令 ASR 无需针对单一说话人训练。这一突破大幅缩短了语音识别系统的训练时间。Dragon Systems 于 1997 年发布首款商用 ASR——NaturallySpeaking Preferred。它每分钟可识别 100 个词,销售表现良好。
- 现代与深度学习时代:2010 年代,研究人员证明,单个端到端音频与转录文本训练的神经网络优于纯统计流水线。随着深度神经网络问世,ASR 的错误率可降至 5% 到 10%,接近人类水平。Alexa、Siri 等语音助手也在这一时期进入市场。
此后,ASR 的准确率和普及度持续提高。截至 2026 年 7 月,Artificial Analysis 的独立研究 显示,ElevenLabs Scribe v2 的词错误率(WER)仅为 2.2%,处于行业领先水平。

ASR 如何工作?语音转文本技术基础
ASR 会捕获音频样本,将其转换为数值表示,再使用训练好的模型预测这些数值最可能对应的词序列。现代 ASR 可在实时场景中运行,不到 1 秒即可完成整个端到端流程。

ASR 流水线主要分为 5 个阶段:
- 音频采集与预处理:系统录制音频信号,去除背景噪声、减少回声并统一音量,以提高一致性。根据具体模型,转录开始前还可能使用语音活动检测(VAD)区分语音、静音和背景声。
- 特征提取:音频会转换为数值表示,通常是频谱图或梅尔频率特征,可精确突出人类语音的频率和模式。这一步本质上是将原始波形转为机器学习模型可高效处理的数据。
- 声学建模:神经网络分析上一步的特征,预测音素或其他语音单元,学习声学模式与口语之间的关系。现代端到端模型通常会将这一步与语言理解结合,而不是将其作为独立阶段。
- 语言建模与解码:系统根据语法、上下文和数学概率等规则,评估最可能的词序列。后两项尤为关键:两句话的 IPA(国际音标)转写可能相似,但语境完全不同。例如,“Recognize Speech”和“Wreck a nice peach”听起来可能相同,含义却截然不同。当准确度无法确定时,上下文能帮助系统判断正确答案。
- 输出格式化:确定语音内容后,系统生成带标点和大小写的最终转录文本。词级时间戳和说话人标签等额外元数据,可生成更详细的转录稿。
模型通过这些主要阶段,将输入的音频数据转换为书面转录稿。
传统混合系统与端到端深度学习 ASR
上述流水线说明了 ASR 的工作原理,但其中的中间环节实际上可采用两种技术路线。
传统系统串联多个组件:编码单词发音的词典模型、将音频映射到音素的声学模型,以及预测可能词序列的语言模型。每个组件都需要人工专业知识,从手工编写发音词典的语言学家,到将每个词与音频精确位置对齐的标注人员。
端到端深度学习将所有组件整合为单一神经网络。该网络直接将音频映射为文本,并从数百万小时配对音频和转录稿中隐式学习发音、声学特征和语言概率统计。
下面来看看传统和现代 ASR 技术方法的区别。
如何衡量 ASR 准确率:词错误率(WER)基准
在所有语音转文本和 ASR workflow 中,词错误率(WER)是企业采用的主要准确率指标。它比较 ASR 生成的机器转录稿与人工验证版本,主要统计替换、删除和插入 3 类错误。
WER 的计算公式是用总错误数除以参考转录稿中的词数。WER 为 5% 意味着系统能准确转录 95% 的文本;如今多数领先模型正远低于 5%,不断接近完美。
WER 是很有用的基准,但评估 ASR 工具效果时还应考虑其他因素:
- 格式准确性:系统能否正确格式化非标准字符串?例如,金额 $1,225 是按原样显示,还是写成“1,225 美元”?
- 延迟:准确率固然重要,但若生成一份简单转录稿都要几分钟,工具就无法使用。即使准确率极高,也需兼顾低延迟以提升实用性。
- 鲁棒性:即使在 浓重口音或嘈杂背景等场景中,模型准确率也不应显著下降。
- 说话人分离质量:多说话人场景依赖于将每个词正确归属到对应说话人。识别不同说话人并正确标记,对 ASR 至关重要,尤其适用于法庭等多说话人密集的行业。
如需了解更多,请阅读我们的 词错误率 完整指南。

ASR 为现代企业带来的主要优势
全球语音和声音识别市场预计将在 2030 年达到逾 $231.1 亿。市场 19.1% 的复合年增长率反映出该技术在商用设备中的广泛普及。每部现代手机都配备听写键盘和语音助手,大多数新车支持语音指令,智能音箱和助手也已走入全球家庭。
通过语音与技术交互,如今已成为客户的常规选择。对企业而言,ASR 可用于客户通话转录、语音智能体辅助等,并融入流程、提升生产力。
以下是 ASR 为现代企业带来的几项主要优势:
- 更快的输入与文档记录:早在 10 多年前,斯坦福发表的一篇论文 就表明,语音识别技术的速度几乎是键盘输入的 3 倍,且错误率更低。对绝大多数人而言,ASR 能加快转录 workflow 中的文档记录和语音优先笔记。
- 降低运营成本:在许多过去需耗费数小时手动记笔记的场景中,ASR 可大幅降低高质量转录成本。法庭案件、呼叫中心、医疗诊所和商务会议如今均可借助准确的 ASR 系统,生成详细笔记和完整的说话人分离对话转录稿。
- 提高无障碍性:世界卫生组织预测,到 2050 年,25 亿人 将存在某种形式的听力损失。先进 ASR 工具提供的实时字幕,可让数字会议和媒体 更易被用户使用。
- 可搜索的语音数据:使用 ASR 自动转录语音后,每一次客户与企业的互动都会完整留档。每通销售电话、支持工单、潜在客户通话或会议都会成为可搜索、可审计的文本。尤其在 AI 时代,以机器可读格式提取上下文有助于构建丰富的知识库。无论出于功能还是合规需求,这都能让信息保持可见。
- 全天候客户体验:ASR 是 语音智能体 的基础技术之一,可支持自动化服务场景,处理客户来电,全年 24 小时不间断。
自动语音识别之所以在技术领域如此普及,是因为它带来诸多优势,并支持广泛的使用场景。无论在医疗领域,还是要转录客户通话以进行情感分析,ASR 都是会用到的基础技术。
ASR 在各行业的热门应用
自动语音识别是无数 workflow 和产品的核心技术。它已如此普及,用户往往不会意识到它如何融入自己使用的技术中。
以下简要介绍全球范围内 ASR 的一些热门应用场景。
客户服务与呼叫中心
呼叫中心是 ASR 的早期采用者,利用它转录通话以进行质量保证和合规管理。如今,ASR 可实时运行,在对话中向客服人员提供建议,并将数千次客户互动转化为团队可分析的数据。
媒体与娱乐
广播机构和流媒体平台可使用 ASR 生成对话字幕,其规模远超人工转录员所能实现。它支持实时转录,也让视频和音频库完全可搜索。
医疗
临床人员每天会花费大量时间撰写文档和病历。ASR 能节省这些时间,为医生提供可实时口述笔记的 医疗 STT 平台。
虚拟会议
会议平台通常提供某种数字笔记功能,可在对话进行时同步转录,无需在参与会议和记笔记之间取舍。Google Meet 等服务还会在会后发送标注行动项的转录稿,帮助构建可搜索的信息索引。
法律与合规
在法律场景中,准确记录说了什么、由谁所说是法庭的核心要求。律师事务所 会利用 ASR 平台转录会议、听证会、客户通话和庭审,并附上精确时间戳以供日后查阅。
教育
大学教授可提供讲座录音的转录稿,帮助学生建立所学课程的记录。在理解和记忆信息时,学生可从这份完整资源开始学习。
ASR 在语音智能体流水线中的位置
ASR 是多种技术部署的标准组成部分。在语音智能体技术中,它是持续循环的 3 个主要阶段中的第一个。
- 听(ASR):智能体捕获输入音频流,并实时将语音转为文本。现代 ASR 会持续处理到达的音频,过滤背景噪声、处理打断、生成部分转录稿,并识别每个人何时说话。
- 思考(语言模型):大语言模型解读转录文本,理解用户意图,从已连接的工具和知识库检索信息,维持对话上下文,并决定最合适的回复或行动。
- 说(文本转语音):文本转语音 模型将生成的 LLM 回复转换为自然且富有表现力的音频。现代 TTS 系统可在音频生成时流式回传给来电者,并调整语速、语调、情感和重音,无需等待完整回复生成。
对话延迟 会在每个阶段累积。流式 ASR 会在说出词语后立即开始输出,而非等待整句话结束,以降低延迟。ElevenAgents 将此作为实时语音智能体的标准,打造高效的智能体体验。
ASR 面临的挑战及技术演进
尽管 ASR 自 1952 年诞生以来已取得长足进步,仍存在多种可能降低准确率的挑战。
以下是 ASR 工具目前仍会遇到的一些问题:
- 口音与方言:可用训练数据通常集中于少数语言和口音,因此较少见的口音或使用人数较少的语言,对 ASR 工具更具挑战。解决方案是使用丰富、多样的训练数据集。
- 背景噪声与说话人重叠:音量变化大或背景噪声很强的环境,会使录音中的单个词更难辨识。多人同时说话也会产生类似影响,降低 ASR 转录准确率。
- 领域专用词汇:包含专业术语或缩写的领域,需要领域级词典和参考资料来提高准确率。医疗和法律是 ASR 工具需要额外支持或专门训练的两个领域。
- 隐私与安全:在许多司法辖区,语音数据被视为个人数据。企业需制定明确的保留政策和防护措施,以保护语音数据处理过程,并确保符合更广泛的法规要求。
使用 ASR 技术时,还需考虑延迟与准确率之间的平衡。某些场景需要兼顾两者,而医疗等领域通常会将准确率置于首位。
使用 ElevenAPI 开始集成生产级 ASR
ElevenAPI 通过 ElevenLabs 文本转语音模型 Scribe v2,为产品提供生产级自动语音识别。Scribe v2 提供词级时间戳、说话人分离、音频事件标记,以及实时应用所需的准确性和可靠性。
访问 ElevenLabs 文本转语音 页面了解更多,或 创建免费账户,几分钟即可启动 API。




