什么是 ASR?自动语音识别如何工作?
- 发布时间
1952 年,全球最先进的语音识别系统只能识别 9 个单词。
时隔约 75 年,自动语音识别(ASR)已能实时转录数十种语言,广泛应用于手机语音助手、直播视频字幕等场景。
本指南将介绍连接 1952 年与现代 ASR 的技术,包括 ASR 的定义、语音转文本的原理,以及 ASR 仍在不断发展的现状。
摘要:
- ASR 指自动语音识别技术,可将语音音频转为文本。
- 最早的 ASR 诞生于 1952 年,深度学习系统在 2010 年代末已接近人类水平。
- 现代 ASR 采用端到端神经网络,基于数百万小时音频训练。
- 词错误率(WER)是衡量准确率的标准指标,但延迟、说话人分离质量和上下文理解等因素也影响实际应用效果。
- ElevenAPI 为开发者提供生产级 ASR,独立评测来自 Artificial Analysis,词错误率仅为 2.2%,为该榜单最低(2026 年 7 月)。
ASR 是什么?自动语音识别的定义
自动语音识别,通常简称 ASR,是指能“听懂”人类语音并将其转为准确、可读文本的软件。它也常被称为 语音转文本 或语音识别,有时也叫计算机语音识别。
ASR 已经非常普及,很多人每天都在使用却未必察觉。每次语音输入、向语音助手提问、观看直播字幕,或通过 交互式语音应答电话 系统操作时,实际上都在与 ASR 互动。
虽然语音转文本和 ASR 常被视为同义词(且密切相关),但两者并不完全相同。ASR 是识别内容的底层技术,STT 则是该技术的具体应用。语音识别软件还可进一步识别说话人,为说话人分离等功能提供基础。
这些区别虽小,但如果你打算将 ASR、STT 或语音识别集成到应用或网站中,了解这些差异很有必要。
自动语音识别技术简史
自动语音识别技术比大多数人想象的要早,最早可追溯到 20 世纪 50 年代。70 多年来,ASR 经过多个重要阶段,这些阶段为其发展奠定了基础。
以下是 ASR 技术发展的主要阶段:
- 1952 年,首个 ASR:1952 年,Bell 实验室开发了自动数字识别器 AUDREY,可识别 1 到 9 的数字。该工具准确率约 90%,且只能由发明者本人使用,应用极为有限。虽然与现代技术相差甚远,但能识别 1-9 已属当时的技术突破。
- 1960-70 年代,ASR 词汇量增长:此后几十年,全球多家实验室(如 IBM、伦敦大学学院、日本 NEC)都开发了类似 AUDREY 的模型。印度斯坦福博士生 Raj Reddy 开发了元音识别器,为连续语音识别奠定基础,无需每个词之间停顿。DARPA 资助的研究推动了 Beam Search(束搜索)方法的诞生,到 1976 年已能识别 1000 多个单词。
- 1980 年代至 2010 年初,统计方法进步:1987 年,Raj Reddy 的一位研究生(后为教授)将隐马尔可夫模型与束搜索结合,实现了无需针对单一说话人训练的 ASR,大幅缩短了训练时间。Dragon Systems 于 1997 年发布首个商用 ASR——NaturallySpeaking Preferred,每分钟可识别 100 个单词,市场表现良好。
- 现代阶段与深度学习:2010 年代,研究人员证明端到端神经网络(直接用音频和文本训练)优于纯统计方法。深度神经网络让 ASR 错误率降至 5%-10%,接近人类水平。此时,Alexa、Siri 等语音助手也进入市场。
此后,ASR 越来越准确,应用也更广泛。截至 2026 年 7 月,Artificial Analysis 的独立研究将 ElevenLabs Scribe v2 评为行业领先,词错误率(WER)仅 2.2%。

ASR 如何工作?语音转文本技术基础
ASR 通过采集音频样本,将其转为数值表示,再用训练好的模型预测最可能的词序列。现代 ASR 可实时完成整个流程,通常不到 1 秒。

ASR 流程主要分为五个阶段:
- 音频采集与预处理:系统录制音频信号,去除背景噪音、降低回声、统一音量,以提升一致性。部分模型还会用语音活动检测(VAD)区分语音与静音或背景声,随后开始转录。
- 特征提取:音频被转为数值表示,通常为声谱图或梅尔频率特征,突出语音中的频率和模式。这一步将原始波形转为机器学习模型可处理的数据。
- 声学建模:神经网络分析上一步的特征,预测音素或其他语音单元,学习声学模式与语言的关系。现代端到端模型常将此步骤与语言理解结合处理,而非完全独立。
- 语言建模与解码:系统根据语法、上下文和概率等规则,判断最可能的词序列。后两者尤为关键,因为两句话的音标可能相似,但语境完全不同。例如,“Recognize Speech”和“Wreck a nice peach”听起来相似,但含义完全不同。上下文有助于系统做出正确判断。
- 输出格式化:确定语音内容后,最终文本会带有标点和大小写输出。还可包含词级时间戳、说话人标签等元数据,生成更详细的转录结果。
整个流程中,模型将音频数据转为文本。
传统混合系统 vs. 端到端深度学习 ASR
上述流程描述了 ASR 的基本原理,但中间部分其实有两种技术路径可选。
传统系统由多个组件串联:词典模型(编码发音)、声学模型(音频到音素)、语言模型(预测词序列)。每个组件都需专家参与,如语言学家手工制作发音词典、标注员对齐每个词与音频位置。
端到端深度学习将所有组件整合为一个神经网络,直接将音频映射为文本,通过数百万小时的音频与文本对学习发音、声学和语言概率。
下面简单对比传统与现代 ASR 技术的区别。
ASR 准确率如何衡量:词错误率(WER)标准
在所有语音转文本和 ASR 场景中,词错误率(WER)是主要的准确率指标。它将 ASR 生成的转录与人工校对版本对比,主要包括替换、删除和插入三类错误。
WER 计算公式为总错误数除以参考文本的总词数。5% 的 WER 意味着系统能准确转录 95% 的文本,领先模型的 WER 已远低于 5%。
虽然 WER 很重要,但评估 ASR 工具时还应考虑其他因素:
- 格式化准确率:系统能否正确格式化非常规字符串?比如金额 $1,225 是否能直接显示,而不是转为“one thousand two hundred twenty-five dollars”?
- 延迟:准确率虽重要,但如果生成转录需几分钟,工具就失去实用性。即使很准,也需兼顾低延迟。
- 鲁棒性:即使遇到 重口音或嘈杂环境等情况,也不应显著降低模型准确率。
- 说话人分离质量:多说话人场景需准确区分每个词的说话人。能正确识别和标记不同说话人对 ASR 尤为重要,尤其在法庭等多说话人行业。
了解更多,请阅读我们的 词错误率.

ASR 为现代企业带来的主要价值
全球语音识别市场预计到 2030 年将超 231.1 亿美元。19.1% 的年复合增长率反映了该技术在商用设备中的普及。每部现代手机都配有语音输入和语音助手,大多数新车支持语音指令,智能音箱和助手已进入全球家庭。
语音交互已成为用户与技术互动的主流方式。对企业来说,ASR 可用于客户通话转录、语音助手等场景,提升流程效率。
以下是 ASR 为现代企业带来的主要优势:
- 输入与文档更快:早在 10 多年前,斯坦福大学发表论文,证明语音识别技术比键盘输入快近三倍,且错误率更低。对大多数人来说,ASR 能大幅提升转录和语音笔记的效率。
- 运营成本更低:许多原本需人工记录数小时的场景,ASR 技术大幅降低了高质量转录的成本。法庭、呼叫中心、医疗机构、商务会议等都可用 ASR 生成详细笔记和完整分离的转录记录。
- 可访问性提升:世界卫生组织预测,到 2050 年将有 25 亿人存在不同程度的听力损失。先进 ASR 工具提供的实时字幕可让数字会议和媒体对用户更友好.
- 语音数据可检索:自动转录语音后,每一次客户互动都被完整记录。每通销售、支持、潜在客户电话或会议都变为可检索、可审计的文本。在 AI 时代,将信息转为机器可读格式有助于构建知识库,无论是功能还是合规,都能让信息更透明。
- 全天候客户体验:ASR 是 语音助手等自动化支持场景的基础技术,可实现客户通话自动处理,全年无休。
自动语音识别之所以在技术领域如此普及,正是因为它带来的价值和支持的应用场景极为广泛。无论是医疗行业还是客户通话转录,ASR 都是不可或缺的基础技术。
ASR 在各行业的常见应用
自动语音识别已成为众多工作流程和产品的核心技术。它的普及程度让用户往往忽略了其在日常技术中的存在。
以下是 ASR 在全球范围内的一些典型应用场景。
客户服务与呼叫中心
呼叫中心是 ASR 的早期应用者,用于通话转录以保障质量和合规。如今,ASR 可实时为坐席提供建议,将大量客户互动转为可分析的数据。
媒体与娱乐
广播和流媒体平台可用 ASR 批量生成字幕和对话转录,远超人工转录效率。它不仅支持实时转录,还让音视频库变得可检索。
医疗健康
医护人员有大量时间花在文档和记录上。ASR 可帮助医生通过 医疗 STT 平台实时语音记录,提高效率。
线上会议
会议平台通常提供数字笔记功能,实时转录对话,无需在参与和记笔记间做选择。Google Meet 等服务还会在会后发送带有重点事项的转录,方便信息检索。
法律与合规
法律场景下,准确记录内容和说话人是法庭的核心需求。律所会用 ASR 平台转录会议、听证、客户通话和法庭记录,并带有精确时间戳,便于后续查阅。
教育
大学教授可为课程提供录音转录,帮助学生建立完整的学习记录。学生可据此更好地理解和记忆知识。
ASR 在语音助手流程中的位置
ASR 是多种技术部署的标准环节。在语音助手技术中,它是三大循环阶段的第一步。
- 聆听(ASR):助手实时采集音频流,将语音转为文本。现代 ASR 可持续处理音频,过滤背景噪音、处理打断、生成部分转录,并识别每个人的发言。
- 思考(语言模型):大型语言模型解析转录文本,理解用户意图、检索相关信息、保持对话上下文,并决定最合适的回复或操作。
- 说话(文本转语音):文本转语音模型将 LLM 生成的回复转为自然、富有表现力的音频。现代 TTS 系统可在音频生成时调整语速、语调、情感和重音,无需等待完整回复即可回传给用户。
对话延迟会在每个环节累积。流式 ASR 可在语音刚说出口时就开始输出,减少等待整句结束的延迟。ElevenAgents将此作为实时语音助手的标准,带来高效的助手体验。
ASR 面临的挑战及技术演进
虽然 ASR 技术自 1952 年以来取得巨大进步,但仍存在一些影响准确率的挑战。
以下是 ASR 工具目前常见的问题:
- 口音与方言:可用训练数据通常集中于少数语言和口音,较少见的口音或小语种对 ASR 工具来说更具挑战。丰富多样的数据集是解决方案。
- 背景噪音与多人同时说话:环境噪音大或音量变化大时,难以准确识别每个词。多人同时说话也会降低转录准确率。
- 领域专有词汇:涉及专业术语或缩写的领域需定制词典和参考资料以提升准确率。医学和法律等领域的 ASR 工具需额外训练或辅助。
- 隐私与安全:在许多地区,语音数据属于个人数据。企业需制定明确的数据保留政策和保护措施,确保语音数据合规处理。
使用 ASR 技术时还需权衡延迟与准确率。部分场景需平衡两者,而医疗等领域则更看重准确率。
用 ElevenAPI 快速集成生产级 ASR
ElevenAPI通过 Scribe v2(ElevenLabs 文本转语音模型)为产品提供生产级自动语音识别。Scribe v2 支持词级时间戳、说话人分离、音频事件标记,具备实时应用所需的准确率和可靠性。
访问 ElevenLabs 文本转语音 页面了解详情,或免费注册账户,几分钟即可启用 API。


