语音智能体评估框架:6 大核心维度解析
- 发布时间
- 最近更新
语音智能体需要协调多个近乎并发运行的工具。这是一场精妙的配合:先用实时 语音转文本(STT)记录客户反馈,再通过大语言模型(LLM)整合上下文并生成回复,最后使用 文本转语音(TTS)软件生成音频文件。
涉及这么多环节,如何准确评估语音智能体的性能?
本文提出一个包含 6 大支柱的语音智能体评估框架,明确说明评估智能体成效时应衡量什么。我们还会介绍不同行业为何应赋予这些支柱不同权重,以及评估中常见的错误。
摘要
- 语音智能体评估的 6 大核心支柱是:TTS 音色质量、对话质量、工具使用与任务完成、智能水平、合规与安全、可靠性。
- 最重要的生产环境目标是:MOS 达到 4.3、TSR 超过 85%,首段音频响应时间低于 500ms。
- 不同行业对各项支柱的权重不同,某些部署场景会更看重其中某一项。
- 常见测试错误包括只评估干净音频,以及忽略 P99 延迟峰值。
- ElevenLabs 在关键指标上表现领先:Scribe v2 以 2.2% 的 WER 创下业界最低水平(Artificial Analysis,2026 年 6 月);Flash v2.5 和 Turbo v2.5 是速度领先的模型(Artificial Analysis,2026 年 6 月);ElevenAgents 的模型推理延迟约为 75ms。
什么是语音智能体评估框架?
AI 语音智能体评估框架是一套结构化体系,可从多个维度测试性能。完整的框架应涵盖从音频保真度、对话流畅度到监管合规等各项指标。
不同于文本聊天机器人,语音智能体的每次交互至少会经过 3 层技术:自动语音识别(ASR),将用户的话转换为文本;负责组织回复的 LLM;以及将回复转换回音频的 TTS 系统。任一系统出现故障,都会影响整体体验。
正因如此复杂,企业必须在选择供应商和部署前评估语音智能体。额外的延迟或不准确的回复都可能带来现实后果,例如客户流失,甚至面临监管罚款和声誉受损。
语音智能体评估框架通过基准测试和可量化数据,判断智能体是否适合特定用例。从业务角度看,评估不同语音模型有助于为客户选择最佳方案。
应评估的 6 大语音智能体支柱
尽管 创建和部署 AI 智能体 从未如此简单,但底层运行流程仍相当复杂。多个组件协同工作:聆听用户、理解需求、将信息传给 LLM,再生成音频回复,许多操作几乎同时发生。
若想与最佳语音智能体合作,企业需要一套严格的基准评估框架。
如果更关注测试结果,Artificial Analysis 提供了基于不同组件的多项智能体对比。下方展示的是模型间速度对比结果:ElevenLabs Turbo v2.5 和 Flash v2.5 在每秒处理字符数方面大幅领先。

对于想自行开展实验的开发者或企业,以下是 AI 智能体评估框架应采用的 6 大支柱:
- TTS 音色质量: 合成语音对终端用户而言是否自然、清晰且富有表现力。业界领先模型,例如 Eleven v3,可用超过 70 种语言提供富有人情感的类人表达。
- 对话质量: 模型能否理解人类语音、识别含义,并在多轮对话中及时结合上下文回复?
- 工具使用: AI 智能体无需人工干预,利用可用资源完成任务的程度。
- 智能水平: 模型的推理能力、处理新颖输入的能力,以及避免产生不准确或幻觉式回复的能力。
- 合规与安全: 除了各项能力外,AI 语音智能体还必须遵守所有监管和合规要求,包括启用有效的防护措施。
- 可靠性: 通过总可用时间、负载下的稳定性能等要素,判断 对话式 AI 智能体能否随需求扩展。
这些支柱各自独立,却又相互关联,共同决定用户最终体验。例如,即使模型改善了音色质量,若延迟仍然很高,客户在听到回复前依然会经历尴尬的等待。
下面深入了解各项语音 AI 评估支柱。
TTS 音色质量
我们先从音色质量说起,因为这可能是人与 AI 对话式智能体互动时最先注意到的因素。若声音机械或令人不适,使用体验会明显变差。
国际电信联盟电信标准化部门(ITU-T)定义的早期评估指标之一是平均意见分(MOS)。MOS 的范围为 1 至 5 分,1 分表示不可用,5 分表示优秀。它是一项主观指标,需要人类听众在通话后提供反馈。
按这一量表,MOS 低于 3.5 分表现一般,尤其以当前标准来看,很可能影响客户满意度。
MOS 以人为本,但多项技术要求会影响这一得分:
- 音高一致性与抖动:音高和抖动是人们聆听时会自然感知的两个语言要素。“音高”指语音中的语调变化,例如提问时自然提高声调。抖动是指语音模型对音高的理解发生波动,导致无法在整句话中维持连贯韵律。业界的抖动基准为 30ms。
- 情感表现力: 即使声音清晰准确,若语气不符合句子应有的情感,也会显得不对劲。缺少准确的语调线索,人类听众会更难与 AI 对话式智能体建立共鸣,并给出更低评价。ElevenAgents 提供 近似人类的情感表现力,让每条回复都带有明确的情感意图。
- 背景噪声: 语音智能体的背景噪声有两个值得评估的维度。输出端会在回复中细微加入环境背景音,让智能体听起来更自然。输入端则可选用 STT 层的背景噪声过滤功能,以提高准确率。评估智能体时,两者都应测试:听环境音是否自然,并比较开启和关闭噪声过滤时的 STT 准确率。
计算 MOS 时,应以 4.3 至 4.5 分为目标,这代表上述所有感知维度都获得了高分。如需大规模预测 MOS 而无需人工评审小组,可使用 UTMOS 和 NISQA 等工具。
对话质量
对话质量是介于音色质量与任务完成之间的综合支柱,用于衡量语音智能体理解用户需求、结合上下文处理打断,并将对话持续推进至完成的效果。
这里的主要指标是意图分类准确率,通常在 85% 至 92% 之间,顶尖表现可达 96% 以上。85% 看似很高,但仍意味着全部传入请求中有 15% 被错误分类并路由到错误资源。
有助于实现高意图分类准确率的技术要素包括:
- 轮次交替: 轮次交替决定语音智能体管理自然对话流程的能力,评估其何时应聆听、回复或等待更多输入。它还包括处理插话:模型清除正在生成的回复,并根据新输入生成新的回复。ElevenLabs 使用 多上下文 websocket,无缝处理这类自然打断。
- 延迟:延迟 是指用户说完一句话到智能体开始播放音频回复之间的端到端等待时间。生产级语音智能体应将首段音频响应时间控制在 500ms 以内,低于 300ms 更佳。ElevenLabs Flash 模型提供约 75ms 的业界领先模型推理时间,助你在此项指标中取得优势。
- 回退率: 回退率衡量 AI 智能体无法理解用户、需要请求澄清或重复的频率。它很大程度上受 STT 准确率影响:如果语音识别层误听或错误呈现客户所说的内容,LLM 接收到的就是失真的输入。回退率的计算公式为:回退率(%)=(回退次数 / 交互总次数)* 100。
ElevenLabs Scribe V2 在 Artificial Analysis 语音转文本模型评估中以 2.2% 的 WER 位居最低

衡量对话质量的一种方式是查看不同组件的行业基准。如你所见,ElevenLabs 的 Scribe v2 截至 2026 年 6 月以 2.2% 的词错误率位居最低,这意味着更少误听、更少回退,以及更准确的意图分类。
企业可能会发现,对话质量还取决于语音智能体运行的 workflow。例如,在客户服务场景中,升级转人工的交接质量或 FAQ 解决率也是需要考虑的因素。
工具使用与任务完成
质量衡量对话体验,任务完成则衡量对话是否达成了成功结果。企业应重点关注语音智能体评估框架的这一部分,因为它与业务成果直接相关。
衡量工具使用的一项指标是槽位填充准确率,用于判断 AI 智能体完成填写客户信息表等常规任务的效果。高槽位填充准确率说明智能体能顺畅地从对话转向行动,且不会在过程中丢失信息。
任务成功率(TSR)是衡量智能体成功完成端到端任务比例的指标。任务完成取决于智能体能否理解请求,并使用正确的已连接工具获取协助,包括 API、数据库、检索增强生成(RAG)和内部知识库。
TSR 的公式为:
TSR =(完全完成的任务数 / 尝试的任务总数)x 100
生产就绪的语音智能体应以 TSR 超过 85% 为目标,并监控工具调用准确率和工具调用可靠性。为避免 TSR 下滑,请对任何提示词或已连接模型的变更进行回归测试。即使微小偏差也可能严重影响 TSR。
智能水平
智能水平涵盖语音智能体的推理和高阶能力。这一支柱清晰地区分了语音主导的 IVR(交互式语音应答)与语音 AI 智能体。
此项需评估的关键维度包括:
- 幻觉风险: 智能体生成不准确或与公司文档不一致的信息,即为幻觉。在语音 AI 中,这类问题尤其有害,因为它们可能以自信的语气传达。近期研究表明,常见的幻觉会显著损害客户对语音智能体的满意度。
- 超出范围的处理: 智能智能体能识别问题何时超出其上下文范围,并作出恰当回应。它们不会编造答案,而是拒绝回答或将对话引导回已定义的上下文范围。
- 上下文保留: 在多轮对话中,智能体能否追踪先前提到的实体和作出的承诺?缺乏这种能力,客户可能需要反复说明,或收到相互矛盾的回复。
- 推理与多步逻辑: 智能体能否正确处理条件逻辑,或在多轮对话中串联推论?特别是在 金融服务 等技术性更强的用例中,在预定义上下文内推理的能力至关重要。
这些维度和组件已有多个第三方基准。例如,斯坦福大学的语言模型整体评估(HELM)可评测 LLM 在不同类别中的表现。对于幻觉,TruthfulQA 能深入分析回复中出现错误答案的频率。
ElevenAgents 的一项优势是,不同于将你锁定在单一底层模型上的某些语音平台,它支持完全替换 LLM 层。实际使用中,这意味着可针对特定用例接入在推理基准中表现最好的模型。
合规与安全
企业需要实施主动防护措施,防止有害或违反政策的输出。不同于可能被绕过或覆盖的系统级提示词指令,独立的防护检查会作为模型外的单独层级运行。在输出触达用户前进行评估,若对话进入危险领域,则中止对话。
可审计性也是相关要求:生产环境智能体需以支持事后审查的格式,保留详细的决策和输出日志。尤其在监管严格的行业,事后能够证明合规与一开始实现合规同样重要。
业务须遵守的具体法规因行业而异。最常见的适用框架包括:
- HIPAA: 适用于美国医疗场景中的受保护健康数据。
- PCI-DSS: 适用于处理支付卡数据的任何智能体。
- GDPR: 面向欧盟及拥有欧盟客户企业的数据隐私义务。
对于评估合规状况的企业,ElevenLabs 已符合 AICPA SOC Type II 和 GDPR 要求,并获得 AIUC-1 认证。AIUC-1 是专为 AI 智能体设计的安全标准。
可靠性
可靠性是语音智能体评估框架的最后一项支柱,衡量智能体能否持续提供实时服务。
评估语音智能体时,请关注以下特征:
- 可用时间: 所有面向客户的部署都应达到 99.9% 的可用时间,以避免服务中断。对于入站支持等始终在线的用例,稳定的可用时间尤为重要。
- 优雅降级: 由于语音智能体底层复杂,某个组件开始失效时,智能体应平稳降级。实际而言,就是转接人工,而非在负担加重或持续报错时继续运行。
- 负载下的性能: 上线前,负载测试应至少模拟预期峰值并发量的 2 倍。高压测试可发现只有在大规模下才会出现的延迟增加或性能下降。
即使高质量模型满足其他所有条件,若无法随客户需求扩展,也可能无法使用。ElevenAgents 获 1,000,000 家领先创作者和企业信赖,证明该平台可在不牺牲性能基准的情况下支持企业级部署。
如何测量语音智能体的 MOS(分步指南)
如果企业希望手动测量 MOS,需要大量人类听众及一批来自真实对话的音频片段。这是一个包括收集反馈、求平均值和解读数据的结构化流程。
以下是在实践中测量语音智能体 MOS 的方法:
- 准备测试集: 从智能体的音频输出中选取具有代表性的样本,覆盖不同类型的对话,至少包含 100 段音频。
- 进行评分: 请人类听众根据沟通体验质量,按 1 至 5 分为每段音频评分。
- 汇总评分并计算分数: 先计算每段音频的平均分,再计算所有样本音频的平均分,得出整体 MOS。MOS 达到 4.3 分或以上,表示语音智能体已可用于生产环境。
尽管需投入较多人工,这个流程能为所选语音智能体提供可靠的 MOS。如需大规模运行测试,可用 NISQA 等自动化工具替代人类听众,以程序化方式预测 MOS 分数。还可将这些系统集成到现有流水线中,持续监测 MOS 的变化。
AI 与人工测试基准:FCR、AHT 和 CSAT
持续计算 MOS 能观察模型改进或退化,也可通过与人工表现进行基准比较来补充更多背景。了解人类在相似岗位中的实际表现,有助于判断语音智能体是否接近理想水平。
以下是 AI 与人工测试基准中可考虑的几项指标。
AI 智能体应能达到人工的 FCR 和 CSAT,同时显著改善 AHT。后者之所以能够改善,是因为 AI 智能体通常处理的对话比人工智能体更通用。许多企业采用这样的 workflow:由 AI 智能体先响应,只有在无法自主处理的复杂情况下才将通话转给人工智能体。
AI 对比聚合平台 Poe 的 2025 年数据显示,ElevenLabs 保持了最强的整体请求完成能力,成功完成了 74.4% 的所有传入请求。这一成功带动使用量快速增长,Eleven v3 和 v2.5-Turbo 长期占发送给 AI 模型消息的 60% 以上。
按 Poe 基准统计的 AI 模型消息量变化趋势,ElevenLabs 在语音智能体评估框架中领先

语音智能体测试中的常见错误
遵循语音智能体评估框架时,很容易只测试最佳情境。但客户日常与语音 AI 系统互动的体验,并不来自理想条件。
以下是 3 个常见的语音智能体测试错误及其改进方法:
- 只测试最简单的路径: 尤其在为 MOS 选择音频片段时,务必纳入边缘用例。现实中带背景噪声或口音的音频极为常见,若只测试“干净”的音频文件,会导致 MOS 校准失准。
- 优先考虑封闭率而非解决率: 优化模型以将用户留在智能体系统内,会在不改善结果的情况下抬高封闭率。若封闭率高但 FCR 低,智能体只是在让用户陷入令人沮丧的循环。应设置机制,允许用户按需与人工智能体交谈。
- 忽视延迟百分位数: SLA 通常以 P95 定义延迟。该指标对于为大多数客户提供稳定体验很重要,但不要忘记最后 5% 也是真实客户。对于每天处理 10,000 通电话的系统,即使只有 5%,仍有 500 人会经历缓慢对话。应将 P99 而非仅中位数或 P95 作为主要 SLA 目标。
牢记这些要点,便能建立公平且有代表性的基准,而非依据理想化的平均值。
为何需要按用例进行评估
尽管该框架的 6 大支柱为需要探索的领域提供了指引,但每项支柱的权重取决于所在行业。例如,金融服务企业可能优先考虑合规和工具使用,而消费品牌则会将 TTS 音色质量作为首要原则。
以下是 2 个按用例评估的实例,以及它们如何改变各支柱的权重平衡。
客户支持
在呼叫中心等行业,首次通话解决率(FCR)等其他任务完成指标也很重要。成功处理来电而无需人工介入,可显著减轻人工客服智能体的需求压力。麦肯锡估计,使用语音智能体的呼叫中心可将交互量最多降低 50%。
虽然不如任务成功率重要,另一个值得考虑的维度是封闭率。封闭率衡量通话的总时长。如果封闭率很高但 FCR 很低,说明智能体让用户一直在线,却没有为客户提供解决方案。实际体验中,这会让客户感到一直在兜圈子、非常挫败。
还应跟踪 AHT,AI 智能体应快速解决常规问题。因此,客户支持领域会优先考虑对话质量,尤其是轮次交替和回退率,而不是其他方面。
医疗健康
医疗健康 是高度监管的领域,严格的合规要求使语音智能体运营极为谨慎。合规是核心关注点,因此框架中安全支柱的权重会显著提高,并与智能水平一同优先于其他因素。
医疗健康聊天机器人 需要处理预约安排、远程医疗访问流程、症状分诊和保险咨询。这些任务都要求较高的智能水平和工具使用能力,再次说明行业或岗位特定需求会影响哪项支柱最重要。
无论业务所属领域为何,理解语音智能体评估的核心支柱并均衡应用,都有助于找到最适合的智能体。
使用 ElevenAgents 构建高性能、低延迟应用
所选构建平台会直接影响语音智能体在实际 workflow 中的表现。特别是在与客户互动时,需要确信智能体能在每个类别中表现出色。
ElevenAgents 专为生产级语音部署打造,结合通过 Eleven v3 提供的业界领先 TTS、通过 Scribe v2 实现的实时 STT,以及专为企业级规模设计的 智能体编排层。每个组件都针对本框架提出的基准打造,助你为客户提供高质量体验。
无论还在权衡方案,还是已准备开始构建,ElevenLabs 都能为你提供合适的路径。探索 ElevenAgents 平台,了解它如何适配用例,或 注册,立即开始构建。

