语音智能体评估框架:6 大核心维度解析
- 发布时间
- 最近更新
语音智能体需要协调多种近乎同步运行的工具。这是一场精密配合:先通过实时语音转文字(STT)记录客户反馈,再利用大语言模型(LLM)整合上下文并生成回复,最后通过文本转语音(TTS)软件生成音频文件。
环节如此之多,如何准确评估语音智能体的表现?
本文将提出一个包含 6 大支柱的语音智能体评估框架,明确说明评估智能体成效时应衡量什么。我们还会介绍不同行业为何应赋予这些支柱不同权重,以及评估中常见的错误。
摘要
- 语音智能体评估的 6 大核心支柱是:TTS 音质、对话质量、工具使用与任务完成、智能水平、合规与安全,以及可靠性。
- 最重要的生产目标是:MOS 达到 4.3、TSR 超过 85%,以及首段音频生成时间低于 500ms。
- 不同行业对各支柱的权重不同,某些部署场景会优先考虑其中某一项。
- 常见测试错误包括只评估纯净音频,以及忽略 P99 延迟峰值。
- ElevenLabs 在关键指标上领先:Scribe v2 的 WER 低至 2.2%,位居行业最低(Artificial Analysis,2026 年 6 月);Flash v2.5 和 Turbo v2.5 是速度领先的模型(Artificial Analysis,2026 年 6 月);ElevenAgents 的模型推理延迟约为 75ms。
什么是语音智能体评估框架?
AI 语音智能体评估框架是一套结构化体系,可用于从多个维度测试性能。全面的框架应包含各类指标,覆盖音频保真度、对话流畅度,甚至监管合规性。
不同于文本聊天机器人,语音智能体会让每次交互至少经过 3 层技术:自动语音识别(ASR),将用户的话转换为文字;负责组织回复的 LLM;以及将回复转换回音频的 TTS 系统。任一系统失效,都会影响整体体验。
正因如此复杂,企业需要在选择供应商和部署前评估语音智能体。额外延迟或回复不准确都可能带来实际后果,例如客户流失,严重时甚至面临监管罚款和声誉损失。
语音智能体评估框架通过基准测试和可量化数据,判断智能体是否适合特定用例。从商业角度看,评估不同语音模型能帮助你为客户选择最佳方案。
应评估的语音智能体 6 大支柱
尽管创建和部署 AI 智能体从未如此简单,但其底层运行流程仍相当复杂。多个组件协同工作:监听用户、理解需求、将信息提供给 LLM,再生成音频回复,期间会发生大量近乎同时进行的操作。
企业若想与最佳语音智能体合作,需要一套严格的基准评估框架。
如果更想了解测试结果,Artificial Analysis提供了基于不同组件的多项智能体对比。下方可见其模型间速度对比结果,ElevenLabs 的Turbo v2.5和 Flash v2.5 在每秒处理字符数上遥遥领先。

对于希望自行开展实验的开发者或企业,以下是应采用的 AI 智能体评估框架 6 大支柱:
- TTS 音质:合成语音对终端用户而言是否自然、清晰且富有表现力。行业领先模型如Eleven v3,可在超过 70 种语言中提供接近真人、富有情感的表达。
- 对话质量:模型能否理解人类语音、解析语义,并在多轮对话中及时结合上下文回复?
- 工具使用:AI 智能体无需人工干预,利用可用资源完成任务的程度。
- 智能水平:模型推理、处理新颖输入,以及避免生成错误或幻觉回复的能力。
- 合规与安全:除具备各项能力外,AI 语音智能体还必须遵守所有法规和合规要求,包括主动护栏。
- 可靠性:通过整体正常运行时间和负载下的稳定表现等指标,判断对话式 AI智能体能否随需求扩展。
这些支柱虽各自独立,却相互关联,共同决定用户的最终体验。例如,即使模型改善了音质,但延迟依然很高,客户在听到语音前仍会经历尴尬的等待。
下面深入了解这些语音 AI 评估支柱。
TTS 音质
我们从音质说起,因为这很可能是用户与 AI 对话智能体互动时最先注意到的因素。若声音听起来机械或诡异,主观体验会明显变差。
国际电信联盟电信标准化部门(ITU-T)定义的早期评估指标之一是平均意见得分(MOS)。MOS 采用 1-5 分制,1 分表示不可用,5 分表示优秀。作为主观指标,它通过人类听众在通话后提供反馈来计算。
该量表中低于 MOS 3.5 的表现并不理想,尤其按现代标准来看,并且可能影响客户满意度。
MOS 以人为本,但多项技术要求都会影响这一分数:
- 音高一致性与抖动:音高和抖动是人们在聆听时会自然感知的两项语言元素。“音高”是指语音中变化的语调,例如提问时自然提高音调。抖动是指语音模型对音高的理解发生变化,导致它无法在整句话中保持连贯的韵律。行业中抖动的基准值为 30ms。
- 情感表现力:即使声音清晰准确,如果语气与句子预期的情感基调不符,听起来仍会不自然。缺少准确的语调线索,人类听众会更难与 AI 对话智能体建立亲近感,评分也会更低。ElevenAgents 提供接近真人的情感表现力,让每条回复都带有明确的情感意图。
- 背景噪声:语音智能体中的背景噪声有两个值得评估的维度。在输出端,可在回复中轻微加入环境背景声,使智能体听起来更自然。在输入端,STT 层的背景噪声过滤是可选开关,可提升准确率。评估智能体时应同时测试两项:听听环境噪声是否自然,并分别在开启和关闭噪声过滤器时评估 STT 准确率。
计算 MOS 时,应以 4.3-4.5 为目标,这表明在上述所有感知类别中均取得高分。若想大规模预测 MOS 而无需人工评审小组,可使用UTMOS和NISQA等工具。
对话质量
对话质量是介于音质和任务完成之间的综合支柱。它衡量语音智能体能否有效理解用户需求、在适当语境下处理中断,并将对话推进至多轮完成。
这里的主要指标是意图分类准确率,通常在 85%-92% 之间,优秀表现可达 96% 以上。85% 看似很高,但仍意味着所有流入请求中有 15% 被错误分类并路由至错误资源。
有助于提升意图分类准确率的技术要素包括:
- 轮次交替:轮次交替决定语音智能体管理自然对话流程的效果。它评估智能体是否知道何时该倾听、回复或等待更多输入,也涵盖处理插话:模型会清除正在生成的回复,并根据新输入生成新回复。ElevenLabs 使用多上下文 websocket无缝处理这类自然中断。
- 延迟:延迟是指用户说完一句话到智能体开始输出音频之间的端到端等待时间。生产级语音智能体的首段音频生成时间应低于 500ms,低于 300ms 更佳。ElevenLabs Flash 模型提供行业领先、约 75ms 的模型推理时间,助你在此项取得优异表现。
- 回退率:回退率衡量 AI 智能体无法理解用户、要求澄清或重复的频率。这在很大程度上是 STT 准确率的下游结果:若语音识别层听错或错误呈现客户所说内容,LLM 接收到的输入就会被破坏。回退率采用直接计算公式:回退率(%)=(回退次数 / 交互总次数)* 100。
在 Artificial Analysis 语音转文字模型评估中,ElevenLabs Scribe V2 以 2.2% 的 WER 位居最低

衡量对话质量的一种方法,是参考不同组件的行业基准标准。如你所见,ElevenLabs 的 Scribe v2截至 2026 年 6 月的词错误率最低,为 2.2%,意味着更少误听、更少回退,以及更准确的意图分类。
企业可能会发现,对话质量还取决于语音智能体所处的 workflow。例如,在客户服务中,还应考虑升级转人工的交接质量或 FAQ 解决率。
工具使用与任务完成
质量衡量对话体验,任务完成则衡量它是否成功达成结果。企业应特别关注语音智能体评估框架的这一部分,因为它与业务结果直接相关。
衡量工具使用的一项指标是槽位填充准确率,用于判断 AI 智能体完成填写客户信息表等常规任务的能力。高槽位填充准确率表明智能体能顺畅地从对话转向行动,同时不丢失信息。
任务成功率(TSR)是以百分比衡量智能体成功完成端到端任务的指标。任务完成取决于智能体能否理解请求,并使用正确的已连接工具寻求支持,包括 API、数据库、检索增强生成(RAG)和内部知识库。
TSR 的计算公式为:
TSR =(完全完成的任务数 / 尝试的任务总数)x 100
生产就绪的语音智能体应以 TSR 超过 85% 为目标,并监控工具调用准确率和工具调用可靠性。为避免 TSR 下滑,请针对提示词或已连接模型的任何改动进行回归测试。即使微小偏差,也可能对 TSR 造成重大影响。
智能水平
智能水平涵盖语音智能体的推理和高阶能力。这一支柱清楚地区分了语音主导的 IVR(交互式语音应答)和语音 AI 智能体。
此处应评估的关键维度包括:
- 幻觉风险:智能体生成不准确或与公司文档不一致的信息,即为幻觉。它在语音 AI 中尤其有害,因为这些信息可能被自信地传达出来。近期研究表明,常见的幻觉问题会显著损害客户对语音智能体的满意度。
- 超范围处理:智能智能体能识别问题何时超出自身上下文领域,并做出恰当回应。它们不会编造答案,而是拒绝回答,或将对话引导回已映射的上下文范围。
- 上下文保持:在多轮对话中,智能体能否追踪此前提到的实体和作出的承诺?缺少此能力,客户可能需要反复说明,或收到相互矛盾的回复。
- 推理与多步逻辑:智能体能否正确处理条件逻辑,或跨多轮对话串联推断?特别是在金融服务等技术性更强的用例中,在预定义上下文内推理的能力是成功关键。
这些维度和组件已有多个第三方基准。例如,斯坦福大学的语言模型整体评估(HELM)可对不同类别的 LLM 表现进行基准测试。对于幻觉,TruthfulQA 可深入分析回复中出现错误答案的频率。
ElevenAgents 的一项优势是,不同于某些将你锁定在单一底层模型的语音平台,它支持完全替换 LLM 层。实际而言,这意味着你可接入在特定用例推理基准中表现最好的模型。
合规与安全
企业需要实施主动护栏,防止有害或违反政策的输出。与可能被规避或覆盖的系统级提示词指令不同,独立护栏检查作为模型之外的单独层运行。它们会在输出触达用户前进行评估,若对话偏离至危险领域则予以中止。
可审计性是另一项相关要求。生产环境中的智能体需要以支持事后审查的格式,保留详细的决策和输出日志。特别是在强监管行业中,事后证明合规与一开始实现合规同样重要。
企业必须遵守的具体法规因行业而异。最常见的适用框架包括:
- HIPAA:适用于美国医疗场景中的受保护健康数据。
- PCI-DSS:适用于处理支付卡数据的任何智能体。
- GDPR:适用于欧盟及拥有欧盟客户的企业的数据隐私义务。
对于评估合规状况的企业,ElevenLabs 已符合 AICPA SOC Type II 和 GDPR,并获得了AIUC-1 认证。AIUC-1是专为 AI 智能体设计的安全标准。
可靠性
可靠性是语音智能体评估框架的最后一项支柱,关注智能体能否持续提供实时服务。
评估语音智能体时,请关注以下特性:
- 正常运行时间:所有面向客户的部署都应达到 99.9% 的正常运行时间,以避免服务中断。尤其对于入站支持等始终在线的用例,稳定的正常运行时间至关重要。
- 优雅降级:由于语音智能体底层复杂,若某个组件开始失效,智能体应能优雅地处理降级。实际做法是转接人工,而不是在压力增加或不断报错的状态下继续运行。
- 负载下的性能:上线前,负载测试应至少模拟预期峰值并发量的 2 倍。高压力测试可发现只会在规模化运行时出现的延迟增加或性能下降。
即使高质量模型满足所有其他条件,若无法随客户需求扩展,也可能无法使用。ElevenAgents 获得 1,000,000 位领先创作者和企业的信赖,证明平台能够在不牺牲性能基准的情况下支持企业级部署。
如何衡量语音智能体的 MOS(分步指南)
如果想手动衡量 MOS,需要大量人类听众以及从真实对话中选取的音频片段。这是一个结构化流程,包括收集反馈、计算平均值,再解读数据。
以下是在实际中衡量语音智能体 MOS 的方法:
- 准备测试集:从智能体输出中选取具有代表性的音频样本,覆盖不同对话,至少包含 100 个片段。
- 进行评分:请人类听众根据沟通体验质量,按 1-5 分为每段音频评分。
- 汇总评分并计算得分:先计算每段音频的平均评分,再对所有样本片段取平均,得出整体 MOS。MOS 达到 4.3 或以上,表明语音智能体已具备生产部署条件。
尽管需要大量人工,这一流程能为所选语音智能体提供可靠的 MOS。若要大规模测试,可用 NISQA 等自动化工具替代人类听众,以编程方式预测 MOS 分数。还可将这些系统集成到现有流水线中,持续监测 MOS 随时间的变化。
AI 与人工测试基准:FCR、AHT 和 CSAT
持续计算 MOS 可观察模型改进或退化,而与人工表现进行基准对比则能提供更多背景。了解人工客服在相似岗位中的实际表现,可判断语音智能体是否接近理想水平。
以下是 AI 与人工测试基准中值得考虑的几项指标。
AI 智能体应能达到人工客服的 FCR 和 CSAT,同时显著改善 AHT。后一项提升源于 AI 智能体通常处理的对话比人工客服更通用。许多企业采用的 workflow 是:AI 智能体先响应,只有在问题过于复杂、无法自主处理时才转接人工客服。
AI 对比聚合平台 Poe 的 2025 年数据显示,ElevenLabs 保持着最强的整体请求完成能力,完成了所有传入请求的 74.4%。这一成功带来了快速增长的使用量:随着时间推移,发送至 AI 模型的消息中,Eleven v3 和 v2.5-Turbo 占比超过 60%。
随时间推移发送给 AI 模型的消息数:ElevenLabs 在 Poe 语音智能体评估框架中领先

常见语音智能体测试错误
遵循语音智能体评估框架时,很容易只测试最佳情况。但现实中,客户日常使用语音 AI 系统的体验并非来自理想条件。
以下是 3 个常见的语音智能体测试错误及改进方法:
- 只测试最简单的路径:特别是在为 MOS 选择音频片段时,务必纳入边缘用例。现实生活中,带背景噪声或口音的语音片段极其常见,因此只测试“纯净”音频文件会导致 MOS 校准不准。
- 优先追求留存而非解决:优化模型以将用户留在智能体系统内,会在不改善结果的情况下抬高留存率。若留存率很高但 FCR 很低,说明智能体正让用户陷入令人沮丧的循环,而没有提供解决方案。应建立机制,让用户能在需要时与人工客服沟通。
- 忽略延迟百分位数:SLA 通常以 P95 级别定义延迟。该指标对于为大多数客户提供稳定体验很重要,但别忘了最后 5% 也是真实客户。对于每天处理 10,000 通电话的系统而言,5% 仍意味着有 500 人经历缓慢的对话。应将 P99 作为主要 SLA 目标,而非只关注中位数或 P95。
牢记这些要点,便能建立公平且有代表性的基线,而不是依据理想化的平均值。
为何应按用例进行专项评估
本框架列出的 6 大支柱能指引应探索的领域,但各支柱的权重取决于所在行业。例如,金融服务行业可能优先考虑合规和工具使用,而消费品牌则可能将 TTS 音质作为首要原则。
以下通过两个按用例评估的实例,说明它们如何改变各支柱之间的权重平衡。
客户支持
在呼叫中心等行业,首次通话解决率(FCR)等其他任务完成指标也是重要考量。无需人工干预即可成功处理来电,能显著减少对人工客服的需求。麦肯锡估计,使用语音智能体的呼叫中心最多可将交互量减少 50%。
虽然不如任务成功率重要,但还应考虑留存率。留存率是考察通话总时长的指标。如果留存率很高而 FCR 很低,说明智能体让用户一直在线,却未为客户解决问题。实际体验中,客户可能会觉得自己在原地打转,十分沮丧。
还应跟踪 AHT,AI 智能体的目标是快速解决常规问题。因此,客户支持领域应优先考虑对话质量,尤其是轮次交替和回退率,而非其他方面。
医疗健康
医疗健康是高度监管的领域,严格的合规要求使语音智能体的运营尤为谨慎。合规是核心关注点,使框架中安全支柱的权重显著提高,并与智能水平共同成为最优先事项。
医疗健康聊天机器人需要处理预约安排、远程医疗服务路径、症状分诊和保险咨询。这些都要求高度的智能水平和工具使用能力,再次说明行业或岗位的具体需求会影响哪项支柱最重要。
无论企业身处哪个领域,理解语音智能体评估的核心支柱并平衡应用,都有助于找到最适合的智能体。
使用 ElevenAgents 构建高性能、低延迟方案
选择的构建平台会直接影响语音智能体在实际 workflow 中的表现。尤其是在与客户互动时,你需要确信智能体能在每项指标中表现出色。
ElevenAgents 专为生产级语音部署而构建,结合通过Eleven v3提供的行业领先 TTS、通过Scribe v2实现的实时 STT,以及面向企业规模设计的智能体编排层。每个组件均针对本框架所列基准构建,帮助你为客户提供高质量体验。
无论你仍在权衡方案,还是已准备开始构建,ElevenLabs 都能提供适合的路径。探索ElevenAgents 平台,了解它如何适配你的用例,或注册并立即开始构建。


