跳至内容

衡量对话式 AI:成功的关键指标

发布时间
最近更新

收听收听本文

对话式 AI 工具能大幅降低全天候客户支持成本,无需安排夜班,也不必承担将岗位外包到海外带来的数据隐私风险。

但只有 AI 智能体能解决客户问题,节省成本才有意义。通过合适的关键绩效指标衡量对话式 AI,能判断它是否有效,尤其适用于处理大量客户咨询的企业。

本文将介绍如何通过评估对话流程和响应准确性,同时保障客户体验与品牌形象。还会说明客户体验团队如何针对来电问候语开展有效的 A/B 测试,并了解如何维护可靠的多语言对话式 AI 平台。

Overview of 10 conversational AI metrics, targets, and how latency affects satisfaction.

摘要

  • 从质量、体验和运营指标三个维度系统衡量对话式 AI,可提供保障客户体验所需的数据。
  • 自动化评估工具可大规模持续跟踪和改进对话式 AI 指标,人工人员则定期抽查。
  • 每次 A/B 测试只隔离一个特定变量,便能准确定位问题,从而部署直接解决已发现问题的修复方案。
  • AI 公司经常更新底层模型,原本可靠的聊天机器人在生产环境中往往会因此表现不同,所以持续改进必不可少。

衡量对话式 AI 的含义及其重要性

衡量 对话式 AI,是系统评估已测试或部署的 AI 智能体处理客户请求和解决问题的能力。目标是根据设定的性能标准,确定自动化系统在真实场景中处理多轮对话的效果。这些标准通常涵盖模型理解用户意图、保持品牌调性、提供准确回答以及成功解决问题的能力。

对于旨在减少团队工作量的系统而言,模型评估似乎会增加不少额外工作。但如果不持续评估,就很难了解模型在真实用例中的表现。换言之,你知道 AI 系统降低了客户支持运营成本,但能否确认它让客户满意,而不是促使他们寻找其他解决方案?

全面衡量需要从三个主要类别考察模型:

  • 质量: 根据用户的初始请求,评估 AI 回答的准确性、连贯性和相关性。核心问题是:AI 是否答对了并给出正确答案,还是在产生幻觉和犯错?
  • 体验: 评估客户体验,例如 AI 是否快速响应,以及需要几轮对话才能给出满意答案。核心问题是:用户是否觉得体验自然且有帮助,还是感到机械和挫败?
  • 运营: 判断系统是否可靠运行,并且仍是满足客户支持需求的高性价比方案。常见关注点包括:系统正常运行时间是否足够高,是否带来了足以证明其价值的投资回报?

每个团队对成功的定义不同,支持自动化前的初始痛点对此影响很大。例如,如果团队起初难以维持 24/7 客户支持,AI 智能体全天候可用便能显著提升客户支持表现。不过,这些类别都关乎整体成功:即使系统始终在线且很少崩溃,如果显得机械又会编造答案,对客户也没有多大帮助。

Conversational AI should be measured by quality, experience, and operations—not one alone.

应跟踪的核心对话式 AI 指标

跟踪清晰、可操作的数据,评估智能体面对客户时的表现,以及当前实施方案是否创造了实际业务价值。持续评估也为定期改进铺路。当明确工作流程中的瓶颈或需要调整的地方时,就能依据数据有效解决根本原因。

评估语音通话和聊天机器人表现时,可从这些 对话式 AI 指标 开始:

  • 自助解决率: 跟踪在自动化渠道内完全解决的咨询占比。目标因行业、场景、用例和机器人类型而异。例如,零售业 60–80% 相当常见,而旅游网站通常为 40–60%。
  • 升级率: 衡量 AI 智能体无需转交人工即可处理通话的频率。主动型企业会设置自动阈值,在情绪转为负面时立即将通话转给人工。理想升级率因行业和任务复杂度而异,但可将目标定为 15–30%。
  • 词错误率(WER): 跟踪 AI 在通话或转写中准确“听到”词语的能力。较好的行业标准为 5%,但在受监管领域,或处理医疗、金融和法律等敏感信息的用例中,需要更低的 WER
  • 意图识别准确率: 成功的 AI 智能体不只是识别词语,还要准确理解用户的痛点和需求。准确率目标因用例和具体意图类别而异。
  • 响应准确率: 判断模型提供真实且有意义回答的可靠程度。这对确保客户解决问题至关重要。一般客户服务咨询应达到 80% 或更高,支付等敏感用例则需达到 99% 或更高。
  • 幻觉率: 虽然与响应准确率密切相关,幻觉率专门衡量回答基于知识库的事实准确性。低幻觉率对确保回答有帮助,以及防止模型做出公司无法兑现的承诺至关重要。
  • 客户满意度(CSAT): 通过通话后问卷收集客户情绪,以判断满意度。企业通常采用 5 分制收集数据,但往往以百分比表示结果。根据 SurveyMonkey 的数据,较好的 CSAT 评分 通常从约 70% 开始,一些企业的目标为 80% 或更高。
  • 平均意见得分(MOS): 这项以人为本的指标同样采用 5 分制,用于衡量 AI 回答听起来是否自然,以及合成语音是否清晰。MOS 目标可设为 约 4.3–4.5.
  • 端到端语音延迟: 计算用户完成请求到智能体开始回应之间的总延迟。生产级智能体的端到端首段音频时间(TTFA)目标应低于 500 毫秒。ElevenLabs Flash v2.5 模型目前的内部模型推理延迟为 约 75 ms。实际端到端延迟会因所在位置和所用端点类型等因素而异。
  • 每次对话成本: 衡量每次自动化客户互动的总运营成本,并与人工会话比较。ElevenLabs 对话服务起价为 每分钟 10 美分,而客服代表的平均时薪意味着人工会话约为每分钟 32 美分。因此可节省约 70% 的成本,但价格可能因套餐和用量而异。请查看 ElevenLabs 定价页面,了解当前价格。

选择用于衡量模型表现的指标时,应考虑对所在行业和业务模式最重要的领域。例如,银行和患者信息等领域尤其重视准确性与事实性;而将客户体验置于首位的企业,则最看重 延迟、MOS 和升级率。

注意,某些指标可以解释其他指标的根本原因。例如,高延迟很可能导致 MOS 评分低,进而造成以 CSAT 表示的客户满意度下降。

如何衡量对话式 AI 准确性

通过约 500 到 1,000 条真实历史对话构建真实标签测试集,以衡量模型准确性。真实日志能捕捉合成数据常常遗漏的自然、杂乱表达,例如拼写错误、俚语和用户操作失误。然后根据这些真实日志,从意图识别、响应准确率和幻觉率三个方面评估系统。

使用 LLM 评委评分法,对这些交互进行自动评估。但务必用人工标注系统验证自动评分,以确保两者一致。之后,人工审核员每周依据简单的三级标准抽查聊天机器人表现:

  • 正确: 回答符合事实、与上下文相关,并直接满足用户的主要意图。
  • 可接受: 回答在技术上正确且有帮助,但有少量风格问题、措辞不够自然,或格式不符合品牌调性。
  • 错误: 回答包含事实错误、严重幻觉,或完全误解用户意图,需立即修正。

理想情况下,应按意图评估模型,因为 AI 智能体可能在某些场景表现出色,却在其他场景严重失效。使用汇总数据会让高表现领域掩盖关键薄弱点。

我们将 Next Reply(场景)测试 直接集成到 ElevenAgents 测试中,简化了这套流程。Next Reply 功能评估的是智能体发送的后续消息,而非完整的多轮对话。不过,你需要提供评估节点之前的聊天记录,并依据政策、语气和质量标准为回复评分。

如何对对话式 AI 回复进行 A/B 测试

A/B 测试收集真实反馈,避免猜测客户偏好。随后可利用这些实证数据微调 AI 模型表现。跟踪指标后,团队通常会列出想要改变的事项或准备开展的实验。但同时改动多项内容,很难判断哪些有效、哪些无效。

因此,有效测试要求每次只隔离一个特定变量,同时保持其余底层知识库不变。可调整的元素包括:

  • 问候语文案: 将初始问候语改得更具体,例如用“你好,选产品遇到困难了吗?”替代简单的“你好,有什么可以帮你?”。
  • 音色: 在特定情况下,客户可能会因男性或女性特征、语气、语调甚至口音,对某些音色的反应更好。
  • 模型路由: 高能力模型通常成本更高,因此高效且经济的做法是根据复杂或简单的咨询进行相应路由。
  • 提示词: 提示词由多个部分组成,因此每次只改动一个方面,例如上下文、目标、风格、语气、受众或回复模板(CO-STAR)。

团队还应调整测试周期。对话流量通常远低于网页浏览量,因此需要运行数周而非数天,才能获得统计显著性。如果流量极低,应测试幅度大、变化明显的改动,而非微小调整。

实用的工作流程还需要 智能体版本控制、比较和回滚工具。我们已将这些功能直接集成到 ElevenAgents。

Measuring conversational AI A/B testing guide for conversational AI: greeting copy, voice, model routing, and prompts.

部署前如何测试对话式 AI 智能体

客户服务直接面对影响业务营收的人群,而 AI 有时会对微小改动产生难以预测的反应。因此,新的或修订后的对话式 AI 智能体上线生产环境前,务必进行测试。仅凭“感觉测试”并不够。

我们的 ElevenAgents 测试框架围绕三类主要测试设计,分别针对对话式 AI 流水线的特定层级:

  • 模拟测试: 让智能体与 模拟用户进行完整的多轮对话,以确认对话是否达到预期性能水平。
  • Next Reply 测试: 仅根据特定语气、政策或其他约束测试智能体的即时回复,以确认回复是否恰当且准确。
  • 工具调用测试: 确保智能体能正确调用已连接的 API,并传递高风险数据库查询或转接所需的准确参数。

许多攻击者试图为恶意目的越狱模型,因此上线前还需要加入对抗性测试层。与 QA 团队、提示词工程师和红队网络安全专家合作,测试提示词注入、离题诱导和违反规则的尝试。

最后,采用分阶段发布:先向一小部分用户推出试行版本,并监控实际使用行为。模型通过严格标准后,再发布给更大范围的用户或全部客户。记得指定一位明确负责的负责人监督发布,并建立回滚路径,以防调整导致性能指标下降。

Pre-deployment tests: simulation, next reply, tool calls, and adversarial testing.

在生产环境中评估聊天机器人表现

发布对话式 AI 模型前,应为每个用例定义成功标准。这对高度监管领域的应用尤为重要,因为这些领域对准确性和数据隐私的标准更高、要求更严格。

自动回复让大规模 A/B 测试模型变得容易,但客观测试还需结合临时阅读对话记录和人工测试者的反馈。人工参与者能发现 AI 模型遗漏的对话细节,以及在汇总数据中容易丢失的数据异常。全面的评估策略还应包括情绪分析和直接用户反馈。

持续改进进一步区分了能提供高投资回报的成熟系统。竞争对手可能将测试和监控视为独立任务,而成熟的流水线会将两者结合。在这种情况下,生产环境中的失败案例会直接纳入测试集,用于训练下一版优化后的智能体。

当 AI 公司更新智能体所依赖的基础模型时,也需要定期调整。这类变化经常会让原本有效的提示词突然导致回答不可靠,甚至不恰当。

我们已将这一反馈闭环直接集成到平台中。使用 对话分析工具 自动收集结构化数据,轻松评估情绪。大型组织还使用我们的 企业级对话式 AI 基础设施,放心地在全球范围监控并扩展智能体。

使用 ElevenAgents 开始衡量客户服务指标

要大规模成功部署对话式 AI,仅有高质量音色和低延迟模型还不够。还需要一个用于设计、构建、测试、部署和调整多智能体工作流程的集成生态系统。

ElevenAgents 提供所需的可扩展基础设施。团队可使用 Next Reply 验证、情绪跟踪和自动数据收集等工具,持续监控和优化模型,获得最佳结果。更重要的是,能在问题影响客户前发现性能回退。

准备好简化对话式 AI 衡量流程了吗?探索我们的 智能体测试功能,了解企业团队如何部署可靠的智能体,提升客户服务指标。

了解更多 ElevenAgents,或 注册,立即开始。

关于衡量对话式 AI 的常见问题

相关内容

用高质量 AI 音频创作