跳至内容

对话式 AI 设计:如何打造更自然的人机体验

发布时间
最近更新

收听收听本文

对话式 AI 设计过去指的是构建决策树。早期聊天机器人和 IVR 菜单依赖严格的预设分支:按 1 处理账单问题,说“是”或“否”,并希望客户的问题正好符合你预设的某条路径。只有当对话始终处于已构建的范围内时,这种模式才有效。

AI 智能体消除了这一限制。它们现在可以实时理解对话、调用知识库和工具,并记住已说过的内容,因此不再受固定脚本限制。

但这一变化并未消除对话式 AI 设计的必要性,反而提高了要求。没有严格脚本可依赖,智能体的人设、workflow 和决策点必须定义得足够完善,才能应对开放式实时对话,而非预设对话。

本指南将介绍对聊天和语音智能体而言,对话式 AI 设计的实际含义、它为何影响团队已在考核的指标,以及如何优化以获得更自然的体验。做好这些,就能部署能与客户建立连接、提供更快更好服务的 AI 智能体。

摘要

  • 对话式 AI 设计是指对 AI 智能体的沟通方式进行结构化设计和优化,让对话更自然。
  • 语音 AI 对问题的容忍度低于文本,因为聊天界面中不易察觉的语音、延迟和时机问题,会让语音对话显得机械。
  • ElevenAgents 通过一系列功能,实现更像真人的 AI 语音和聊天智能体。你可以控制声音、人设和对话流程,并针对各渠道优化延迟。

什么是对话式 AI 设计?

对话式 AI 设计是一项 UX 实践,用于配置 AI 智能体的行为方式。它涵盖人设、护栏、workflow 和所调用的知识库等,让对话体验与产品的其他部分一样完善。

不过,这类配置在不同渠道中并不相同。智能体可通过一套配置运行在聊天、语音或 SMS 等多个渠道。每种渠道都有自身限制,而语音的限制最严格。当语音是智能体的一个渠道时,它必须选择并输出合适的声音,实时管理语速和轮次交接,并在停顿被误认为通话中断前给出回复。这些在聊天中并非必需:回复略慢或不够完美,通常不会破坏互动。

为聊天智能体实施对话式 AI 设计时,需要考虑以下因素,以及语音额外增加的要求。

Feature
Chat
Voice
Latency
Small delays are unnoticeable, and there is often more time to think as users type their own answers.
Voice agents have almost no room for delay. A pause that's fine in a chat window reads as dead air on a call, and the customer assumes it dropped.
Persona
Comes through in font, color, and word choice.
Persona also has to come through in accent, pacing, and tone, since the customer hears it instead of reading it.
Conversation flow
Messages simply queue up. No turn-taking, interruption handling, or silence detection needed.
The agent has to decide, in real time, when the customer is done talking and when it’s safe to respond.
Language and accent
The agent just needs to detect and match the right language.
The agent also has to get the accent right, since language detection alone won't catch it.

客户不会有意识地逐项评估这些因素。他们只会察觉哪里不对劲,而这种感觉足以削弱对整个智能体的信任,进而影响你部署它原本想实现的目标。

为什么对话式 AI 设计对良好用户体验很重要

从轮次交接、延迟到人设,上述每项因素都会影响客户在关键时刻对品牌的看法:他们可能成为拥护者,也可能成为批评者。这种看法会直接反映在团队的考核指标中。

  • 更高的满意度和解决率: 智能体及时回复且不会突兀打断时,客户对互动的评价更高。
  • 减少放弃率: 客户退出对话的原因不只是等待过久。无论是通话中尴尬的停顿,还是聊天中生硬、不符合品牌调性的回复,只要交付体验不符合预期,都可能让他们想结束对话。
  • 更快解决问题: 清晰的对话流程设置和完善映射的 workflow 可减少死胡同、重复提问和“我帮你转接”时刻。
  • 更少转交人工客服: 智能体能自然处理对话流程并遵循既定 workflow 时,首次尝试便能解决更多问题,而不会让客户因困惑而要求人工服务。

例如, eDreams ODIGEO 是全球最大的在线旅游平台之一。他们借助 ElevenAgents 在 5 种核心语言中部署了AI 智能体,在低延迟语音合成和更精准的意图识别等因素推动下,每通电话开始时便能更快识别需求,问题解决速度实现两位数提升,通话转接率实现两位数下降。这类成果还取决于对话设计以外的诸多变量,但也说明了良好对话式 AI 设计能带来什么。

对话式 AI 设计如何在 ElevenAgents 中实现

在 ElevenAgents 中,可以优化人设、声音、轮次交接、转接和延迟等决定智能体是否像真人的因素。以下介绍如何配置和优化每一项,让智能体在真实对话中表现出色。

人设和声音选择

人设决定客户的第一印象,而不匹配的人设会在对话开始前就削弱信任。对于亲切的零售品牌,过于刻板的人设会让客户在智能体说出有用内容前就产生质疑。从系统提示词开始塑造人设:先定义智能体的角色、个性和护栏

对于语音智能体,人设也必须通过声音体现。金融通话中,过于随意的声音会传达与文本中人设不匹配相同的信号,因此选择声音也是这项工作的一部分。可从以下方面着手:

  • 声音选择: 让声音与品牌、受众和主题相匹配。口音、性别和语调都有助于与特定来电者建立信任,并为对话定调。
  • 多语言支持: 为支持的每种语言选择专属声音,而不是在各市场默认使用同一种声音。同一声音勉强用于多种语言,往往至少会在其中一种语言中听起来像外国口音,削弱你希望建立的信任。

ElevenAgents 提供声音库中超过 11,000 种声音,可按口音、角色和使用场景搜索,因此通常无需从零开始。如果没有合适的声音,还有两种选择:从一小段音频样本克隆现有声音,或从零设计声音,通过文本提示词描述所需的年龄、口音、语调和语速。

对话流程设置

语音对话的时间要求最严格。与聊天不同,聊天中的停顿只是空白;通话中节奏中断会立刻被理解为无声或连接中断。让节奏恰到好处,是让语音智能体成为自然对话参与者的最重要因素,而这始于轮次交接模型本身。

ElevenLabs 的轮次交接模型以研究成果为基础,能够识别说话者是否真正说完,而非只是暂停。这让模型能判断智能体何时应回复,而不是根据固定延迟猜测。

此外,还可以调整以下设置,优化对话流程

  • 轮次超时 智能体在回复前静默等待的时长,避免客户还在思考时贸然插话,或客户说完后让其久等。
  • 软超时 智能体在处理暂停期间使用的简短填充语,例如“请稍候”或“我看看”,避免客户以为通话中断。避免使用承诺具体时间的填充语,例如“等一秒”,因为实际回复时间会变化。
  • 打断 当客户开始插话时,智能体是否停止说话。启用此功能可实现自然的来回交流。对于法律免责声明、安全说明及任何必须完整听完的内容,应禁用此功能。
  • 轮次响应积极度 客户停止说话后,智能体多快开始回复。“积极”适合重视快速响应的客服场景。“耐心”最适合收集客户信息,例如电话号码或邮箱地址,避免智能体在客户报到一半数字时打断。“普通”适合作为一般对话的默认设置。

这些细微调整会带来很大影响。即使只是略微改变超时时间,也可能决定智能体是显得专注,还是像在打断别人。

Workflow、转接设计和脚本

Workflow 是 ElevenAgents 中落实大量对话式 AI 设计的地方。它定义何时发生什么:决策点、升级路径、转接,以及原本需要智能体临场发挥的一切。

Workflow 与另外两个系统协同,让智能体更完善。系统提示词 定义智能体的核心行为,例如角色、语调,以及在问候或转接等关键节点会说什么、不会说什么。流程 则是针对单一且明确任务的更规范化选项,例如验证客户身份或引导退货。它不会根据客户的说法分支,而是无论对话如何进行,始终从头到尾遵循固定步骤。

开始构建智能体最简单的方法是使用预构建智能体模板。这些模板提供 workflow 和系统提示词的起点,让你进行微调而非从零构建。以下是可用来打造专属智能体的一些调整:

  • 决策映射: 精确映射智能体在每个决策点的操作,让整段对话从开场到解决都有明确定义。 子智能体节点 可让你在流程的特定节点调整系统提示词、模型甚至声音,使敏感的验证步骤能采用比通话前段闲聊更严格的护栏。
  • 升级触发条件: 为转交人工服务定义清晰触发条件,并内置于 workflow,而不是让智能体临场决定。例如,问题两次尝试仍未解决、客户要求主管,或交易敏感或金额较高而需要人工处理时,进行升级。
  • 转接上下文: 在系统提示词中,定义智能体转接前应收集的内容,例如订单 ID 或账户号码,以及触发转接的条件。然后将这些保存的信息映射到 转接工具配置,让信息自动传递,客户无需向人工客服重复说明。
  • 脚本化措辞: 在系统提示词中为关键时刻定义确切措辞。开场问候、错误消息、法律免责声明和升级转接,绝不应留给智能体临场发挥。与其让智能体在出错时猜测如何表达,不如使用“我目前无法访问该信息”这样的固定表述,更可靠。

Workflow 本身在 ElevenAgents 中以可视化图谱构建,每个决策点和升级触发条件都会映射为可直接查看和编辑的节点。

Conversational AI design. Workflow interface for managing agent transfers and meetings in ElevenLabs platform.

上线后,分析功能会将真实对话数据叠加到同一图谱上,让你准确看到客户在哪些环节卡住或流失,并无需猜测即可修复问题。

延迟和性能

延迟是决定互动是否像真人交流的最重要因素之一。即使对话其他方面都很顺利,缓慢回复也会迅速提醒客户:他们正在与机器交谈。

无论智能体运行于聊天还是语音渠道,处理管线的每个环节都会增加延迟。有些因素适用于两者,其他则仅在涉及语音时适用。

  • LLM: 每次选择模型,都是在成本、推理质量和速度之间取舍,合适的平衡取决于具体对话。FAQ 或预约确认等简单、高频互动,可使用更快、更轻量的模型且不影响体验。对于财务咨询或多步骤故障排除等更复杂的任务,通常值得选择推理能力更强的模型,即使回复会稍慢一些。
  • 知识库和 RAG: 每次知识库查询都会在智能体回复前增加一次往返。因此,精简且聚焦的知识库比需要广泛搜索的知识库响应更快。
  • 集成和工具调用: 每次外部工具调用,例如在 Salesforce 中查询订单或在日历中查看空闲时间,都会增加一次往返。编写清晰的工具描述,避免智能体犹豫该调用哪个工具,并且只调用对话实际需要的工具。
  • 地理位置和数据托管: 将 ElevenAgents 区域与数据托管位置匹配;对于电话部署,也要与电话服务商区域匹配,例如 Twilio、SIP 或其他服务商。如果智能体区域和通话网关区域位于地球两端,对话还没开始就会增加延迟。
  • 语音转文本(仅语音): 智能体进行推理前,Scribe 会先转录客户所说的内容。实时对话应使用实时版本(Scribe v2 Realtime),而非侧重准确性、速度较慢的批处理版本。
  • 轮次交接(仅语音): 决定智能体何时回复,上文已详细介绍。它本身也是延迟因素:如果模型迟迟无法识别轮次结束,处理管线的其他环节还没开始就已增加延迟。
  • 文本转语音和声音选择(仅语音): 默认声音、合成声音和 Instant Voice Clones 的响应速度快于 Professional Voice Clones。只有在额外保真度值得以延迟为代价时,才使用 Professional Voice Clones。

如需深入了解延迟,请参阅延迟优化最佳实践以及延迟的测量和报告方式

使用 ElevenAgents 设计第一个智能体

上述控制项体现了对 AI 智能体而言,对话式 AI 设计在实践中的含义。它们都原生集成于 ElevenAgents,可通过无代码控制台配置,让你构建能进行真实对话的智能体,而不只是正确回答问题。

对于希望获得实操支持的团队,ElevenLabs 的 前置部署工程师会直接与团队合作,确定范围、构建并上线可用于生产环境的智能体,随后持续微调其上线后的性能。

无论自行构建还是寻求支持,最快了解差异的方法就是亲自试用。现在就创建智能体,或联系销售团队

对话式 AI 设计常见问题

相关内容

用高质量 AI 音频创作