对话式 AI 设计:如何打造更自然的人机体验
- 发布时间
- 最近更新
对话式 AI 设计过去指的是构建决策树。早期聊天机器人和 IVR 菜单依赖严格的预设分支:按 1 处理账单问题,说“是”或“否”,并希望客户的问题正好符合你预设的某条路径。只有当对话始终处于已构建的范围内时,这种模式才有效。
AI 智能体消除了这一限制。它们现在可以实时理解对话、调用知识库和工具,并记住已说过的内容,因此不再受固定脚本限制。
但这一变化并未消除对话式 AI 设计的必要性,反而提高了要求。没有严格脚本可依赖,智能体的人设、workflow 和决策点必须定义得足够完善,才能应对开放式实时对话,而非预设对话。
本指南将介绍对聊天和语音智能体而言,对话式 AI 设计的实际含义、它为何影响团队已在考核的指标,以及如何优化以获得更自然的体验。做好这些,就能部署能与客户建立连接、提供更快更好服务的 AI 智能体。
摘要
- 对话式 AI 设计是指对 AI 智能体的沟通方式进行结构化设计和优化,让对话更自然。
- 语音 AI 对问题的容忍度低于文本,因为聊天界面中不易察觉的语音、延迟和时机问题,会让语音对话显得机械。
- ElevenAgents 通过一系列功能,实现更像真人的 AI 语音和聊天智能体。你可以控制声音、人设和对话流程,并针对各渠道优化延迟。
什么是对话式 AI 设计?
对话式 AI 设计是一项 UX 实践,用于配置 AI 智能体的行为方式。它涵盖人设、护栏、workflow 和所调用的知识库等,让对话体验与产品的其他部分一样完善。
不过,这类配置在不同渠道中并不相同。智能体可通过一套配置运行在聊天、语音或 SMS 等多个渠道。每种渠道都有自身限制,而语音的限制最严格。当语音是智能体的一个渠道时,它必须选择并输出合适的声音,实时管理语速和轮次交接,并在停顿被误认为通话中断前给出回复。这些在聊天中并非必需:回复略慢或不够完美,通常不会破坏互动。
为聊天智能体实施对话式 AI 设计时,需要考虑以下因素,以及语音额外增加的要求。
客户不会有意识地逐项评估这些因素。他们只会察觉哪里不对劲,而这种感觉足以削弱对整个智能体的信任,进而影响你部署它原本想实现的目标。
为什么对话式 AI 设计对良好用户体验很重要
从轮次交接、延迟到人设,上述每项因素都会影响客户在关键时刻对品牌的看法:他们可能成为拥护者,也可能成为批评者。这种看法会直接反映在团队的考核指标中。
- 更高的满意度和解决率: 智能体及时回复且不会突兀打断时,客户对互动的评价更高。
- 减少放弃率: 客户退出对话的原因不只是等待过久。无论是通话中尴尬的停顿,还是聊天中生硬、不符合品牌调性的回复,只要交付体验不符合预期,都可能让他们想结束对话。
- 更快解决问题: 清晰的对话流程设置和完善映射的 workflow 可减少死胡同、重复提问和“我帮你转接”时刻。
- 更少转交人工客服: 智能体能自然处理对话流程并遵循既定 workflow 时,首次尝试便能解决更多问题,而不会让客户因困惑而要求人工服务。
例如, eDreams ODIGEO 是全球最大的在线旅游平台之一。他们借助 ElevenAgents 在 5 种核心语言中部署了AI 智能体,在低延迟语音合成和更精准的意图识别等因素推动下,每通电话开始时便能更快识别需求,问题解决速度实现两位数提升,通话转接率实现两位数下降。这类成果还取决于对话设计以外的诸多变量,但也说明了良好对话式 AI 设计能带来什么。
对话式 AI 设计如何在 ElevenAgents 中实现
在 ElevenAgents 中,可以优化人设、声音、轮次交接、转接和延迟等决定智能体是否像真人的因素。以下介绍如何配置和优化每一项,让智能体在真实对话中表现出色。
人设和声音选择
人设决定客户的第一印象,而不匹配的人设会在对话开始前就削弱信任。对于亲切的零售品牌,过于刻板的人设会让客户在智能体说出有用内容前就产生质疑。从系统提示词开始塑造人设:先定义智能体的角色、个性和护栏。
对于语音智能体,人设也必须通过声音体现。金融通话中,过于随意的声音会传达与文本中人设不匹配相同的信号,因此选择声音也是这项工作的一部分。可从以下方面着手:
- 声音选择: 让声音与品牌、受众和主题相匹配。口音、性别和语调都有助于与特定来电者建立信任,并为对话定调。
- 多语言支持: 为支持的每种语言选择专属声音,而不是在各市场默认使用同一种声音。同一声音勉强用于多种语言,往往至少会在其中一种语言中听起来像外国口音,削弱你希望建立的信任。
ElevenAgents 提供声音库中超过 11,000 种声音,可按口音、角色和使用场景搜索,因此通常无需从零开始。如果没有合适的声音,还有两种选择:从一小段音频样本克隆现有声音,或从零设计声音,通过文本提示词描述所需的年龄、口音、语调和语速。
对话流程设置
语音对话的时间要求最严格。与聊天不同,聊天中的停顿只是空白;通话中节奏中断会立刻被理解为无声或连接中断。让节奏恰到好处,是让语音智能体成为自然对话参与者的最重要因素,而这始于轮次交接模型本身。
ElevenLabs 的轮次交接模型以研究成果为基础,能够识别说话者是否真正说完,而非只是暂停。这让模型能判断智能体何时应回复,而不是根据固定延迟猜测。
此外,还可以调整以下设置,优化对话流程:
- 轮次超时: 智能体在回复前静默等待的时长,避免客户还在思考时贸然插话,或客户说完后让其久等。
- 软超时: 智能体在处理暂停期间使用的简短填充语,例如“请稍候”或“我看看”,避免客户以为通话中断。避免使用承诺具体时间的填充语,例如“等一秒”,因为实际回复时间会变化。
- 打断: 当客户开始插话时,智能体是否停止说话。启用此功能可实现自然的来回交流。对于法律免责声明、安全说明及任何必须完整听完的内容,应禁用此功能。
- 轮次响应积极度: 客户停止说话后,智能体多快开始回复。“积极”适合重视快速响应的客服场景。“耐心”最适合收集客户信息,例如电话号码或邮箱地址,避免智能体在客户报到一半数字时打断。“普通”适合作为一般对话的默认设置。
这些细微调整会带来很大影响。即使只是略微改变超时时间,也可能决定智能体是显得专注,还是像在打断别人。
Workflow、转接设计和脚本
Workflow 是 ElevenAgents 中落实大量对话式 AI 设计的地方。它定义何时发生什么:决策点、升级路径、转接,以及原本需要智能体临场发挥的一切。
Workflow 与另外两个系统协同,让智能体更完善。系统提示词 定义智能体的核心行为,例如角色、语调,以及在问候或转接等关键节点会说什么、不会说什么。流程 则是针对单一且明确任务的更规范化选项,例如验证客户身份或引导退货。它不会根据客户的说法分支,而是无论对话如何进行,始终从头到尾遵循固定步骤。
开始构建智能体最简单的方法是使用预构建智能体模板。这些模板提供 workflow 和系统提示词的起点,让你进行微调而非从零构建。以下是可用来打造专属智能体的一些调整:
- 决策映射: 精确映射智能体在每个决策点的操作,让整段对话从开场到解决都有明确定义。 子智能体节点 可让你在流程的特定节点调整系统提示词、模型甚至声音,使敏感的验证步骤能采用比通话前段闲聊更严格的护栏。
- 升级触发条件: 为转交人工服务定义清晰触发条件,并内置于 workflow,而不是让智能体临场决定。例如,问题两次尝试仍未解决、客户要求主管,或交易敏感或金额较高而需要人工处理时,进行升级。
- 转接上下文: 在系统提示词中,定义智能体转接前应收集的内容,例如订单 ID 或账户号码,以及触发转接的条件。然后将这些保存的信息映射到 转接工具配置,让信息自动传递,客户无需向人工客服重复说明。
- 脚本化措辞: 在系统提示词中为关键时刻定义确切措辞。开场问候、错误消息、法律免责声明和升级转接,绝不应留给智能体临场发挥。与其让智能体在出错时猜测如何表达,不如使用“我目前无法访问该信息”这样的固定表述,更可靠。
Workflow 本身在 ElevenAgents 中以可视化图谱构建,每个决策点和升级触发条件都会映射为可直接查看和编辑的节点。

上线后,分析功能会将真实对话数据叠加到同一图谱上,让你准确看到客户在哪些环节卡住或流失,并无需猜测即可修复问题。
延迟和性能
延迟是决定互动是否像真人交流的最重要因素之一。即使对话其他方面都很顺利,缓慢回复也会迅速提醒客户:他们正在与机器交谈。
无论智能体运行于聊天还是语音渠道,处理管线的每个环节都会增加延迟。有些因素适用于两者,其他则仅在涉及语音时适用。
- LLM: 每次选择模型,都是在成本、推理质量和速度之间取舍,合适的平衡取决于具体对话。FAQ 或预约确认等简单、高频互动,可使用更快、更轻量的模型且不影响体验。对于财务咨询或多步骤故障排除等更复杂的任务,通常值得选择推理能力更强的模型,即使回复会稍慢一些。
- 知识库和 RAG: 每次知识库查询都会在智能体回复前增加一次往返。因此,精简且聚焦的知识库比需要广泛搜索的知识库响应更快。
- 集成和工具调用: 每次外部工具调用,例如在 Salesforce 中查询订单或在日历中查看空闲时间,都会增加一次往返。编写清晰的工具描述,避免智能体犹豫该调用哪个工具,并且只调用对话实际需要的工具。
- 地理位置和数据托管: 将 ElevenAgents 区域与数据托管位置匹配;对于电话部署,也要与电话服务商区域匹配,例如 Twilio、SIP 或其他服务商。如果智能体区域和通话网关区域位于地球两端,对话还没开始就会增加延迟。
- 语音转文本(仅语音): 智能体进行推理前,Scribe 会先转录客户所说的内容。实时对话应使用实时版本(Scribe v2 Realtime),而非侧重准确性、速度较慢的批处理版本。
- 轮次交接(仅语音): 决定智能体何时回复,上文已详细介绍。它本身也是延迟因素:如果模型迟迟无法识别轮次结束,处理管线的其他环节还没开始就已增加延迟。
- 文本转语音和声音选择(仅语音): 默认声音、合成声音和 Instant Voice Clones 的响应速度快于 Professional Voice Clones。只有在额外保真度值得以延迟为代价时,才使用 Professional Voice Clones。
如需深入了解延迟,请参阅延迟优化最佳实践以及延迟的测量和报告方式。
使用 ElevenAgents 设计第一个智能体
上述控制项体现了对 AI 智能体而言,对话式 AI 设计在实践中的含义。它们都原生集成于 ElevenAgents,可通过无代码控制台配置,让你构建能进行真实对话的智能体,而不只是正确回答问题。
对于希望获得实操支持的团队,ElevenLabs 的 前置部署工程师会直接与团队合作,确定范围、构建并上线可用于生产环境的智能体,随后持续微调其上线后的性能。
无论自行构建还是寻求支持,最快了解差异的方法就是亲自试用。现在就创建智能体,或联系销售团队。



