网络研讨会回顾:打造自然的 AI 智能体
- 发布时间
- 最近更新
收听收听本文
大多数团队都希望打造听起来很自然的智能体。
但很多团队遇到的问题是:智能体能完成任务,却不理解上下文、紧迫性或情绪。一旦来电者察觉到这一点,信任感和互动质量都会下降。
在我们最近的直播研讨会:打造听起来很自然的 AI 智能体中,Luigi Sambuy(前线部署工程团队)讲解了机械式智能体与真正像人一样的智能体之间的差别。
听起来自然,为何比想象中更难
大多数部署智能体的团队已经解决了准确性问题:智能体能给出正确答案、预订正确的餐桌、取消正确的航班。
更难的是让表达方式恰到好处。
无论回答多么正确,如果智能体不能呼应来电者的情绪、捕捉紧迫感,又总以同样平淡的节奏回答每个问题,听起来始终会很像机器。客户不只希望问题得到解决,也希望在过程中感到自己被倾听。
自然语音智能体的 4 个特征
- 节奏与流畅度:采用自然的语速、停顿和速度变化,而非单调朗读
- 情绪呼应:面对沮丧的来电者表达关切,面对好消息传递温暖
- 上下文:结合用户历史、业务系统以及文化和地区线索,避免泛泛而谈
- 身份特征:为品牌量身打造音色,而非使用现成默认音色
演示:自然语音智能体实战
场景:一位顾客致电 Rosette Restaurant,想更改预订。这天是他们结婚 5 周年纪念日,而且快迟到了。
演示内容:
- 智能体以温暖的方式开场,先祝贺周年纪念日,再处理其他事项
- 它发现顾客所述时间与实际预订时间略有不符,于是先澄清,而不是猜测
- 它将预订改至晚上 9 点,并主动为这个特别日子提供靠窗座位,无需顾客提出
- 通话中,智能体使用自然的停顿、语气词,并根据情境调整语气——令人安心、温暖从容
为何重要:这些效果并非来自不同的模型或更强大的平台,而是来自提示词。系统提示词允许智能体在句中自我修正、在“查找信息”时自然地停顿,并调整情绪语气以呼应来电者——如今,任何基于平台构建产品的团队都可以使用这些技巧。
打造自然智能体的 7 个关键要素
- 情绪标签:可通过 v3 对话模型的表现力模式使用,是实现语气变化最关键的功能
- 背景噪音:办公环境声、城市声音或键盘敲击声,营造更熟悉、更有人情味的语境
- 系统提示词中的语气:大部分差异其实都在这里
- 积极程度设置(积极/常规/耐心):应与互动所需时间相匹配
- 发音词典/关键词:用于名称、品牌和外来词,避免智能体误读。
- 输出设置:有些团队会特意加入背景电话铃声,而非使用纯净音频,因为从传统呼叫中心迁移过来的客户已习惯略显闷的音色
- 声音设计或克隆:打造完全定制、符合品牌调性的音色,而非从现成音色中挑选。声音设计支持通过提示词描述特定需求(例如:“一位 30 多岁、听起来像通过耳机说话的男性”)。语音克隆涵盖即时克隆(约 30 秒音频)到专业克隆(更多素材、更高保真度)。
自然语音智能体最佳实践
直接在系统提示词中写明语气。这是平淡的智能体与自然的智能体之间大部分差异所在。明确允许智能体在句中自我修正(“人们真实说话的方式”)、在查找信息时自然停顿,并在面对严肃内容后先留出片刻安静再回应。
让情绪标签符合当下情境。在严肃或有风险的时刻使用“兴奋”标签并不合适。应有意识地将标签放在实际会出现的对话位置,并随通话进展根据来电者情绪调整(例如,对焦虑的来电者保持冷静、给予安慰;对赶时间的人则快速而温暖)。
有意识地设置积极程度。积极模式适合简洁、高信息量的交流;当对方需要时间查找文件或号码时,耐心模式更合适。所有场景都默认使用积极模式,会让智能体显得咄咄逼人,而不够自然。
为每个节点选择合适的 LLM。简单路由步骤使用更轻量、更快的模型;需要实际决策的节点则使用能力更强的模型。
将感知延迟视为“自然”的一部分。除了选择模型外,推测式轮次生成(来电者还在说话时,模型就开始组织回复)和软超时语气词,都能缩短人们对停顿时长的感受,即使实际响应时间没有改变。
本地化,而非单纯翻译。选择真正以目标语言训练的音色,使用发音词典;对于单语言场景,也可以考虑直接用该语言编写提示词,以提升表现。当跨语言的快速低延迟比表现力范围更重要时,Multilingual v2 仍是可靠选择。
监控智能体。使用模拟测试,无需真实通话即可验证智能体;通过评估标准对通话后结果进行通过/不通过评分,并逐轮进行情感分析,准确找出智能体在哪个对话环节使用了不恰当的语气,然后据此优化提示词。
观看完整课程
观看完整网络研讨会点击此处。





