跳至内容

交互模型:打造自然的人机对话

发布时间
最近更新

收听收听本文

凡是试过在 AI 语音智能体说到一半时打断它的人,都知道系统并非为人类对话而设计是什么感觉。节奏不对,声音与内容脱节,即使信息正确,互动还是不自然:不像在和知识渊博的人交谈,更像在操作碰巧会说话的软件。

这种不自然感源于架构:许多语音 AI 系统是为处理轮次而非对话而构建的。它们一次只监听、处理和响应一轮交流。简单演示时可行,但对话一旦变得情绪化且难以预测,就会失效。

交互模型是一类可通过音频和文本实时沟通的 AI 系统。它不仅理解说了什么,还能感知何时说出,以及当下需要怎样的情绪回应。本文将介绍交互模型有何不同、为何对部署语音 AI 的企业至关重要,以及 ElevenLabs 如何朝这一方向构建。

摘要

  • 多数语音 AI 在真实对话中会失效,因为它无法处理打断、沉默,或跨轮次延续的上下文。
  • ElevenLabs 的交互技术栈专为处理打断、停顿和重叠说话而设计,不会丢失上下文或打断对话节奏。
  • ElevenLabs 正通过先进的级联架构、自研 文本转语音识别(STT)和 文本转语音(TTS),以及针对低延迟和自然双向对话优化的技术栈,构建真正的交互模型。

为什么多数人机语音交流不够自然

多数语音 AI 将对话视为一系列离散的输入和输出:系统等待一段语音,将其转换为文本,处理文本后再回复。这适用于一问一答的交互,但真实对话不是整齐的文本交流序列,而是充满停顿和插话的持续往来。

去除轮次之间的流动感和跨轮次延续的上下文,会导致 3 个具体问题:

  • 它会打断你,或让你等待:系统无法区分思考时的停顿和一轮对话结束,因此要么在你还没说完时插话,要么在你停下后一直沉默。你在句中整理思路,就会被打断;你讲完重点,又得面对一段空白等待。
  • 它一开口就无法回应:系统一开始回答,就不再监听。如果你打断它并改变话题,它仍会继续回答你已经不关心的问题,因为它无法识别变化。
  • 它会逐渐遗忘:每轮对话都被独立处理,5 轮之前的上下文无法延续。结果就是你不得不重复说明,或系统的反应仿佛对话才刚开始。

最终,对话即使功能上正确,感觉依然不对。

交互模型能做到而传统语音 AI 做不到的事

传统语音 AI 一次处理一轮对话,交互模型则同时运行完整对话,关注正在说什么以及接下来需要做什么。其功能差异在于,交互模型会响应当前交流的实际状态,而非只针对最新输入作答。

交互模型具备:

  • 实时响应:系统可按对话速度响应,端到端周期可根据配置控制在 1 秒以内。
  • 自然处理打断、沉默和重叠:它能区分思考时的停顿和一轮对话结束,不会打断他人或留下空白。当客户插话改变方向时,它也能处理重叠语音,不丢失上下文或让对话中断。
  • 全程上下文连续性:系统不会在每轮对话重置上下文,而是持续保留对话历史,因此第 10 轮的回答会反映从第一轮至今发生的一切。
  • 自适应表达:可根据执行的任务类型,对声音进行编程调整,例如更平静、更直接或更安抚。
  • 并行执行任务:系统可同时检索信息、调用工具并持续说话,不会在查找信息时陷入沉默。

检验交互模型的场景,是一通进展不顺的电话。下方录音中,一位客户致电咨询航班取消。他们情绪紧张,需要尽快解决问题。

mark screenshot w caption space

智能体会立刻从客户的用词中识别其急切与沮丧。它会调整语气,在不失去当前进度的情况下处理打断,并利用已连接的工具,为取消的航班提供实际解决方案。最终,客户无需人工客服便获得了解决方案。

与如今常见的轮次式智能体相比,这些系统会等待每次停顿,以中性基调回答,完全忽略客户的沮丧情绪。几轮交流后仍无法回应来电者的真实感受,这通电话很可能需要转交人工处理,让客户比一开始更加沮丧。

ElevenLabs 如何构建交互模型

我们的对话管线采用 先进的级联架构,而非融合架构。因此,并非由一个模型处理所有环节,而是每个阶段各由专门组件负责。

这种方法的优势在于,我们可以独立优化管线中的每个阶段,无需重建整个系统,就能为任一组件替换更好的模型。由于这些组件均为自研,它们经过协同优化,彼此传递的不只是数据,还有丰富的上下文。这让管线依然能像一场连贯对话般运行,而不是一串彼此独立的工具。

级联模型结构

Flowchart of an audio processing system: Audio, Speech-to-Text, LLM, Text-to-Speech, Audio in an interaction model

融合模型结构

Audio processing flowchart: Audio > Combined System (STT, LLM, TTS, Tools) > Audio.

图片:级联模型与融合模型

当前管线由以下技术构成:

  • Scribe v2 Realtime:我们的 自研 STT 模型可在 90 多种语言中以约 150 ms 的延迟转录语音,能应对背景噪声、口音、打断,以及笑声、停顿等非语言事件。它也专为处理领域专用词汇而打造,从医学术语到金融行话均可应对。
  • 预测式轮次管理:该系统通过理解对话流来判断何时说话、停顿或等待,而不是依赖固定的静音阈值。我们对语音活动检测模型的改进,使其能更好过滤背景语音和简短回应,让轮次衔接更自然。
  • Eleven v3 Conversational:我们最具 表现力的 TTS 模型,专为实时双向对话打造。它会跨轮次延续对话的情绪基调,因此智能体在第 10 轮的表达会反映此前发生的一切,而不只基于最新回复。
  • Expressive Mode:基于 Eleven v3 Conversational 和轮次管理系统,Expressive Mode可控制智能体当下的表达方式:客户沮丧时缓和情绪,困惑时给予安抚,需要清晰说明时直接表达。它还可读取表达标签,让模型根据 [laughs]、[whispers] 或 [sighs] 等提示塑造特定的表达瞬间。
  • Flash v2.5:我们的低延迟 TTS 模型支持 32 种语言,可在 75 ms 内生成语音。当延迟最重要时,它能将响应时间控制在人类自然对话节奏的范围内。
  • Speech Engine连接整个技术栈的基础层,通过 WebSocket 将服务器连接至我们的 ElevenAPI,每次对话一个连接。我们负责 STT 和 TTS,服务器则运行 LLM,因此技术团队可接入自有模型,并将对话逻辑保留在自己的基础设施中。

这些模型持续改进,新版本也定期发布。每次更新都会进一步缩小与软件交谈和与人交谈之间的差距,带来更快响应、更敏锐的情绪识别、更多语言和更流畅的表达。

边思考边说话

交互模型并非每个部分都必须严格按顺序运行。ElevenAgents 可在对话继续时于后台持续工作,而不是在提问和回答之间默认沉默。

多个核心系统协同工作,实现同时说话和思考:

  • 并行工具调用:智能体可查询数据库、运行工具或在说话时查询订单状态,让信息检索不会成为对话中的空白停顿。
  • 软超时:如果 LLM 生成回复的时间超出预期,智能体会说一句简短的填充语,例如“让我想想”或“嗯”,而不是留下尴尬的沉默。软超时有助于保持自然的对话节奏,并降低被打断的可能性。
  • 忽略打断词:系统不使用固定静音阈值,而是尝试理解所说内容的含义,以判断一轮对话是否真正结束。同样,也可配置让“好的”或“嗯哼”等简短肯定回应直接通过,而不触发完整打断,这样来电者每次插话时,智能体都不会丢失进度。

这些系统共同协作,避免智能体给人缓冲或加载回复的感觉。它们构成精简的对话引擎,能像人一样自然填补空当,同时在后台处理信息并组织思路。

使用 ElevenLabs 时,对话实际如何进行

上述组件并不会整齐地依次运行,而是相互重叠。以下是 ElevenLabs 智能体在客服通话中,如何处理来电者中途询问“我的订单已经发货了,还是仍在处理中?”的过程。

  1. 来电者说话:音频通过 WebSocket 连接流式传输至 ElevenLabs,Scribe 开始实时转录,延迟约为语音后的 150 ms。
  2. 系统理解对话流:Scribe 仍在转录时,预测式轮次管理已在判断来电者是否说完,还是仍在思考中。句尾的“还是仍在处理中?”被识别为交接信号而非停顿,因此会触发下一步,而不是等待沉默。
  3. LLM 整合上下文并回复:转录后的问题会连同对话历史、通过企业自有系统经 RAG 检索到的订单记录、此前通话中的工具输出和系统提示词,一并发送给 LLM。它会综合推理这些信息,生成基于来电者实际订单的回复,而不是通用状态消息。
  4. Eleven v3合成回复:文本将转为自然的语音。如果启用了 Expressive Mode,回复会包含符合当下情境的表达提示,因此常规更新听起来会轻松从容,而非平淡。当延迟最重要时,Flash 可在 75 ms 内完成合成。
  5. 回复流式返回:合成尚未完成,音频就已开始播放,因此来电者能在其余内容仍在生成时听到回答开头。
  6. 循环重复:每一轮新对话都会延续此前的语气、上下文和历史。

在这个快速过程中,对话感觉很自然。来电者不再需要适应机器:他们无需放慢速度、过度清晰地咬字,或等待提示音,只会像与人交谈一样自然说话。

在整个企业部署自然语音智能体

这里介绍的一切如今都已投入生产,而非未来路线图。从级联架构到亚秒级管线,全球企业已在使用 ElevenAgents大规模处理真实客户对话。

这也涵盖受监管、高风险的环境,因为我们的智能体架构支持防护机制、审计日志和合规控制。ElevenLabs 已获得 SOC 2 Type II、ISO 27001、HIPAA 和 PCI DSS Level 1 认证,并提供 Zero Retention Mode 和区域数据驻留,满足需要将数据保留在特定边界内的团队需求。

准备让智能体开始工作?你可以创建智能体并在控制台中开始构建,或联系销售团队,咨询适合你环境的部署方案。

交互模型常见问题

相关内容

用高质量 AI 音频创作