交互模型:打造自然的人机对话
- 发布时间
- 最近更新
任何试过在 AI 语音智能体说话时打断它的人,都知道未为人类对话打造的系统是什么感觉。节奏不对,声音与内容脱节,即使信息正确,互动仍让人觉得别扭:不像在和知识丰富的人交谈,更像是在操作碰巧会说话的软件。
这种不自然感源于结构性问题:许多语音 AI 系统是为处理轮次而非对话而设计的。它们一次只听取、处理并回应一轮交流。简单演示中这没问题,但对话一旦变得情绪化且难以预测,系统就会失效。
交互模型是能通过音频和文本进行实时沟通的 AI 系统。它不仅能感知说了什么,还能理解何时说出,以及当下需要怎样的情感回应。本文将介绍交互模型有何不同、为何对部署语音 AI 的企业至关重要,以及 ElevenLabs 如何朝这一方向发展。
摘要
- 大多数语音 AI 在真实对话中表现不佳,因为它们无法处理打断、沉默或跨轮次延续的上下文。
- ElevenLabs 的交互技术栈可处理打断、停顿和重叠语音,不会丢失上下文或破坏对话流畅性。
- ElevenLabs 正通过先进的级联架构、自研文本转语音(STT)和文本转语音(TTS),以及专为低延迟、自然双向对话优化的技术栈,迈向真正的交互模型。
为何大多数人类与 AI 的语音沟通不够自然
大多数语音 AI 将对话视为一系列离散的输入和输出:系统等待一段语音,将其转为文本,处理文本后再回复。这适用于命令与响应式互动,但真实对话不是清晰的文本交换序列,而是充满停顿和插话的持续往来。
忽略轮次之间的流动和跨轮次延续的上下文,会导致 3 个具体问题:
- 它会打断你,或让你等待:系统无法区分思考时的停顿和一次发言的结束,所以要么在你还没说完时插话,要么在你停下后沉默不语。你在句中整理思路时,它会打断你;你说完观点后,又得面对一段无声等待。
- 它一开口就无法响应:系统一开始回复,就不再倾听。即使你打断它来改变话题,它仍会继续回答你已经不关心的问题,因为它无法察觉任何变化。
- 它会逐渐忘记上下文:每个轮次都被独立处理,因此 5 轮前的上下文无法延续。你不得不重复自己说过的话,或者系统的回应就像对话才刚开始。
结果就是,对话在功能上可能正确,体验上却依然不对劲。
交互模型能做到传统语音 AI 做不到的事
传统语音 AI 一次处理一个轮次,交互模型则同时处理完整对话,关注正在说什么以及接下来需要做什么。功能上的区别在于,交互模型会响应当前交流的实际状态,而不只是最新输入。
交互模型具备:
- 实时响应:系统按对话速度响应,端到端周期可根据配置控制在 1 秒以内。
- 自然处理打断、沉默和重叠:它能区分思考停顿和一次发言结束,因此不会打断用户或留下无声空档。客户插话以改变方向时,它也能处理重叠语音,不会丢失上下文或中断对话。
- 全程对话连续性:系统不会在每个轮次重置上下文,而是延续对话历史,因此第 10 轮的回复会反映自第 1 轮以来发生的一切。
- 自适应表达:可根据正在处理的任务类型,设定声音风格变化,例如更平静、更直接或更安抚。
- 并行执行任务:系统可以一边检索信息、调用工具,一边继续说话,而不是在查询时陷入沉默。
最能检验交互模型的,是一通进展不顺的电话。以下录音中,一位客户因航班取消来电。他情绪紧张,需要快速解决问题。

智能体从客户用词中立即识别出紧迫感和挫败感。它调整语气,处理打断而不失去条理,并通过已连接的工具,为被取消的航班提供实际解决方案。最终,客户无需人工客服便解决了问题。
与如今常见的轮次式智能体相比,这些系统会等待每一次停顿,以中性基调回答,完全忽略客户的挫败感。几轮交流后,如果仍未回应来电者的真实感受,电话很可能需要转给人工客服,让客户比一开始更加沮丧。
ElevenLabs 如何构建交互模型
我们的对话管线采用先进的级联架构,而非融合架构。因此并非由一个模型处理所有环节,而是让每个阶段由专门的组件负责。
这种方法的优势在于,我们可以独立优化管线的每个阶段,无需重建整个系统,就能为任何组件替换更好的模型。而且这些组件均由我们自主研发,能够协同优化,彼此传递丰富上下文,而不只是数据。这让管线表现得像一段连贯对话,而不是一串独立工具。
级联模型结构

融合模型结构

图片:级联模型与融合模型
目前构成该管线的技术包括:
- Scribe v2 Realtime:我们的自研 STT 模型可在约 150 ms 内实时转写超过 90 种语言的语音,并能应对背景噪声、口音、打断,以及笑声和停顿等非语言事件。它也能处理领域专用词汇,涵盖医学术语和金融行话。
- 预测式轮次切换:该系统通过理解对话流动来决定何时说话、停顿或等待,而非依赖固定的静音阈值。我们对语音活动检测模型的改进,使其能更好过滤背景语音和简短回应,让轮次切换更加自然。
- Eleven v3 Conversational:我们最具表现力的 TTS 模型,专为实时双向对话打造。它能跨轮次延续对话的情绪温度,因此智能体在第 10 轮的表达会反映此前的一切,而不只是最新回复。
- Expressive Mode:基于 Eleven v3 Conversational 和轮次切换系统,Expressive Mode可控制智能体当下的声音表现:客户感到挫败时缓和情绪,困惑时给予安抚,需要清晰表达时则更直接。它还能识别表达标签,因此模型可根据 [laughs]、[whispers] 或 [sighs] 等提示,塑造特定时刻的表达方式。
- Flash v2.5:我们的低延迟 TTS 模型支持 32 种语言,可在 75 ms 内生成语音。当延迟是首要考量时,它能将响应时间保持在自然人类对话的节奏范围内。
- Speech Engine:连接整个技术栈的纽带层,通过 WebSocket 将服务器连接至我们的 ElevenAPI,每段对话使用一个连接。我们负责 STT 和 TTS,服务器运行 LLM,因此技术团队可以使用自己的模型,并将对话逻辑保留在自有基础设施中。
这些模型持续改进,新版本定期发布。每次发布都会通过更快的响应、更准确的情绪识别、更多语言和更流畅的表达,缩小与软件交谈和与人交谈之间的差距。
边思考边说话
交互模型并非每个部分都必须严格按顺序运行。ElevenAgents 可以在对话持续进行时继续在后台工作,而不是在提问和回答之间默认保持沉默。
几个核心系统协同工作,实现同时说话和思考:
- 并行工具调用:智能体仍在说话时,可以查询数据库、运行工具,或查询订单状态,因此检索不会让人感觉对话出现无声停顿。
- 软超时:如果 LLM 生成回复的时间超出预期,智能体会说出“让我想想”或“嗯……”等简短填充语,而非留下尴尬的沉默。软超时有助于维持自然对话节奏,并降低被打断的可能性。
- 忽略打断词:系统不采用固定静音阈值,而是尝试理解所说内容的含义,判断一轮发言是否真正结束。同样,“好的”或“嗯哼”等简短肯定语可以设置为直接通过,不会触发完整打断,这意味着来电者每次插话时,智能体都不会失去条理。
这些系统共同避免让智能体显得像是在缓冲或加载回复。它们构成精简的对话引擎,能像人一样自然填补空档,同时在后台处理信息和整理思路。
使用 ElevenLabs 时,对话实际如何进行
上述组件并非整齐地逐一运行,而是彼此重叠。以下以客服通话中一位来电者问“我的订单已经发货了吗,还是仍在处理中?”为例,说明 ElevenLabs 智能体如何处理。
- 来电者说话:音频通过 WebSocket 连接流式传输至 ElevenLabs,Scribe 开始实时转写,延迟约为语音后 150 ms。
- 系统理解对话流:Scribe 仍在转写时,预测式轮次切换已在评估来电者是否说完或仍在思考。结尾的“还是仍在处理中?”被理解为交接信号而非停顿,因此会触发下一步,而不会静默等待。
- LLM 整合上下文并回复:转写后的问题会连同对话历史、通过 RAG 从企业自有系统检索到的订单记录、通话前段的工具输出和系统提示词,一并发送给 LLM。它会综合分析这些信息,生成基于来电者实际订单的回复,而不是通用状态消息。
- Eleven v3合成回复:文本转为自然的音频。如果启用了 Expressive Mode,回复会带有符合当下情境的表达提示,让常规更新听起来轻松从容,而非平淡生硬。当延迟是首要考量时,Flash 可在 75 ms 内完成合成。
- 回复流式返回:合成尚未完成时,音频便开始播放,因此来电者会在其余内容仍在生成时听到回答开头。
- 循环重复:每个新轮次都会延续对话的语气、上下文和历史。
在这快速的过程中,对话感觉很自然。来电者不再需要适应机器:无需放慢语速、刻意咬字清晰,也无需等待提示音。他们只需像与人交谈一样自然说话。
在全业务范围部署自然流畅的语音智能体
这里介绍的一切现已投入生产,并非路线图上的计划。从级联架构到亚秒级管线,全球企业已经在使用 ElevenAgents,大规模处理真实客户对话。
这也涵盖受监管且高风险的环境,因为我们的智能体架构支持安全护栏、审计日志和合规控制。ElevenLabs 已获得 SOC 2 Type II、ISO 27001、HIPAA 和 PCI DSS Level 1 认证,并提供 Zero Retention Mode 和区域数据驻留,满足需要将数据保留在特定边界内的团队需求。
准备让智能体开始工作?你可以创建智能体,然后在控制台中开始构建;或者联系销售团队,讨论适配你所在环境的部署方案。
.webp&w=3840&q=80)
.webp&w=3840&q=80)

