跳至内容

级联与融合模型:架构如何决定语音智能体是否适合企业应用

发布时间
最近更新

收听收听本文

大多数人认为,语音智能体采用级联或融合架构构建。实际上,智能体的设计处于两者之间的连续谱上,通常会根据应用场景采用 5 种架构。

智能体的架构决定了它能否在生产环境中可靠运行、适应具体业务需求,并在对话中听起来自然。像 OpenAI Realtime 模型这样的融合架构,在简短交流中可能会显得极其逼真。但当团队需要落实合规护栏、排查失败响应,或在下个月有更强的 LLM 推出时进行替换,单一融合网络几乎无路可走。

在 ElevenLabs,我们采用先进的级联架构。通过用于语音识别、推理和语音生成的专用组件,实现高水平的智能性与可靠性。我们还加入上下文韵律、低延迟优化和智能轮次交接,让对话自然流畅。之所以这样构建,是因为合作的企业和政府机构需要既逼真自然、又能在生产环境中可靠处理复杂任务的智能体。 

本文将介绍 5 种主要架构、各自擅长和不足之处,以及我们如何看待关键工作流程中部署智能体所需的基础。

团队选择架构时会评估什么

团队通常会从 3 个方面提出问题。

能处理复杂任务吗?

  • 推理和模型灵活性:能否为应用场景选择最佳模型,包括当前最强的 LLM,并在出现更好选择时升级?
  • 智能体逻辑:能否定义和控制智能体遵循的对话流程、决策规则和升级路径?
  • 工具使用:该架构能否支持多步骤工具调用和外部系统集成?

听起来和感觉上像真人吗?

  • 韵律:智能体能否呈现自然的节奏、语调和情感?
  • 延迟:响应速度是否足以让人感觉是在对话?
  • 轮次交接:智能体知道何时说话、停顿或让出话轮吗?

能在生产环境中信赖它吗?

  • 可靠性:智能体的行为是否可预测且一致,还是会随时间偏离?
  • 护栏:该架构能否防范意外响应或对抗性用户?
  • 透明度:该架构会生成中间输出,还是一个黑箱?

级联与融合架构之间的取舍

级联架构由一系列专用组件串联而成:语音转文本(STT)、大语言模型和文本转语音(TTS)。每个阶段都可以独立优化、测试和升级。 

级联架构

Cascaded (Overview) Diagram

这种模块化正是级联架构成为大多数企业级智能体基础的原因。每个阶段都会产生可检查的输出:STT 与 LLM 之间、LLM 与 TTS 之间均有可读文本。可在文本层实施护栏,无需修改语音模型即可集成最新前沿 LLM;出现故障时,通常也能定位问题根源。

级联架构长期受到的批评是会丢失韵律线索。语音被转换为文本,语调、节奏和情感必须在输出端重建。虽然可以通过显式建模部分恢复这些线索,但不如融合方法自然。延迟和轮次交接等其他维度,通常可在两种方法中优化至相近的性能水平。

融合模型

Sequential Fused Diagram

融合架构采用截然不同的方法。识别、推理和生成都在单个多模态网络内部完成。音频输入,音频输出,中间没有可检查的层。

没有中间阶段既是优势,也是限制。融合架构能自然保留韵律线索,因为语音从未被拆解成文本。然而,它在实施护栏、替换单个组件或检查中间输出以进行调试方面的能力有限。针对行业术语微调 STT,或集成不同 LLM 以增强推理和工具调用的能力也受到限制。系统是一个网络,团队只能使用其原有的推理能力;如今这意味着较轻量的核心,无法在复杂任务上匹敌前沿 LLM。

5 种架构

1. 基础级联

Basic Cascaded Diagram

音频先转写,LLM 生成文本回复,再由 TTS 朗读。每个阶段都基于纯文本运行,因此一切都可见、可测试、可控。

其可信优势很明确:文本层护栏、确定性的对话流程和完整审计追踪。由于 LLM 是独立组件,可为智能体搭配推理或工具调用能力最强的任意前沿模型,并在更好的模型发布后立即升级。缺点在于对话质量:没有上下文 TTS,智能体虽然实用,却显得平淡。它无法适应情绪或产生韵律变化,适合播报账户余额,却不足以应对沮丧的客户。

示例应用场景:

  • 电信和公用事业领域的 IVR 替代方案
  • SaaS 产品引导中的 FAQ 处理
  • 预约确认、处方提醒和配送提醒等外呼通知;这类场景中一致性比亲切感更重要

2. 高级级联

Audio conversation flow: STT converts speech to text, LLM processes it, TTS converts text back to speech.

同样是模块化架构,但现在多个组件可利用更丰富的上下文。这正是我们在Expressive Mode中为ElevenAgents构建的能力。

Scribe v2 Realtime STT 模型可基于此前对话上下文,快速、准确地生成转写文本。LLM 根据文本指示 TTS 如何表达语音,而不只是说什么,例如“令人安心地”“着重强调地”“带着紧迫感地”,并在整个对话中动态调整语气。轮次交接系统利用相同信号,让智能体判断何时回应、何时让出话轮。语音模型共置于同一技术栈内,组件之间无需网络跳转,因此延迟保持很低。

该架构保留了基础级联的所有优势:完全透明、文本层护栏、组件可替换、领域微调,以及可使用最强的工具调用和推理模型。它还显著改善了韵律、延迟和轮次交接。团队可在新的前沿 LLM 发布当周集成它,也可针对医疗保健语音转文本中的专业术语进行微调,而无需重建其他组件。

示例应用场景:

  • 金融服务客户支持:在有争议的扣费通话中,以富有同理心的表达配合严格合规护栏和完整交互日志
  • 医疗接待员:以恰当的紧迫程度分流患者来电,采用符合 HIPAA 的流程,并针对医学术语进行领域化语音识别
  • 销售助手:在遵循结构化行动指南并将更新同步至 CRM 的同时,保持亲切、有说服力的语气

3. 混合级联与融合

Hybrid Cascaded Diagram

有些架构会将输入语音的声学特征(发音、情感、语气)直接以嵌入形式输入 LLM,而非先转换为文本。TTS 仍保持模块化。

这让 LLM 能获得更丰富的信息,了解一句话是如何说出来的,而不只是说了什么,这对特定应用很有价值。融合的 ASR+LLM 模块比清晰的文本交接更难审计,因为中间表示是嵌入,而非人类可读的内容。LLM 也不再易于替换,因此推理和工具调用能力受限于构建该融合模块时所采用的模型。

示例应用场景:

  • 语言学习和发音辅导:听出学生如何说话,与了解他们说了什么同样重要
  • 对语气敏感、复杂度较低的支持场景:识别沮丧情绪很重要,但任务本身较简单。

4. 顺序融合

Sequential Fused Diagram

单个多模态模型一次完成识别、推理和生成,每次处理一个话轮。

韵律表现可能很强。由于语音从未被拆解为文本,模型能自然保留语速、语调和情感线索。简短对话听起来会非常流畅。

但没有文本层,实施护栏的能力有限;可供调试的中间输出有限;替换更优 LLM 或针对领域微调 STT 的灵活性也有限。其推理核心通常比前沿 LLM 更轻量,因此复杂工具调用和多步骤任务表现较弱。当任务需要解决复杂问题时,单有韵律并不够。

示例应用场景:

  • 个人陪伴应用、娱乐聊天机器人,以及表现力驱动互动、合规要求极低的应用。

5. 双工融合

Duplex Fused Diagram

输入和输出同时处理,模型一边聆听一边说话。这可让简短交流显得格外自然,具有真实的语音重叠和流畅的话轮转换。

它也是最难控制的架构,护栏极难实施,串音还会带来不可预测的错误。检查、记录或调试都极其困难;系统大多是封闭的,组件替换、领域微调或定制的选择极少。由于同时处理为复杂逻辑留下的容量更少,推理和工具使用比顺序融合模型受到更大限制。而让短暂交流听起来自然的同一套并行处理方式,也会使长对话变得不稳定。


示例应用场景:

  • 实验性陪伴应用、社交语音平台和可接受不可预测行为的研究演示。

为应用场景选择合适架构

Cascaded-vs-fused-model-chart (recap of the above)

合适的架构取决于具体应用的需求。如果构建的是以自然语音为核心功能的体验,并且愿意在前沿推理、护栏和透明度上作出妥协,融合架构确实具备优势。融合模型在韵律上领先,但高级级联系统每个季度都在不断接近;受架构层面的限制,融合模型在复杂推理或可信度方面尚未取得实质进展。

对大多数企业和政府机构而言,最佳架构应当既音质出色,又具备能力、可定制、值得信赖,并可大规模部署。因此,我们选择采用先进级联架构构建ElevenAgents,并投入开发Expressive Mode以及一流、协同优化的语音转文本文本转语音模型。这让团队能够构建智能体,兼具高水平智能性、可靠性和控制力,以及自然、接近真人的语音。

随着 AI 智能体持续扩展到客户支持、教育、个人助理等更多领域,能够成功的智能体将建立在适合其具体应用的架构之上。

相关内容

用高质量 AI 音频创作