Ir al contenido

Modelos en Cascada vs Fusionados: Cómo la arquitectura determina si tu agente de voz está listo para empresas

Publicado
Última actualización

EscucharEscucha este artículo

La mayoría de la gente piensa que los agentes de voz se crean con una arquitectura en cascada o fusionada. En la práctica, los agentes se diseñan en un espectro entre ambas, y suelen utilizarse cinco arquitecturas según la aplicación.

La arquitectura del agente determina su capacidad para comportarse de forma fiable en producción, adaptarse a requisitos empresariales específicos y sonar natural al conversar. Una arquitectura basada en fusión, como el modelo Realtime de OpenAI, puede sonar impresionantemente realista en intercambios breves. Pero cuando los equipos necesitan aplicar medidas de cumplimiento normativo, depurar una respuesta fallida o cambiar a un LLM más potente cuando salga uno el mes que viene, una única red fusionada ofrece pocas alternativas.

En ElevenLabs utilizamos una arquitectura avanzada basada en cascada. Aprovechamos componentes especializados para el reconocimiento de voz, el razonamiento y la generación de voz, lo que proporciona altos niveles de inteligencia y fiabilidad. Incorporamos prosodia contextual, optimización de baja latencia y gestión inteligente de turnos para que las conversaciones fluyan de forma natural. La creamos así porque las empresas y organismos públicos con los que trabajamos necesitan agentes que suenen realistas y sean fiables en producción para tareas complejas. 

En este artículo repasamos las cinco arquitecturas principales, para qué sirven, dónde presentan limitaciones y cómo entendemos la base de los agentes implementados en flujos de trabajo críticos.

Qué evalúan los equipos al elegir una arquitectura

Las preguntas que se plantean los equipos suelen agruparse en tres categorías.

¿Puede gestionar tareas complejas?

  • Razonamiento y flexibilidad de modelos: ¿Puedes elegir los mejores modelos para tu caso de uso, incluidos los LLM más potentes disponibles, y actualizarlos cuando haya opciones mejores?
  • Lógica del agente: ¿Puedes definir y controlar los flujos de conversación, las reglas de decisión y las vías de escalado que sigue tu agente?
  • Uso de herramientas: ¿Puede la arquitectura admitir llamadas a herramientas de varios pasos e integraciones con sistemas externos?

¿Sonará y se sentirá humano?

  • Prosodia: ¿El agente ofrece un ritmo, una entonación y un tono emocional naturales?
  • Latencia: ¿Las respuestas son lo bastante rápidas como para que la conversación resulte natural?
  • Gestión de turnos: ¿Sabe el agente cuándo hablar, hacer una pausa o ceder el turno?

¿Puedo confiar en él en producción?

  • Fiabilidad: ¿El agente se comporta de forma predecible y coherente, o se desvía con el tiempo?
  • Medidas de seguridad: ¿Puede la arquitectura aplicar protecciones frente a respuestas no deseadas o usuarios adversarios?
  • Transparencia: ¿La arquitectura genera resultados intermedios o es una caja negra?

Las ventajas e inconvenientes de las arquitecturas en cascada y fusionadas

Las arquitecturas basadas en cascada se construyen encadenando componentes especializados: Voz a Texto (STT), un modelo de lenguaje de gran tamaño y Texto a Voz (TTS). Cada etapa puede optimizarse, probarse y actualizarse de forma independiente. 

Arquitectura en cascada

Cascaded (Overview) Diagram

Esta modularidad es lo que convierte a las arquitecturas en cascada en la base de la mayoría de los agentes de nivel empresarial. Cada etapa genera resultados que se pueden inspeccionar: texto legible entre STT y el LLM, y entre el LLM y TTS. Las medidas de seguridad pueden aplicarse en la capa de texto, el LLM de frontera más reciente puede integrarse sin modificar los modelos de voz y, cuando algo falla, por lo general es posible identificar el origen del error.

La crítica histórica a las arquitecturas en cascada es que pierden señales prosódicas. La voz se reduce a texto, y la entonación, el ritmo y la emoción deben reconstruirse en la salida. Estas señales pueden recuperarse parcialmente mediante modelado explícito, pero no se capturan de forma tan natural como en los enfoques fusionados. Otras dimensiones, como la latencia y la gestión de turnos, normalmente pueden optimizarse para lograr niveles de rendimiento comparables en ambos enfoques.

Modelo fusionado

Sequential Fused Diagram

Las arquitecturas fusionadas adoptan un enfoque fundamentalmente distinto. El reconocimiento, el razonamiento y la generación tienen lugar dentro de una única red multimodal. Entra audio y sale audio, sin ninguna capa intermedia que se pueda inspeccionar.

La ausencia de etapas intermedias es a la vez su atractivo y su limitación. La arquitectura fusionada puede preservar las señales prosódicas de forma natural, porque la voz nunca se descompone en texto. Sin embargo, la capacidad para aplicar medidas de seguridad, cambiar componentes individuales o inspeccionar resultados intermedios para depurar es limitada. También hay limitaciones para ajustar STT con terminología específica de un sector o integrar un LLM distinto con mayor capacidad de razonamiento y de llamada a herramientas. El sistema es una única red y los equipos están limitados a las capacidades de razonamiento con las que se entrega, lo que hoy implica núcleos más ligeros que no pueden igualar a los LLM de frontera en tareas complejas.

Las cinco arquitecturas

1. Cascada básica

Basic Cascaded Diagram

El audio se transcribe, el LLM genera una respuesta de texto y TTS la reproduce. Todas las etapas operan con texto sin formato, por lo que puedes verlo, probarlo y controlarlo todo.

Las ventajas en términos de confianza son claras: medidas de seguridad en la capa de texto, flujos de conversación deterministas y registros de auditoría completos. Como el LLM es un componente independiente, puedes combinar el agente con el modelo de frontera que ofrezca la mayor capacidad de razonamiento o llamada a herramientas, y actualizarlo en cuanto aparezca uno mejor. El punto débil es la calidad de la conversación: sin TTS contextual, el agente suena funcional, pero plano. No hay adaptación emocional ni variación prosódica, algo aceptable para comunicar saldos de cuentas, pero insuficiente para atender a un cliente frustrado.

Ejemplos de casos de uso:

  • Sustitución de IVR en telecomunicaciones y servicios públicos
  • Gestión de preguntas frecuentes para la incorporación a SaaS
  • Notificaciones salientes, como confirmaciones de citas, recordatorios de recetas y avisos de entrega, donde la coherencia importa más que la cercanía

2. Cascada avanzada

Audio conversation flow: STT converts speech to text, LLM processes it, TTS converts text back to speech.

La misma arquitectura modular, pero ahora varios componentes operan con un contexto más rico. Esto es lo que creamos con Modo Expresivo en ElevenAgents.

El modelo STT Scribe v2 Realtime genera transcripciones rápidas y precisas basándose en el contexto previo de la conversación. A partir del texto, el LLM indica a TTS cómo debe emitir la voz, no solo qué decir, con instrucciones como «de forma tranquilizadora», «con énfasis» o «con urgencia», adaptando dinámicamente su tono durante la conversación. El sistema de gestión de turnos utiliza las mismas señales, lo que permite al agente determinar cuándo responder y cuándo ceder el turno. Los modelos de voz están ubicados conjuntamente en una misma pila, sin saltos de red entre componentes, por lo que la latencia se mantiene baja.

La arquitectura conserva todo lo de la cascada básica: transparencia total, medidas de seguridad en la capa de texto, posibilidad de cambiar componentes, ajuste al dominio y acceso a los modelos de llamada a herramientas y razonamiento más potentes disponibles. Añade mejoras significativas en prosodia, latencia y gestión de turnos. Los equipos pueden integrar un nuevo LLM de frontera la semana en que se lanza o ajustar STT para el ámbito sanitario a su terminología, sin reconstruir ningún otro componente.

Ejemplos de casos de uso:

  • Atención al cliente en servicios financieros, donde una respuesta empática en una llamada por un cargo impugnado se combina con estrictas medidas de cumplimiento normativo y un registro completo de la interacción
  • Recepcionistas sanitarios que clasifican las llamadas de pacientes con la urgencia adecuada, flujos conformes con HIPAA y reconocimiento de voz ajustado al dominio para terminología médica
  • Asistentes de ventas que mantienen un tono cercano y persuasivo mientras siguen un guion estructurado y envían actualizaciones al CRM

3. Cascada híbrida y fusionada

Hybrid Cascaded Diagram

Algunas arquitecturas introducen características acústicas de la voz de entrada —pronunciación, emoción y tono— directamente en el LLM como embeddings, en lugar de convertirlas primero en texto. TTS sigue siendo modular.

Esto proporciona al LLM información más rica sobre cómo se ha dicho algo, no solo sobre qué se ha dicho, lo que resulta valioso para aplicaciones específicas. El bloque ASR+LLM fusionado es más difícil de auditar que una transferencia de texto limpia porque la representación intermedia es un embedding, no algo que una persona pueda leer. Además, el LLM ya no puede cambiarse fácilmente, lo que limita tus capacidades de razonamiento y llamada a herramientas al modelo en torno al que se creó el bloque fusionado.

Ejemplos de casos de uso:

  • Aprendizaje de idiomas y entrenamiento de pronunciación, donde escuchar cómo habla un estudiante importa tanto como lo que dice
  • Atención sensible al tono y de baja complejidad, donde detectar la frustración importa, pero la tarea en sí es sencilla.

4. Fusionada secuencial

Sequential Fused Diagram

Un único modelo multimodal se encarga del reconocimiento, el razonamiento y la generación en una sola pasada, un turno cada vez.

La prosodia puede ser muy buena. Como la voz nunca se descompone en texto, el modelo preserva de forma natural el ritmo, la entonación y las señales emocionales. Las conversaciones breves pueden sonar extraordinariamente fluidas.

Sin embargo, la capacidad de aplicar medidas de seguridad sin una capa de texto es limitada, hay pocos resultados intermedios para depurar y poca flexibilidad para cambiar a un LLM mejor o ajustar STT a tu dominio. Los núcleos de razonamiento suelen ser más ligeros que los LLM de frontera, por lo que las llamadas a herramientas complejas y las tareas de varios pasos se resienten. Cuando la tarea exige resolver un problema complejo, la prosodia por sí sola no basta.

Ejemplos de casos de uso:

  • Compañeros personales, chatbots de entretenimiento y aplicaciones donde la expresividad impulsa la interacción y los requisitos de cumplimiento normativo son mínimos.

5. Fusionada dúplex

Duplex Fused Diagram

La entrada y la salida se procesan simultáneamente: el modelo escucha y habla a la vez. Esto puede hacer que los intercambios breves resulten sorprendentemente naturales, con solapamiento real de voz y transiciones de turno fluidas.

También es la arquitectura más difícil de controlar: las medidas de seguridad son muy difíciles de aplicar y la diafonía introduce errores impredecibles. Inspeccionar, registrar o depurar es extremadamente difícil, y el sistema está en gran medida cerrado, con opciones mínimas para cambiar componentes, ajustar el dominio o personalizarlo. El razonamiento y el uso de herramientas están aún más limitados que en los modelos fusionados secuenciales, ya que el procesamiento simultáneo deja menos capacidad para una lógica compleja. Además, el mismo procesamiento simultáneo que hace naturales los intercambios cortos vuelve inestables las conversaciones largas.


Ejemplos de casos de uso:

  • Apps experimentales de compañía, plataformas sociales de voz y demostraciones de investigación en las que se acepta un comportamiento impredecible.

Cómo elegir la arquitectura adecuada para tu caso de uso

Cascaded-vs-fused-model-chart (recap of the above)

La arquitectura adecuada depende de lo que requiera cada aplicación. Si estás creando una experiencia en la que una voz natural es la característica principal, las arquitecturas fusionadas ofrecen ventajas reales si estás dispuesto a renunciar a razonamiento de frontera, medidas de seguridad y transparencia. Aunque los modelos fusionados lideran en prosodia, los sistemas avanzados en cascada se acercan cada trimestre, mientras que los modelos fusionados no han avanzado de forma significativa en razonamiento complejo ni confianza debido a limitaciones arquitectónicas.

Para la mayoría de las empresas y organismos públicos, la mejor arquitectura es aquella que suena bien y, además, es capaz, personalizable, fiable y está lista para implementarse a escala. Por eso elegimos crear ElevenAgents con una arquitectura avanzada en cascada e inversiones en Modo Expresivo y modelos de primera categoría, cooptimizados para Voz a Texto y Texto a Voz. Esto permite a los equipos crear agentes con altos niveles de inteligencia, fiabilidad y control, junto con una voz natural y humana.

A medida que los agentes de IA se extienden por la atención al cliente, la educación, los asistentes personales y otros ámbitos, los que triunfen se construirán sobre arquitecturas adaptadas a sus aplicaciones específicas.

Artículos relacionados

Crea con el audio IA de la más alta calidad