Modo expresivo
Crea agentes de voz que adapten el tono, el ritmo y la expresión emocional según el contexto de la conversación.
Descripción general
El modo expresivo permite a los agentes generar voz que refleje intención, emoción y énfasis, adaptándose en tiempo real a cómo suenan los usuarios y a lo que dicen. Se basa en dos mejoras de nivel de sistema en la pila conversacional:
- Eleven v3 Conversational — el modelo de Texto a Voz con mayor inteligencia emocional y conciencia del contexto disponible en ElevenAgents.
- Un nuevo sistema de toma de turnos — respuestas con una temporización más precisa y menos interrupciones.
El modo expresivo se activa de forma predeterminada cuando seleccionas Eleven v3 Conversational como modelo de TTS de tu agente.
Eleven v3 Conversational
Eleven v3 Conversational es una versión de Eleven v3 con latencia ultrabaja, optimizada para diálogos en directo de ida y vuelta. Mantiene el contexto conversacional entre turnos y adapta la entonación para que coincida con el tono y la intención de cada intercambio.
- Entonación según el contexto: los agentes adaptan el tono según el contexto de la conversación; responden con más calma cuando un usuario parece preocupado o con mayor claridad cuando hace falta ser directo.
- Control emocional explícito: guía la entonación mediante reglas en el prompt de sistema, desde activadores precisos hasta situaciones más generales, para ajustarla a la voz de marca y los requisitos de cumplimiento normativo.
- Compatibilidad con más de 70 idiomas: se amplía desde los ~32 idiomas de los modelos Flash, con una expresividad mejorada en idiomas donde antes faltaban matices, incluido el japonés.
- Etiquetas expresivas: el LLM puede generar etiquetas como
[laughs],[whispers]o[sighs]para controlar momentos concretos de la entonación.
Eleven v3 Conversational tiene el mismo precio que otros modelos de TTS de ElevenLabs en Agents, a partir de 0,08 $ por minuto.
Sistema de toma de turnos
El nuevo sistema de toma de turnos utiliza señales en tiempo real de Scribe v2 Realtime, incluidas pistas emocionales y patrones de habla, para determinar cuándo debe hablar, hacer una pausa o esperar un agente. Esto ayuda a los agentes a responder de forma más natural, especialmente en situaciones con una alta carga emocional.
Por ejemplo, «sí» puede ser una confirmación completa o una introducción para seguir hablando. Al analizar cómo se dijo (pistas del habla como la prosodia), además de la transcripción, el sistema sincroniza la respuesta del agente de forma más natural.
El comportamiento de toma de turnos se puede ajustar aún más con la opción de predisposición a tomar el turno.
Configuración
Activar el modo expresivo
Selecciona el modelo de TTS
Configura el modelo de TTS de tu agente como V3 Conversational. El modo expresivo se activa de forma predeterminada con este modelo.
Actualizar desde el panel
Actualizar mediante la CLI
Actualizar mediante la API
Abre tu agente en el panel, ve a la pestaña Voz del agente y selecciona V3 Conversational como modelo de Texto a Voz. Guarda los cambios.

Ejemplos de prompts de sistema
Guía la expresión emocional de tu agente mediante instrucciones en lenguaje natural en el prompt de sistema. El modelo las interpreta según el contexto, así que no se necesitan etiquetas explícitas para cada situación.
Indicaciones generales
Activadores específicos
Uso de etiquetas expresivas
Además de la entonación según el contexto, el LLM puede generar etiquetas explícitas para controlar momentos concretos. Algunas etiquetas habituales son:
[laughs]— Añade risas a la voz[whispers]— Baja el volumen para susurrar[sighs]— Añade un matiz de suspiro[slow]— Ralentiza la voz[excited]— Añade entusiasmo a la entonación
Cada etiqueta afecta aproximadamente a las siguientes 4-5 palabras antes de volver a la entonación normal.
Prácticas recomendadas
Adapta la entonación al contexto
Guía a tu agente para que adapte su expresión emocional a la situación. Un cliente frustrado debe escuchar una respuesta tranquila y empática. Un usuario que comparte buenas noticias debe percibir una calidez genuina. Un tono inadecuado erosiona la confianza.
Usa reglas en el prompt de sistema para mantener la coherencia
Define pautas de tono claras en el prompt de sistema en lugar de depender únicamente del criterio del modelo. Esto garantiza una entonación coherente y alineada con la voz de marca y los requisitos de cumplimiento normativo.
Prueba en distintos idiomas
La expresión emocional puede variar entre idiomas. Prueba tu agente en cada idioma de destino para asegurarte de que el matiz emocional se transmite como esperas, especialmente en idiomas con normas conversacionales diferentes.
Combínalo con los ajustes de predisposición a tomar el turno
Combina el modo expresivo con ajustes adecuados de predisposición a tomar el turno. El modo paciente da más espacio a los usuarios en conversaciones emocionalmente sensibles, mientras que el modo ágil funciona bien en interacciones rápidas.
Supervisa e itera
Usa las analíticas de conversaciones para ver cómo responden los usuarios a la entonación expresiva. Perfecciona las pautas de tono según los resultados de las conversaciones y los comentarios de los usuarios.
Limitaciones
- Eleven v3 Conversational no conserva las características de los clones de voz profesionales (PVC); es posible que el resultado no suene como la voz PVC original.
- Los efectos de las etiquetas expresivas duran aproximadamente 4-5 palabras antes de volver a la entonación normal.
- La expresividad puede variar entre voces e idiomas.
Preguntas frecuentes
¿El modo expresivo cuesta más?
No. Eleven v3 Conversational tiene el mismo precio que otros modelos de TTS de ElevenLabs en Agents, a partir de 0,08 $ por minuto.
¿Cómo activo el modo expresivo?
Selecciona V3 Conversational como modelo de TTS de tu agente. El modo expresivo se activa de forma predeterminada con este modelo.
¿Cómo funciona el sistema de toma de turnos?
El sistema utiliza señales en tiempo real de Scribe v2 Realtime, incluidas pistas emocionales y patrones de habla, para predecir cuándo debe responder el agente. Analiza tanto la transcripción como la forma en que se pronunciaron las palabras (prosodia) para sincronizar las respuestas de forma natural.
¿Puedo usar el modo expresivo con mi clon de voz profesional?
Actualmente, Eleven v3 Conversational no conserva bien las características de los PVC. Si mantener la identidad de voz de tu PVC es crucial, considera usar Flash v2 en su lugar.
¿Cuántos idiomas admite Eleven v3 Conversational?
Eleven v3 Conversational admite más de 70 idiomas, frente a los ~32 de los modelos Flash. Esto incluye una expresividad mejorada en idiomas como el japonés, donde antes faltaban matices.
¿Cómo se compara con otros modelos de TTS de ElevenAgents?
Eleven v3 Conversational ofrece un mayor rango emocional que Flash y Multilingual v2, y puede adaptar la entonación según el contexto de la conversación. Admite más de 70 idiomas, frente a los ~32 de Flash. Tiene el mismo precio que los demás modelos.