Modo expresivo

Crea agentes de voz que adapten el tono, el ritmo y la expresión emocional según el contexto de la conversación.

Descripción general

El modo expresivo permite a los agentes generar voz que refleje intención, emoción y énfasis, adaptándose en tiempo real a cómo suenan los usuarios y a lo que dicen. Se basa en dos mejoras de nivel de sistema en la pila conversacional:

  1. Eleven v3 Conversational — el modelo de Texto a Voz con mayor inteligencia emocional y conciencia del contexto disponible en ElevenAgents.
  2. Un nuevo sistema de toma de turnos — respuestas con una temporización más precisa y menos interrupciones.

El modo expresivo se activa de forma predeterminada cuando seleccionas Eleven v3 Conversational como modelo de TTS de tu agente.

Eleven v3 Conversational

Eleven v3 Conversational es una versión de Eleven v3 con latencia ultrabaja, optimizada para diálogos en directo de ida y vuelta. Mantiene el contexto conversacional entre turnos y adapta la entonación para que coincida con el tono y la intención de cada intercambio.

  • Entonación según el contexto: los agentes adaptan el tono según el contexto de la conversación; responden con más calma cuando un usuario parece preocupado o con mayor claridad cuando hace falta ser directo.
  • Control emocional explícito: guía la entonación mediante reglas en el prompt de sistema, desde activadores precisos hasta situaciones más generales, para ajustarla a la voz de marca y los requisitos de cumplimiento normativo.
  • Compatibilidad con más de 70 idiomas: se amplía desde los ~32 idiomas de los modelos Flash, con una expresividad mejorada en idiomas donde antes faltaban matices, incluido el japonés.
  • Etiquetas expresivas: el LLM puede generar etiquetas como [laughs], [whispers] o [sighs] para controlar momentos concretos de la entonación.

Eleven v3 Conversational tiene el mismo precio que otros modelos de TTS de ElevenLabs en Agents, a partir de 0,08 $ por minuto.

Sistema de toma de turnos

El nuevo sistema de toma de turnos utiliza señales en tiempo real de Scribe v2 Realtime, incluidas pistas emocionales y patrones de habla, para determinar cuándo debe hablar, hacer una pausa o esperar un agente. Esto ayuda a los agentes a responder de forma más natural, especialmente en situaciones con una alta carga emocional.

Por ejemplo, «sí» puede ser una confirmación completa o una introducción para seguir hablando. Al analizar cómo se dijo (pistas del habla como la prosodia), además de la transcripción, el sistema sincroniza la respuesta del agente de forma más natural.

El comportamiento de toma de turnos se puede ajustar aún más con la opción de predisposición a tomar el turno.

Configuración

Activar el modo expresivo

1

Selecciona el modelo de TTS

Configura el modelo de TTS de tu agente como V3 Conversational. El modo expresivo se activa de forma predeterminada con este modelo.

Abre tu agente en el panel, ve a la pestaña Voz del agente y selecciona V3 Conversational como modelo de Texto a Voz. Guarda los cambios.

Activación del modo expresivo

2

Guía la expresión emocional en tu prompt de sistema

Añade instrucciones al prompt de sistema de tu agente para orientar cómo adapta su tono. Puedes usar indicaciones generales o activadores específicos.

Ejemplos de prompts de sistema

Guía la expresión emocional de tu agente mediante instrucciones en lenguaje natural en el prompt de sistema. El modelo las interpreta según el contexto, así que no se necesitan etiquetas explícitas para cada situación.

Indicaciones generales

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Activadores específicos

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Uso de etiquetas expresivas

Además de la entonación según el contexto, el LLM puede generar etiquetas explícitas para controlar momentos concretos. Algunas etiquetas habituales son:

  • [laughs] — Añade risas a la voz
  • [whispers] — Baja el volumen para susurrar
  • [sighs] — Añade un matiz de suspiro
  • [slow] — Ralentiza la voz
  • [excited] — Añade entusiasmo a la entonación

Cada etiqueta afecta aproximadamente a las siguientes 4-5 palabras antes de volver a la entonación normal.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Prácticas recomendadas

Guía a tu agente para que adapte su expresión emocional a la situación. Un cliente frustrado debe escuchar una respuesta tranquila y empática. Un usuario que comparte buenas noticias debe percibir una calidez genuina. Un tono inadecuado erosiona la confianza.

Define pautas de tono claras en el prompt de sistema en lugar de depender únicamente del criterio del modelo. Esto garantiza una entonación coherente y alineada con la voz de marca y los requisitos de cumplimiento normativo.

La expresión emocional puede variar entre idiomas. Prueba tu agente en cada idioma de destino para asegurarte de que el matiz emocional se transmite como esperas, especialmente en idiomas con normas conversacionales diferentes.

Combina el modo expresivo con ajustes adecuados de predisposición a tomar el turno. El modo paciente da más espacio a los usuarios en conversaciones emocionalmente sensibles, mientras que el modo ágil funciona bien en interacciones rápidas.

Usa las analíticas de conversaciones para ver cómo responden los usuarios a la entonación expresiva. Perfecciona las pautas de tono según los resultados de las conversaciones y los comentarios de los usuarios.

Limitaciones

  • Eleven v3 Conversational no conserva las características de los clones de voz profesionales (PVC); es posible que el resultado no suene como la voz PVC original.
  • Los efectos de las etiquetas expresivas duran aproximadamente 4-5 palabras antes de volver a la entonación normal.
  • La expresividad puede variar entre voces e idiomas.

Preguntas frecuentes

No. Eleven v3 Conversational tiene el mismo precio que otros modelos de TTS de ElevenLabs en Agents, a partir de 0,08 $ por minuto.

Selecciona V3 Conversational como modelo de TTS de tu agente. El modo expresivo se activa de forma predeterminada con este modelo.

El sistema utiliza señales en tiempo real de Scribe v2 Realtime, incluidas pistas emocionales y patrones de habla, para predecir cuándo debe responder el agente. Analiza tanto la transcripción como la forma en que se pronunciaron las palabras (prosodia) para sincronizar las respuestas de forma natural.

Actualmente, Eleven v3 Conversational no conserva bien las características de los PVC. Si mantener la identidad de voz de tu PVC es crucial, considera usar Flash v2 en su lugar.

Eleven v3 Conversational admite más de 70 idiomas, frente a los ~32 de los modelos Flash. Esto incluye una expresividad mejorada en idiomas como el japonés, donde antes faltaban matices.

Eleven v3 Conversational ofrece un mayor rango emocional que Flash y Multilingual v2, y puede adaptar la entonación según el contexto de la conversación. Admite más de 70 idiomas, frente a los ~32 de Flash. Tiene el mismo precio que los demás modelos.

Funciones relacionadas