Modo expressivo

Crie agentes de voz que adaptam o tom, o ritmo e a expressão emocional com base no contexto da conversa.

Visão geral

O modo expressivo permite que os agentes falem refletindo intenção, emoção e ênfase, adaptando-se em tempo real à forma como os usuários soam e ao que dizem. Ele se baseia em duas melhorias no nível do sistema da estrutura conversacional:

  1. Eleven v3 Conversational — o modelo de Text to Speech mais inteligente emocionalmente e atento ao contexto disponível no ElevenAgents.
  2. Um novo sistema de alternância de turnos — respostas com tempo mais preciso e menos interrupções.

O modo expressivo é ativado por padrão quando você seleciona Eleven v3 Conversational como o modelo TTS do seu agente.

Eleven v3 Conversational

Eleven v3 Conversational é uma versão do Eleven v3 com latência ultrabaixa, otimizada para diálogos ao vivo de ida e volta. Ele mantém o contexto da conversa entre os turnos e adapta a entrega para corresponder ao tom e à intenção de cada interação.

  • Entrega atenta ao contexto: os agentes adaptam o tom com base no contexto da conversa — respondendo com mais calma quando um usuário parece preocupado ou de forma mais direta quando a clareza é importante.
  • Controle emocional explícito: oriente a entrega por meio de regras no prompt do sistema, de gatilhos precisos a cenários mais amplos, para alinhá-la à voz da marca e aos requisitos de conformidade.
  • Suporte a mais de 70 idiomas: expandido de cerca de 32 idiomas nos modelos Flash, com melhor expressividade em idiomas nos quais antes faltavam nuances, incluindo o japonês.
  • Tags expressivas: o LLM pode gerar tags como [laughs], [whispers] ou [sighs] para controlar momentos específicos da entrega.

O Eleven v3 Conversational tem o mesmo preço dos outros modelos TTS da ElevenLabs em Agents, a partir de US$ 0,08 por minuto.

Sistema de alternância de turnos

O novo sistema de alternância de turnos usa sinais em tempo real do Scribe v2 Realtime — incluindo pistas emocionais e padrões de fala — para determinar quando um agente deve falar, pausar ou esperar. Isso ajuda os agentes a responder de forma mais natural, especialmente em situações de forte carga emocional.

Por exemplo, “sim” pode ser uma confirmação completa ou uma introdução para continuar falando. Ao analisar como isso foi dito (pistas de fala, como a prosódia), além da transcrição, o sistema determina o momento da resposta do agente de forma mais natural.

O comportamento de alternância de turnos pode ser ajustado ainda mais com a configuração de disposição para responder.

Configuração

Ativar o modo expressivo

1

Selecionar o modelo TTS

Defina o modelo TTS do seu agente como V3 Conversational. O modo expressivo é ativado por padrão com esse modelo.

Abra seu agente no dashboard, acesse a aba Voz do agente e selecione V3 Conversational como seu modelo de Text to Speech. Salve as alterações.

Ativando o modo expressivo

2

Oriente a expressão emocional no prompt do sistema

Adicione instruções ao prompt do sistema do seu agente para orientar como ele adapta o tom. Você pode usar orientações amplas ou gatilhos específicos.

Exemplos de prompt do sistema

Oriente a expressão emocional do seu agente com instruções em linguagem natural no prompt do sistema. O modelo interpreta essas instruções de acordo com o contexto, portanto não são necessárias tags explícitas para todas as situações.

Orientação ampla

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Gatilhos específicos

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Como usar tags expressivas

Além da entrega atenta ao contexto, o LLM pode gerar tags explícitas para controlar momentos específicos. As tags mais comuns incluem:

  • [laughs] — Adiciona risadas à fala
  • [whispers] — Diminui o volume para sussurrar
  • [sighs] — Adiciona uma qualidade de suspiro
  • [slow] — Desacelera a fala
  • [excited] — Adiciona animação à entrega

Cada tag afeta aproximadamente as próximas 4 a 5 palavras da fala antes de retornar à entrega normal.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Boas práticas

Oriente seu agente a adaptar sua expressão emocional à situação. Um cliente frustrado deve ouvir uma resposta calma e empática. Um usuário compartilhando boas notícias deve ouvir uma cordialidade genuína. Um tom inadequado prejudica a confiança.

Defina diretrizes claras de tom no prompt do sistema, em vez de depender apenas do julgamento do modelo. Isso garante uma entrega consistente, alinhada à voz da marca e aos requisitos de conformidade.

A entrega expressiva pode variar entre idiomas. Teste seu agente em cada idioma de destino para garantir que a nuance emocional seja transmitida como esperado, especialmente em idiomas com normas de conversação diferentes.

Combine o modo expressivo com as configurações adequadas de disposição para responder. O modo paciente dá mais espaço aos usuários em conversas emocionalmente sensíveis, enquanto o modo ávido funciona em interações rápidas.

Use as análises de conversa para acompanhar como os usuários respondem à entrega expressiva. Aprimore as diretrizes de tom com base nos resultados das conversas e no feedback dos usuários.

Limitações

  • O Eleven v3 Conversational não preserva as características de Clones de Voz Profissionais (PVCs) — a saída pode não soar como a voz PVC original.
  • Os efeitos das tags expressivas duram aproximadamente 4 a 5 palavras antes de retornar à entrega normal.
  • A expressividade pode variar entre vozes e idiomas.

Perguntas frequentes

Não. O Eleven v3 Conversational tem o mesmo preço dos outros modelos TTS da ElevenLabs em Agents, a partir de US$ 0,08 por minuto.

Selecione V3 Conversational como o modelo TTS do seu agente. O modo expressivo é ativado por padrão com esse modelo.

O sistema usa sinais em tempo real do Scribe v2 Realtime, incluindo pistas emocionais e padrões de fala, para prever quando o agente deve responder. Ele analisa tanto a transcrição quanto a forma como as palavras foram ditas (prosódia) para determinar o momento das respostas naturalmente.

No momento, o Eleven v3 Conversational não preserva bem as características de PVC. Se manter a identidade da voz PVC for essencial, considere usar Flash v2.

O Eleven v3 Conversational oferece suporte a mais de 70 idiomas, expandindo os cerca de 32 dos modelos Flash. Isso inclui expressividade aprimorada em idiomas como o japonês, nos quais antes faltavam nuances.

O Eleven v3 Conversational oferece uma gama emocional maior do que Flash e Multilingual v2, com a capacidade de adaptar a entrega com base no contexto da conversa. Ele oferece suporte a mais de 70 idiomas, em comparação com cerca de 32 no Flash. Tem o mesmo preço dos outros modelos.

Recursos relacionados