Mode expressif

Créez des agents vocaux qui adaptent le ton, le timing et l’expression émotionnelle au contexte de la conversation.

Vue d’ensemble

Le mode expressif permet aux agents de produire une parole qui reflète l’intention, l’émotion et l’emphase, en s’adaptant en temps réel à la voix et aux propos des utilisateurs. Il repose sur deux améliorations au niveau du système de la pile conversationnelle :

  1. Eleven v3 Conversational : le modèle Text to Speech le plus intelligent sur le plan émotionnel et le plus sensible au contexte disponible dans ElevenAgents.
  2. Un nouveau système de prise de parole : des réponses mieux synchronisées et moins d’interruptions.

Le mode expressif est activé par défaut lorsque vous sélectionnez Eleven v3 Conversational comme modèle TTS de votre agent.

Eleven v3 Conversational

Eleven v3 Conversational est une version d’Eleven v3 à très faible latence, optimisée pour les dialogues en direct. Il conserve le contexte conversationnel d’un tour à l’autre et adapte la restitution au ton et à l’intention de chaque échange.

  • Restitution sensible au contexte : les agents adaptent leur ton au contexte de la conversation, en répondant plus calmement lorsqu’un utilisateur semble inquiet ou plus directement lorsque la clarté est essentielle.
  • Contrôle émotionnel explicite : guidez la restitution grâce à des règles dans le prompt système, avec des déclencheurs précis ou des scénarios plus larges, afin de respecter votre voix de marque et vos exigences de conformité.
  • Prise en charge de plus de 70 langues : étendue par rapport aux quelque 32 langues des modèles Flash, avec une expressivité améliorée dans les langues où les nuances étaient auparavant moins bien restituées, notamment le japonais.
  • Balises expressives : le LLM peut générer des balises comme [laughs], [whispers] ou [sighs] pour contrôler des moments précis de la restitution.

Eleven v3 Conversational est proposé au même tarif que les autres modèles TTS d’ElevenLabs dans Agents, à partir de 0,08 $ par minute.

Système de prise de parole

Le nouveau système de prise de parole utilise des signaux en temps réel de Scribe v2 Realtime, notamment des indices émotionnels et des schémas de parole, afin de déterminer quand un agent doit parler, marquer une pause ou attendre. Les agents répondent ainsi plus naturellement, en particulier dans les situations chargées en émotion.

Par exemple, « ouais » peut constituer un acquiescement complet ou introduire la suite d’une phrase. En analysant la manière dont cela a été dit, notamment les indices vocaux tels que la prosodie, en plus de la transcription, le système synchronise plus naturellement la réponse de l’agent.

Vous pouvez affiner davantage le comportement de prise de parole avec le réglage empressement de prise de parole.

Configuration

Activer le mode expressif

1

Sélectionner le modèle TTS

Définissez le modèle TTS de votre agent sur V3 Conversational. Le mode expressif est activé par défaut avec ce modèle.

Ouvrez votre agent dans le Dashboard, accédez à l’onglet Agent Voice, puis sélectionnez V3 Conversational comme modèle Text to Speech. Enregistrez vos modifications.

Activation du mode expressif

2

Guider la restitution émotionnelle dans votre prompt système

Ajoutez des instructions au prompt système de votre agent afin d’orienter l’adaptation de son ton. Vous pouvez utiliser des indications générales ou des déclencheurs précis.

Exemples de prompts système

Guidez la restitution émotionnelle de votre agent à l’aide d’instructions en langage naturel dans le prompt système. Le modèle les interprète selon le contexte, il n’est donc pas nécessaire d’utiliser des balises explicites dans chaque situation.

Indications générales

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Déclencheurs précis

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Utiliser des balises expressives

En complément d’une restitution sensible au contexte, le LLM peut générer des balises explicites pour contrôler des moments précis. Les balises courantes incluent :

  • [laughs] : ajoute un rire à la parole
  • [whispers] : réduit le volume pour chuchoter
  • [sighs] : ajoute une tonalité de soupir
  • [slow] : ralentit le débit de parole
  • [excited] : ajoute de l’enthousiasme à la restitution

Chaque balise agit sur les 4 à 5 mots suivants environ, avant le retour à une restitution normale.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Bonnes pratiques

Guidez votre agent pour adapter sa restitution émotionnelle à la situation. Un client frustré doit entendre une réponse calme et empathique. Un utilisateur qui partage une bonne nouvelle doit percevoir une chaleur sincère. Un ton inadapté érode la confiance.

Définissez des directives de ton claires dans votre prompt système plutôt que de vous fier uniquement au jugement du modèle. Cela garantit une restitution cohérente avec votre voix de marque et vos exigences de conformité.

La restitution expressive peut varier selon les langues. Testez votre agent dans chaque langue cible afin de vous assurer que la nuance émotionnelle est bien perçue, surtout dans les langues où les normes conversationnelles diffèrent.

Associez le mode expressif à des réglages appropriés d’empressement de prise de parole. Le mode patient laisse davantage d’espace aux utilisateurs lors de conversations émotionnellement sensibles, tandis que le mode empressé convient aux interactions rapides.

Utilisez les analyses de conversation pour suivre la réaction des utilisateurs à la restitution expressive. Affinez vos directives de ton en fonction des résultats des conversations et des retours des utilisateurs.

Limites

  • Eleven v3 Conversational ne préserve pas les caractéristiques des Professional Voice Clones (PVC) : le résultat peut ne pas ressembler à la voix PVC d’origine.
  • Les effets des balises expressives durent environ 4 à 5 mots avant le retour à une restitution normale.
  • L’expressivité peut varier selon les voix et les langues.

FAQ

Non. Eleven v3 Conversational est proposé au même tarif que les autres modèles TTS d’ElevenLabs dans Agents, à partir de 0,08 $ par minute.

Sélectionnez V3 Conversational comme modèle TTS de votre agent. Le mode expressif est activé par défaut avec ce modèle.

Le système utilise des signaux en temps réel de Scribe v2 Realtime, notamment des indices émotionnels et des schémas de parole, pour prédire à quel moment l’agent doit répondre. Il analyse à la fois la transcription et la façon dont les mots ont été prononcés, notamment la prosodie, afin de synchroniser naturellement les réponses.

Eleven v3 Conversational ne préserve actuellement pas bien les caractéristiques des PVC. Si le maintien de l’identité vocale de votre PVC est essentiel, envisagez plutôt d’utiliser Flash v2.

Eleven v3 Conversational prend en charge plus de 70 langues, contre environ 32 pour les modèles Flash. Cela inclut une expressivité améliorée dans des langues comme le japonais, où les nuances étaient auparavant moins bien restituées.

Eleven v3 Conversational offre une gamme émotionnelle plus étendue que Flash et Multilingual v2, avec la capacité d’adapter la restitution au contexte conversationnel. Il prend en charge plus de 70 langues, contre environ 32 pour Flash. Son tarif est identique à celui des autres modèles.

Fonctionnalités associées