Eleven v3 Audio Tags : donner vie aux dialogues à plusieurs personnages
- Rédigé par
- Ryan Morrison
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
Les conversations font vivre les histoires. Avec Eleven v3 Audio Tags, vous pouvez désormais écrire des scènes où les voix se chevauchent, les échanges sont rapides et les émotions s'entremêlent, le tout interprété par un seul modèle.
En combinant des tags tels que [interrupting], [overlapping] ou [laughs], vous créez des dialogues naturels qui s'enchaînent comme une conversation humaine, avec des interruptions, des changements de ton et des réactions spontanées.
Il ne s'agit pas simplement de répliques prononcées les unes après les autres. C'est une interprétation à plusieurs personnages.
Qu'est-ce qu'un dialogue à plusieurs personnages en IA vocale ?
Un dialogue à plusieurs personnages, c'est lorsqu'un modèle vocal interprète plusieurs rôles distincts dans une même scène. Chaque personnage s'exprime dans un style, un ton ou un rythme différent, parfois en interrompant les autres ou en parlant simultanément.
Avec Eleven v3, vous pouvez écrire directement ce type de script : Marissa : [starting to speak] Je pensais qu'on pourrait— Chris : [interrupting] —tester nos nouvelles fonctionnalités de synchronisation ? Marissa : [surprised] Exactement ! Comment as-tu— Chris : [overlapping] —su ce que tu pensais ? Coup de chance ! Marissa : [laughs] Honnêtement ? C'est plutôt amusant.
Le résultat ressemble à un véritable dialogue, pas à une narration assemblée.
De l'interprétation vocale à l'interaction
Ce qui nécessitait auparavant plusieurs intervenants, enregistrements et ajustements de synchronisation peut désormais être géré avec un seul script. Les tags vous permettent de diriger chaque voix indépendamment dans une même scène.
Exemple : Jessica : [whispers] Comme ça. Von Fusion : [sarcastically] Ooh, eh bien, regardez-moi ça, Mademoiselle Je-sais-tout. Jessica : [French accent] C'est spectaculaire, n'est-ce pas ?
Les voix ne se succèdent pas simplement, elles interagissent, réagissent et se chevauchent.
Tags courants pour contrôler plusieurs personnages
Voici quelques tags essentiels pour écrire des dialogues naturels et réactifs :
- Indicateurs de prise de parole : [interrupting], [overlapping], [cuts in]
- Changements émotionnels : [excited], [annoyed], [flustered], [casual]
- Rythme : [fast-paced], [hesitates], [pause], [drawn out]
- Changement d'identité : [childlike tone], [deep voice], [pirate voice], [robotic tone]
Vous pouvez les combiner pour créer des interactions expressives : [frustrated] Tu ne m'écoutes jamais, [interjecting] Parce que tu ne dis jamais ce que tu veux dire !
Chevauchement, rythme et présence
Eleven v3 prend en charge une interprétation sensible au timing qui permet aux voix de s'interrompre ou de parler les unes sur les autres naturellement. C'est essentiel pour l'humour, la tension ou le réalisme.
Dans cet extrait : Marissa : [panicking] Attends, est-ce qu'on fait planter le système ? Je ne sais pas si c'est une fonctionnalité ou un— Chris : [interrupting] Bug ! Marissa : [sighing] Oui, mais honnêtement ? C'est plutôt amusant.`
La scène paraît vivante, car l'interaction est fluide et non scénarisée réplique par réplique.
Diriger des scènes, pas seulement des phrases
Avec Eleven v3, les scènes de dialogue deviennent des interprétations orchestrées. Vous pouvez créer des conversations entières, avec personnages, timing, émotions et intention, à partir d'un seul script et d'un seul modèle.
Pour les auteurs, scénaristes de jeux et concepteurs d'expériences interactives, cela permet d'écrire des scènes complexes sans alourdir la production. Vous ne vous contentez pas d'écrire des répliques. Vous dirigez la dynamique des personnages.
Choisir la bonne voix
Les clones de voix professionnels (PVC) ne sont actuellement pas entièrement optimisés pour Eleven v3, ce qui peut entraîner une qualité de clone inférieure à celle des modèles précédents. Durant cette phase d'aperçu de recherche, il est préférable de choisir un clone de voix instantané (IVC) ou une voix conçue pour votre projet si vous devez utiliser les fonctionnalités de v3. L'optimisation des PVC pour v3 arrivera prochainement.


