Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Text to Speech émotionnel : comment diriger des interprétations vocales IA avec Eleven v4

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Le Text to Speech émotionnel (TTS) transforme un script en interprétation. Au lieu d'une lecture monotone, un modèle TTS expressif restitue chaque mot avec émotion, donnant vie à une scène par la colère, la joie, la tristesse, la frustration et bien plus encore.

En intégrant des Audio Tags à votre script, vous façonnez l'interprétation Text to Speech comme le ferait un metteur en scène. Ajoutez [furious] pour renforcer l'intensité d'une réplique, [sarcastic] pour y apporter une pointe d'humour pince-sans-rire, ou tout autre tag pour indiquer au modèle comment vous souhaitez qu'une réplique soit interprétée. 

Avec Eleven v4, vous disposez d'un TTS émotionnel que vous pouvez diriger ligne par ligne. Voici comment créer des scripts qui donnent vie à vos textes.

Qu'est-ce que le Text to Speech émotionnel ?

Le Text to Speech émotionnel est une parole générée par IA qui interprète une réplique au lieu de simplement la lire. Il exprime les émotions, maîtrise le rythme et le tempo, met l'accent sur les bons mots et ajoute des sons non verbaux, comme des soupirs et des rires.

Eleven v4 est un modèle de rupture qui transforme le texte en véritable interprétation. Grâce à des descriptions intégrées, une même phrase peut être chuchotée, criée ou prononcée à travers les larmes, selon votre vision.

Que vous rédigiez une campagne publicitaire pour votre prochain lancement ou donniez vie aux chapitres de votre roman, Eleven v4 vous accompagne avec un Text to Speech de haute qualité.

Comment Eleven v4 interprète les indications émotionnelles

Eleven v4 s'appuie sur les indications émotionnelles des Audio Tags de votre script pour les transformer en une interprétation audio naturelle.

Voici quelques façons d'ajouter des indications émotionnelles à un texte avec Eleven v4 afin d'améliorer votre résultat final :

  • Audio Tags : Insérez des Audio Tags dans vos instructions, comme [whispers] ou [cries], pour placer des indications directement dans votre script. Vous pourrez créer des scènes chargées d'émotion en dirigeant v4 comme vous le feriez avec un interprète sur scène.
  • Ponctuation : Utilisez la ponctuation pour façonner le rythme et l'interprétation avec vos Audio Tags. Les points de suspension ralentissent une réplique, les tirets interrompent un locuteur en pleine phrase et les points d'exclamation renforcent l'intensité, vous offrant une couche de direction supplémentaire sans ajouter de tag.
  • Continuité émotionnelle : Commencez une phrase par une émotion, et Eleven v4 conserve cette tonalité tout au long de la réplique. Construisez vos scènes de façon itérative et créez des scripts riches et contextuels avec des Audio Tags sur v4.

Pour montrer l'efficacité des Audio Tags pour donner vie au texte avec v4, examinons la différence entre un audio avec et sans tags.

Dans ce premier exemple, nous utilisons simplement une phrase par défaut. À titre de référence, nous utilisons Siren pour ces exemples.

Paragraphe narratif sans Audio Tags sur Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

Ce second exemple reprend la même phrase, avec des Audio Tags ajoutés. Il contient des indications émotionnelles, des effets sonores, et même des sons qui vont au-delà du texte, comme un rire maléfique.

Paragraphe narratif avec Audio Tags sur Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Cinq interprétations Text to Speech émotionnelles avec Eleven v4

La meilleure façon de découvrir toute l'étendue d'Eleven v4 est de l'essayer vous-même. En créant un compte, vous pourrez commencer à utiliser Eleven v4 en quelques minutes.

Pour vous montrer ce qui est possible avec ce modèle Text to Speech expressif, voici une même réplique générée cinq fois. Chaque version reçoit une indication scénique différente, illustrant précisément ce que vous pouvez faire avec le modèle.

Les cinq cartes suivantes utilisent toutes le texte « I didn’t think you’d actually come back. », modifié par un Audio Tag riche en émotion. À titre de référence, ces exemples utilisent également Siren.

Ajouter [furious]

Les consonnes se durcissent et les occlusives deviennent plus marquées. La réplique paraît colérique et prend la forme d'une accusation.

[furious]

[furious] I didn't think you'd actually come back
0:00

Ajouter [excited]

La hauteur monte et le rythme s'accélère, transformant la même phrase en accueil joyeux.

[excited]

[excited] I didn't think you'd actually come back.
0:00

Ajouter [sarcastic] 

La hauteur s'aplatit et les voyelles s'allongent. Le sarcasme est un excellent usage des Audio Tags, car le ton contredit directement les mots écrits.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

Ajouter [crying]

Cette version est poignante. L'interprétation ralentit et se brise en pleine phrase. Vous remarquerez que le travail du souffle joue ici un rôle déterminant.

[crying]

[crying] I didn't think you'd actually come back.
0:00

Ajouter [worried]

Plus discrète et légèrement hésitante, [worried] retire toute certitude à la réplique.

[worried] I didn't think you'd actually come back.
0:00

Conseils pour rédiger des scripts interprétables par l'IA

Nous avons conçu l'application ElevenLabs Text to Speech pour qu'elle soit aussi intuitive que possible. Accédez à la page et commencez à écrire, ou ajoutez des Audio Tags descriptifs pour intégrer des sons ou émotions spécifiques à votre scène.

Voici quelques conseils supplémentaires pour obtenir les meilleurs résultats avec le Text to Speech émotionnel d'Eleven v4 :

  1. Affinez vos indications : Si une réplique ne fonctionne pas, remplacez le tag plutôt que de réécrire le texte. Essayez [worried] au lieu de [sad], ou [sarcastic] au lieu de [annoyed], puis régénérez jusqu'à ce que l'interprétation corresponde à ce que vous aviez en tête.
  2. Générez des scènes complètes en une fois : Si des phrases isolées peuvent donner lieu à une interprétation nuancée, comme nous l'avons montré plus haut, Eleven v4 fonctionne mieux avec des paragraphes ou des passages de texte. Donner au modèle suffisamment de texte pour établir le contexte d'une scène améliore l'interprétation sur l'ensemble du passage. Avec Eleven v4, vous pouvez écrire jusqu'à 10 000 caractères par génération dans l'application TTS.
  3. Utilisez une émotion par segment : Bien que vous puissiez superposer plusieurs Audio Tags dans une phrase, il est préférable d'en utiliser un pour chaque segment afin d'éviter toute confusion. Ajouter des émotions contradictoires comme indications peut produire un résultat moins précis. Vous pouvez aussi ajouter un tag juste avant la proposition exacte visée, puis un nouveau tag après celle-ci si vous souhaitez changer d'émotion au milieu de la phrase. 

Avec ces conseils, vous transformerez rapidement vos textes en interprétations.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Commencer avec Eleven v4 pour le Text to Speech émotionnel

Tout ce que vous avez vu dans cet article a été généré dans l'application ElevenLabs Text to Speech avec un script, une voix et quelques Audio Tags sur Eleven v4.

Pour créer vos propres scènes, sélectionnez simplement une voix, collez une réplique que vous avez écrite et dirigez votre première interprétation.

En savoir plus sur Eleven v4 ou inscrivez-vous pour commencer avec votre première génération.

FAQ sur le Text to Speech émotionnel par IA

Articles similaires

Créez avec l'audio IA de la plus haute qualité