Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Que sont les audio tags ? Le guide complet du TTS émotionnel

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Les Audio Tags sont des indications en langage naturel entre crochets, comme [laughs], [gasps], [excited] et [worried], qu’Eleven v3 interprète comme des directives d’interprétation plutôt que comme des mots à prononcer. Lorsque vous rédigez un script pour un modèle de synthèse vocale, l’insertion de ces Audio Tags vous offre un contrôle précis sur l’interprétation émotionnelle de votre texte. 

Eleven v3 est devenu accessible au public en mars 2026. Avant v3, obtenir une interprétation émotionnelle précise d’un modèle Text to Speech impliquait de régénérer du contenu en espérant obtenir le bon résultat. Les Audio Tags éliminent cette part d’incertitude et vous donnent un contrôle total sur l’interprétation émotionnelle de la synthèse vocale.

Ce guide explique ce que sont les Audio Tags, comment ils fonctionnent, toutes les catégories disponibles et leur comparaison avec le SSML (Speech Synthesis Markup Language). Il présente également des cas d’usage courants, chacun renvoyant vers son guide dédié.

En résumé

  • Les Audio Tags sont des indications entre crochets, comme [shouts] ou [excited], qui dirigent l’émotion, le rythme, l’interprétation et le ton de la synthèse vocale dans Eleven v3.
  • Eleven v3 ne prend pas en charge le SSML, mais le remplace par les Audio Tags pour une expérience d’écriture plus naturelle.
  • Les tags couvrent plusieurs catégories, dont les émotions, l’interprétation et le rythme, les réactions humaines, les accents et les effets sonores.
  • La ponctuation et les majuscules dans votre texte vous permettent de modeler le rythme d’une interprétation par une voix IA.
  • Vous pouvez accéder aux Audio Tags dans l’interface d’ElevenLabs ou via l’API.

Comment fonctionnent les Audio Tags ?

Les Audio Tags s’insèrent directement dans votre transcription, entre crochets. Dès que vous souhaitez modifier l’interprétation, par exemple passer d’un ton normal à [worried], ajoutez simplement un audio tag.

Vous pouvez aussi utiliser plusieurs tags dans une même phrase et les combiner pour une interprétation plus nuancée, par exemple [tired] It’s been a long day… [upset] How many more days can I take?

L’architecture d’Eleven v3 permet au modèle de lire le contexte plus en profondeur que les modèles précédents. Il peut ainsi suivre les indications émotionnelles, les changements de ton, les transitions entre locuteurs et les indices contextuels sans paramètre ni réglage distinct. Indiquez simplement au modèle ce que requiert le moment, et il interprétera la réplique exactement comme vous l’avez prévu.

Eleven v3 gère également les dialogues entre plusieurs locuteurs avec spontanéité, y compris les interruptions, les changements d’humeur et les échanges naturels d’une vraie conversation, uniquement à partir des tags et de la structure du script. 

Audio Tags et SSML

Si vous avez déjà travaillé avec d’autres systèmes de synthèse vocale, vous connaissez probablement le Speech Synthesis Markup Language. Des plateformes comme Amazon Polly et Microsoft Azure Speech utilisent des tags SSML tels que <break> ou <emphasis> pour ajouter du contexte à un script de synthèse vocale. 

Eleven v3 ne prend pas en charge les tags de pause SSML ni le reste de l’ensemble des tags SSML. À la place, Audio Tags, la ponctuation et la structure même du texte remplissent ce rôle, tout en offrant un contrôle précis de l’interprétation.

Le tableau ci-dessous permet d’associer les tags SSML courants à leur équivalent dans Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Pour un rédacteur, ajouter [whispers] à une réplique demande bien moins d’efforts que de configurer un débit de prosodie.

Les catégories d’Audio Tags dans v3 : diriger l’interprétation avec les Audio Tags

Vous pouvez placer des Audio Tags n’importe où dans votre script pour modeler l’interprétation en temps réel. Vous pouvez aussi combiner plusieurs tags dans un script, voire dans une même phrase.

Les tags se répartissent dans les principales catégories suivantes.

Émotions

Ces tags vous aident à définir la tonalité émotionnelle de la voix, qu’elle soit sombre, intense ou enjouée. Vous pouvez par exemple utiliser un ou plusieurs tags parmi [sad], [angry], [happily] et [sorrowful].

[sorrowful] I couldn't sleep that night. The air was too still, and the moonlight kept sliding through the blinds like it was trying to tell me something.
[quietly] And suddenly,
that's when I saw it.
0:00
Okay, you are not going to believe this. You know how I've been totally stuck on that short story, like staring at the screen for hours, just nothing? [sighs] I was seriously about to just trash the whole thing, start over, give up probably.
But then [chuckles] last night, I was just doodling, not even thinking about it, right? And this one little phrase popped into my head, just completely out of the blue. And it wasn't even for the story initially, but then I typed it out just to see, and it was like the floodgates opened. Suddenly, I knew exactly where the character needed to go, what the ending had to be. It all just clicked. [sighs] I stayed up till like 3:00 a.m. just typing like a maniac. Didn't even stop for coffee. [chuckles] And it's, it's good, like really good. It feels so complete now, you know? Like it finally has a soul. [sighs] I am so incredibly pumped to finish editing it now. It went from feeling like a chore to feeling like
magic. Seriously, I'm still buzzing.
0:00

Interprétation et rythme

Ces tags concernent davantage le ton et l’interprétation. Ils permettent d’ajuster le volume et l’énergie pour les scènes exigeant retenue ou intensité. Ils incluent notamment [whispers], [shouts] et [softly].

Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Réactions humaines

Une parole véritablement naturelle inclut des réactions. Vous pouvez ainsi renforcer le réalisme en intégrant à la parole des moments naturels et non scénarisés. Les tags comme [laughs], [clears throat] et [sighs] contribuent à créer un modèle de synthèse vocale capable de restituer les émotions humaines.

D’autres exemples de catégories d’audio tags :

  • Accents et voix de personnages : Les tags d’accent font basculer la voix vers une région ou un personnage spécifique sans changer de modèle, comme [French accent], [British accent] ou [pirate voice]. Ils transforment une seule voix en une distribution flexible plutôt qu’en une interprétation figée.
  • Effets sonores : Les tags d’effets sonores ajoutent directement de l’audio non verbal à la génération, comme [gunshot], [explosion] et [clapping]. Ils conviennent particulièrement à l’audio immersif, aux jeux et aux narrations dramatisées, lorsque la scène exige davantage qu’une voix. Vous pouvez aussi utiliser le générateur d’effets sonores IA ElevenCreative.

Si les tags vous offrent un haut niveau de contrôle, vous pouvez aussi utiliser la ponctuation pour modeler le rythme et l’accentuation. Ajoutez par exemple des points de suspension pour une pause naturelle, ou des virgules pour créer des respirations naturelles. Essayez d’écrire un mot entièrement en majuscules pour l’accentuer : « Je le veux MAINTENANT. »

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00
Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00

Que pouvez-vous faire avec les Audio Tags ?

Les Audio Tags rendent la complexité émotionnelle des scripts accessible de façon intuitive. Écrivez naturellement, puis ajoutez des tags au fil du texte.

Voici un aperçu de quelques cas d’usage de la synthèse vocale émotionnelle avec les Audio Tags.

Conscience situationnelle dans l’audio IA

Des tags tels que [whisper] ou [shouting] permettent à Eleven v3 de réagir à la situation. Qu’il s’agisse d’adoucir un avertissement ou de maintenir une pause prolongée pour créer du suspense, vous pouvez intégrer une conscience situationnelle dynamique à votre script.

Pour une présentation complète, consultez notre guide sur la conscience situationnelle dans l’audio IA.

Diriger l’interprétation des personnages dans la parole

Lorsque vous créez un script comportant plusieurs personnages, il est essentiel de montrer clairement ce qui distingue chaque voix. En jouant sur leur personnalité avec [sarcastically] ou en définissant leur façon de parler avec [British accent], notre moteur de synthèse vocale vous permet de restituer toute une gamme d’émotions.

Découvrez comment diriger l’interprétation des personnages dans la parole IA.

Exprimer le contexte émotionnel dans la parole

Les Audio Tags vous permettent de modeler l’interprétation émotionnelle d’une réplique au fil de sa progression. Vous pouvez développer les émotions tout au long d’un discours et atteindre un crescendo au moment où vous imaginez votre personnage à son plein potentiel. Des tags comme [awe], [booming] et [big laugh] permettent d’intégrer tout un registre émotionnel à l’interprétation de votre voix IA.

En savoir plus sur l’utilisation du contexte émotionnel dans la parole IA. 

Donner vie aux dialogues entre plusieurs personnages

Pour créer des dialogues entre plusieurs personnages, vous pouvez commencer chaque réplique par un audio tag afin de construire des échanges riches entre les personnages. 

Prenons l’exemple suivant : Tom : [coughing] [beginning to speak] désolé, je suis un peu malade aujourd’hui… Emma : [interrupting] —Malade ? Tu sais à quel point je déteste la toux, Tom ! Tom : [surprised] Ce n’est qu’une petite toux, rien de grave. Comment réagirais-tu si… Emma : [overlapping] [annoyed] —Je pense que tu devrais rentrer chez toi. 

Découvrez ce que vous pouvez aussi faire avec les dialogues entre plusieurs personnages dans Eleven v3.

Contrôle précis de l’interprétation pour la parole IA

Avec Eleven v3, vous pouvez contrôler le rythme de la parole grâce aux Audio Tags ou à la ponctuation. Des tags comme [pause], [rushed] ou [drawn out] vous permettent de modeler précisément la réplique. Vous pouvez aussi ajouter des points de suspension, des points et des points d’exclamation pour insuffler naturellement de l’émotion à votre interprétation de synthèse vocale.

Nous avons rédigé un guide détaillé sur le contrôle précis de l’interprétation dans Eleven v3.

La synthèse vocale émotionnelle est disponible via l’API

Les Audio Tags fonctionnent de la même façon via l’API Text to Speech que dans l’interface d’ElevenLabs. Écrivez le tag directement dans le texte du script, et l’API renverra l’interprétation associée dans l’audio généré, des pipelines de livres audio aux voix off publicitaires. 

En savoir plus sur Eleven v3 ou réserver une démo pour commencer dès aujourd’hui.

FAQ sur les Audio Tags et la synthèse vocale émotionnelle

Articles similaires

Créez avec l'audio IA de la plus haute qualité