Aller au contenu

Que sont les audio tags ? Le guide complet du TTS émotionnel

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Les audio tags sont des indications en langage naturel entre crochets, comme [laughs], [gasps], [excited] et [worried], qu’Eleven v3 interprète comme des instructions d’interprétation plutôt que comme des mots à prononcer. Lorsque vous écrivez un script pour un modèle de synthèse vocale, l’insertion de ces audio tags vous offre un contrôle précis sur l’expression émotionnelle de votre texte. 

Eleven v3 est devenu accessible au public en mars 2026. Avant v3, obtenir une interprétation émotionnelle précise d’un modèle de Text to Speech impliquait de régénérer du contenu en espérant le meilleur. Les audio tags éliminent cette incertitude et vous donnent un contrôle total sur l’interprétation émotionnelle de la synthèse vocale.

Ce guide explique ce que sont les audio tags, leur fonctionnement, toutes les catégories disponibles et leur comparaison avec le SSML (Speech Synthesis Markup Language). Nous abordons également les cas d’usage courants, chacun renvoyant vers son guide dédié.

En résumé :

  • Les audio tags sont des indications entre crochets, comme [shouts] ou [excited], qui guident l’émotion, le rythme, l’interprétation et le ton dans le TTS d’Eleven v3.
  • Eleven v3 ne prend pas en charge le SSML, mais le remplace par des audio tags pour une écriture plus naturelle.
  • Les tags couvrent plusieurs catégories : émotions, interprétation et rythme, réactions humaines, accents et effets sonores.
  • La ponctuation et les majuscules dans votre texte vous permettent de façonner le rythme d’une interprétation par une voix IA.
  • Vous pouvez accéder aux audio tags sur ElevenLabs via l’interface ou l’API.

Comment fonctionnent les audio tags ?

Les audio tags s’insèrent directement dans votre transcript, entre crochets. Lorsque vous souhaitez modifier l’interprétation, par exemple pour passer d’un ton normal à [worried], il vous suffit d’ajouter un audio tag.

Vous pouvez aussi utiliser plusieurs tags dans une même phrase et les combiner pour une interprétation plus nuancée, par exemple : [tired] La journée a été longue… [upset] Combien de jours encore vais-je tenir ?

L’architecture d’Eleven v3 permet au modèle de comprendre le contexte plus profondément que les modèles précédents. Il peut ainsi suivre les indications émotionnelles, les changements de ton, les transitions entre intervenants et les indices contextuels sans paramètre ni réglage distinct. Indiquez simplement au modèle ce que requiert la scène : il interprétera la réplique comme vous l’avez prévu.

Eleven v3 gère également les dialogues à plusieurs intervenants avec naturel : interruptions, changements d’humeur et échanges fluides d’une véritable conversation, uniquement à partir des tags et de la structure du script. 

Audio tags ou SSML

Si vous avez travaillé avec d’autres systèmes TTS, vous avez probablement rencontré le Speech Synthesis Markup Language. Certaines plateformes utilisent des tags SSML tels que <break> ou <emphasis> pour apporter davantage de contexte à un script TTS. 

Eleven v3 ne prend pas en charge les tags de pause SSML ni les autres tags SSML. Les audio tags, la ponctuation et la structure même du texte remplissent ce rôle tout en offrant un contrôle précis de l’interprétation.

Le tableau ci-dessous vous permet d’associer les tags SSML courants à leur équivalent dans Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Pour un auteur, ajouter [whispers] à une réplique demande bien moins d’efforts que de configurer une vitesse de prosodie.

Les catégories d’audio tags dans v3 : diriger l’interprétation avec les audio tags

Vous pouvez placer des audio tags n’importe où dans votre script pour façonner l’interprétation en temps réel. Vous pouvez aussi combiner plusieurs tags dans un script, voire dans une même phrase.

Les tags se répartissent dans les grandes catégories suivantes.

Émotions

Ces tags vous aident à définir le ton émotionnel de la voix, qu’il soit grave, intense ou enthousiaste. Vous pouvez par exemple utiliser un ou plusieurs tags parmi [sad], [angry], [happily] et [sorrowful].

Background
Background

Interprétation et rythme

Ces tags concernent davantage le ton et l’interprétation. Ils permettent d’ajuster le volume et l’énergie des scènes qui demandent retenue ou intensité. Par exemple : [whispers], [shouts] et [softly].

Background
Background

Réactions humaines

Une parole véritablement naturelle inclut des réactions. Vous pouvez ajouter du réalisme en intégrant à la parole des instants naturels et non scénarisés. Des tags comme [laughs], [clears throat] et [sighs] contribuent à créer un modèle TTS capable de restituer l’émotion humaine.

Voici d’autres exemples de catégories d’audio tags :

  • Accents et voix de personnages : Les tags d’accent font adopter à la voix une région ou un personnage précis sans changer de modèle, par exemple [French accent], [British accent] ou [pirate voice]. Ils transforment une voix unique en une distribution flexible, plutôt qu’en une interprétation figée.
  • Effets sonores : Les tags d’effets sonores ajoutent directement à la génération des éléments audio non verbaux, comme [gunshot], [explosion] et [clapping]. Ils conviennent aux expériences audio immersives, aux jeux et aux narrations dramatisées, lorsque la scène exige plus qu’une voix. Vous pouvez également utiliser le générateur d’effets sonores IA ElevenCreative.

Les tags vous offrent un haut degré de contrôle, mais vous pouvez aussi utiliser la ponctuation pour façonner le rythme et l’accentuation. Ajoutez par exemple des points de suspension pour une pause naturelle ou des virgules pour créer des respirations naturelles. Écrivez un mot entièrement en majuscules pour l’accentuer : « Je le veux MAINTENANT. »

Background
Background

Que pouvez-vous faire avec les audio tags ?

Les audio tags révèlent intuitivement toute la complexité émotionnelle des scripts. Écrivez naturellement et ajoutez des tags au fil du texte.

Voici un aperçu de quelques cas d’usage du TTS émotionnel avec les audio tags.

Conscience situationnelle dans l’audio IA

Des tags comme [whisper] ou [shouting] permettent à Eleven v3 de réagir à la situation. D’un avertissement adouci à une pause prolongée pour créer du suspense, vous pouvez intégrer une conscience situationnelle dynamique à votre script.

Pour une présentation complète, consultez notre guide sur la conscience situationnelle dans l’audio IA.

Diriger l’interprétation des personnages dans la parole

Lorsque vous créez un script avec plusieurs personnages, vous devez clairement montrer en quoi chaque voix est différente. De l’ajustement de leur personnalité avec [sarcastically] à la définition de leur façon de parler avec [British accent], notre moteur TTS vous permet de couvrir toute la palette des émotions.

Découvrez comment diriger l’interprétation des personnages dans la parole IA.

Exprimer le contexte émotionnel dans la parole

Les audio tags vous permettent de façonner l’interprétation émotionnelle d’une réplique à mesure qu’elle progresse. Vous pouvez développer les émotions tout au long d’un discours, jusqu’au crescendo au moment où vous imaginez votre personnage atteindre son plein potentiel. Des tags comme [awe], [booming] et [big laugh] permettent d’intégrer toute une palette émotionnelle à l’interprétation de votre voix IA.

En savoir plus sur l’utilisation du contexte émotionnel dans la parole IA

Donner vie aux dialogues à plusieurs personnages

Pour créer des dialogues à plusieurs personnages, vous pouvez commencer chaque réplique par un audio tag afin de construire des échanges riches entre les personnages. 

Prenons l’exemple suivant : Tom : [coughing] [beginning to speak] désolé, je suis un peu malade aujourd’hui— Emma : [interrupting] —Malade ? Tu sais à quel point je déteste la toux, Tom ! Tom : [surprised] Ce n’est qu’une petite toux, rien de grave. Comment réagirais-tu si— Emma : [overlapping] [annoyed] —Je pense que tu devrais rentrer chez toi. 

Découvrez ce que vous pouvez encore faire avec les dialogues à plusieurs personnages dans Eleven v3.

Contrôle précis de l’interprétation pour la parole IA

Avec Eleven v3, vous pouvez contrôler le rythme de la parole grâce aux audio tags ou à la ponctuation. Des tags comme [pause], [rushed] ou [drawn out] vous permettent de façonner précisément une réplique. Vous pouvez aussi ajouter des points de suspension, des points et des points d’exclamation pour intégrer naturellement l’émotion à votre interprétation TTS.

Nous avons rédigé un guide détaillé sur le contrôle précis de l’interprétation dans Eleven v3.

Le TTS émotionnel est disponible via l’API

Les audio tags fonctionnent de la même manière via l’API Text to Speech que dans l’interface ElevenLabs. Insérez le tag directement dans le texte du script et l’API renverra l’interprétation correspondante dans l’audio généré, des pipelines de livres audio aux voix off publicitaires. 

En savoir plus sur Eleven v3 ou contacter l’équipe commerciale pour commencer dès aujourd’hui.

FAQ sur les audio tags et le TTS émotionnel

Articles similaires

Créez avec l'audio IA de la plus haute qualité