Que sont les audio tags ? Le guide complet du TTS émotionnel
- Rédigé par
- Jack Limebear
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
Les Audio Tags sont des indications en langage naturel entre crochets, comme [laughs], [gasps], [excited] et [worried], qu’Eleven v3 interprète comme des directives d’interprétation plutôt que comme des mots à prononcer. Lorsque vous rédigez un script pour un modèle de synthèse vocale, l’insertion de ces Audio Tags vous offre un contrôle précis sur l’interprétation émotionnelle de votre texte.
Eleven v3 est devenu accessible au public en mars 2026. Avant v3, obtenir une interprétation émotionnelle précise d’un modèle Text to Speech impliquait de régénérer du contenu en espérant obtenir le bon résultat. Les Audio Tags éliminent cette part d’incertitude et vous donnent un contrôle total sur l’interprétation émotionnelle de la synthèse vocale.
Ce guide explique ce que sont les Audio Tags, comment ils fonctionnent, toutes les catégories disponibles et leur comparaison avec le SSML (Speech Synthesis Markup Language). Il présente également des cas d’usage courants, chacun renvoyant vers son guide dédié.
En résumé
- Les Audio Tags sont des indications entre crochets, comme [shouts] ou [excited], qui dirigent l’émotion, le rythme, l’interprétation et le ton de la synthèse vocale dans Eleven v3.
- Eleven v3 ne prend pas en charge le SSML, mais le remplace par les Audio Tags pour une expérience d’écriture plus naturelle.
- Les tags couvrent plusieurs catégories, dont les émotions, l’interprétation et le rythme, les réactions humaines, les accents et les effets sonores.
- La ponctuation et les majuscules dans votre texte vous permettent de modeler le rythme d’une interprétation par une voix IA.
- Vous pouvez accéder aux Audio Tags dans l’interface d’ElevenLabs ou via l’API.
Comment fonctionnent les Audio Tags ?
Les Audio Tags s’insèrent directement dans votre transcription, entre crochets. Dès que vous souhaitez modifier l’interprétation, par exemple passer d’un ton normal à [worried], ajoutez simplement un audio tag.
Vous pouvez aussi utiliser plusieurs tags dans une même phrase et les combiner pour une interprétation plus nuancée, par exemple [tired] It’s been a long day… [upset] How many more days can I take?
L’architecture d’Eleven v3 permet au modèle de lire le contexte plus en profondeur que les modèles précédents. Il peut ainsi suivre les indications émotionnelles, les changements de ton, les transitions entre locuteurs et les indices contextuels sans paramètre ni réglage distinct. Indiquez simplement au modèle ce que requiert le moment, et il interprétera la réplique exactement comme vous l’avez prévu.
Eleven v3 gère également les dialogues entre plusieurs locuteurs avec spontanéité, y compris les interruptions, les changements d’humeur et les échanges naturels d’une vraie conversation, uniquement à partir des tags et de la structure du script.
Audio Tags et SSML
Si vous avez déjà travaillé avec d’autres systèmes de synthèse vocale, vous connaissez probablement le Speech Synthesis Markup Language. Des plateformes comme Amazon Polly et Microsoft Azure Speech utilisent des tags SSML tels que <break> ou <emphasis> pour ajouter du contexte à un script de synthèse vocale.
Eleven v3 ne prend pas en charge les tags de pause SSML ni le reste de l’ensemble des tags SSML. À la place, Audio Tags, la ponctuation et la structure même du texte remplissent ce rôle, tout en offrant un contrôle précis de l’interprétation.
Le tableau ci-dessous permet d’associer les tags SSML courants à leur équivalent dans Eleven v3.
Pour un rédacteur, ajouter [whispers] à une réplique demande bien moins d’efforts que de configurer un débit de prosodie.
Les catégories d’Audio Tags dans v3 : diriger l’interprétation avec les Audio Tags
Vous pouvez placer des Audio Tags n’importe où dans votre script pour modeler l’interprétation en temps réel. Vous pouvez aussi combiner plusieurs tags dans un script, voire dans une même phrase.
Les tags se répartissent dans les principales catégories suivantes.
Émotions
Ces tags vous aident à définir la tonalité émotionnelle de la voix, qu’elle soit sombre, intense ou enjouée. Vous pouvez par exemple utiliser un ou plusieurs tags parmi [sad], [angry], [happily] et [sorrowful].
Interprétation et rythme
Ces tags concernent davantage le ton et l’interprétation. Ils permettent d’ajuster le volume et l’énergie pour les scènes exigeant retenue ou intensité. Ils incluent notamment [whispers], [shouts] et [softly].
Réactions humaines
Une parole véritablement naturelle inclut des réactions. Vous pouvez ainsi renforcer le réalisme en intégrant à la parole des moments naturels et non scénarisés. Les tags comme [laughs], [clears throat] et [sighs] contribuent à créer un modèle de synthèse vocale capable de restituer les émotions humaines.
D’autres exemples de catégories d’audio tags :
- Accents et voix de personnages : Les tags d’accent font basculer la voix vers une région ou un personnage spécifique sans changer de modèle, comme [French accent], [British accent] ou [pirate voice]. Ils transforment une seule voix en une distribution flexible plutôt qu’en une interprétation figée.
- Effets sonores : Les tags d’effets sonores ajoutent directement de l’audio non verbal à la génération, comme [gunshot], [explosion] et [clapping]. Ils conviennent particulièrement à l’audio immersif, aux jeux et aux narrations dramatisées, lorsque la scène exige davantage qu’une voix. Vous pouvez aussi utiliser le générateur d’effets sonores IA ElevenCreative.
Si les tags vous offrent un haut niveau de contrôle, vous pouvez aussi utiliser la ponctuation pour modeler le rythme et l’accentuation. Ajoutez par exemple des points de suspension pour une pause naturelle, ou des virgules pour créer des respirations naturelles. Essayez d’écrire un mot entièrement en majuscules pour l’accentuer : « Je le veux MAINTENANT. »
Que pouvez-vous faire avec les Audio Tags ?
Les Audio Tags rendent la complexité émotionnelle des scripts accessible de façon intuitive. Écrivez naturellement, puis ajoutez des tags au fil du texte.
Voici un aperçu de quelques cas d’usage de la synthèse vocale émotionnelle avec les Audio Tags.
Conscience situationnelle dans l’audio IA
Des tags tels que [whisper] ou [shouting] permettent à Eleven v3 de réagir à la situation. Qu’il s’agisse d’adoucir un avertissement ou de maintenir une pause prolongée pour créer du suspense, vous pouvez intégrer une conscience situationnelle dynamique à votre script.
Pour une présentation complète, consultez notre guide sur la conscience situationnelle dans l’audio IA.
Diriger l’interprétation des personnages dans la parole
Lorsque vous créez un script comportant plusieurs personnages, il est essentiel de montrer clairement ce qui distingue chaque voix. En jouant sur leur personnalité avec [sarcastically] ou en définissant leur façon de parler avec [British accent], notre moteur de synthèse vocale vous permet de restituer toute une gamme d’émotions.
Découvrez comment diriger l’interprétation des personnages dans la parole IA.
Exprimer le contexte émotionnel dans la parole
Les Audio Tags vous permettent de modeler l’interprétation émotionnelle d’une réplique au fil de sa progression. Vous pouvez développer les émotions tout au long d’un discours et atteindre un crescendo au moment où vous imaginez votre personnage à son plein potentiel. Des tags comme [awe], [booming] et [big laugh] permettent d’intégrer tout un registre émotionnel à l’interprétation de votre voix IA.
En savoir plus sur l’utilisation du contexte émotionnel dans la parole IA.
Donner vie aux dialogues entre plusieurs personnages
Pour créer des dialogues entre plusieurs personnages, vous pouvez commencer chaque réplique par un audio tag afin de construire des échanges riches entre les personnages.
Prenons l’exemple suivant : Tom : [coughing] [beginning to speak] désolé, je suis un peu malade aujourd’hui… Emma : [interrupting] —Malade ? Tu sais à quel point je déteste la toux, Tom ! Tom : [surprised] Ce n’est qu’une petite toux, rien de grave. Comment réagirais-tu si… Emma : [overlapping] [annoyed] —Je pense que tu devrais rentrer chez toi.
Découvrez ce que vous pouvez aussi faire avec les dialogues entre plusieurs personnages dans Eleven v3.
Contrôle précis de l’interprétation pour la parole IA
Avec Eleven v3, vous pouvez contrôler le rythme de la parole grâce aux Audio Tags ou à la ponctuation. Des tags comme [pause], [rushed] ou [drawn out] vous permettent de modeler précisément la réplique. Vous pouvez aussi ajouter des points de suspension, des points et des points d’exclamation pour insuffler naturellement de l’émotion à votre interprétation de synthèse vocale.
Nous avons rédigé un guide détaillé sur le contrôle précis de l’interprétation dans Eleven v3.
La synthèse vocale émotionnelle est disponible via l’API
Les Audio Tags fonctionnent de la même façon via l’API Text to Speech que dans l’interface d’ElevenLabs. Écrivez le tag directement dans le texte du script, et l’API renverra l’interprétation associée dans l’audio généré, des pipelines de livres audio aux voix off publicitaires.
En savoir plus sur Eleven v3 ou réserver une démo pour commencer dès aujourd’hui.




