Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Liste des Audio Tags d’Eleven v4 : essayez-les, puis créez les vôtres

Rédigé par
Jack Limebear
Publié

ÉcouterÉcouter cet article

Eleven v4 est un modèle Text to Speech révolutionnaire qui transforme le texte en interprétation. Les Audio Tags vous permettent de diriger cette interprétation en contrôlant précisément son expression émotionnelle. Ajoutez une indication en langage naturel entre crochets, comme [whispers] ou [excited], et écoutez v4 adapter son interprétation.

Cette liste des Audio Tags d’ElevenLabs couvre toutes les émotions de la gamme complète des émotions d’Eleven v4, ainsi que des tags pour l’interprétation, le rythme, les réactions, les accents et les effets sonores. Une fois les bases acquises, nous vous montrerons aussi comment créer vos propres tags en langage clair.

Découvrez les émotions d’Eleven v4

Écouter la gamme
ExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTired

En résumé

  • Les Audio Tags sont des signaux en langage naturel placés entre crochets qu’Eleven v4 interprète comme des indications de jeu, modifiant sa façon de prononcer les mots qui suivent.
  • Eleven v4 est le modèle le mieux classé dans l’Artificial Analysis Speech Arena [September 2026], et les Audio Tags vous permettent de diriger l’interprétation ligne par ligne.
  • La roue des émotions d’Eleven v4 vous permet d’écouter différentes émotions pour obtenir rapidement un aperçu des capacités du modèle.
  • Les tags ne se limitent pas à une liste définie : vous pouvez créer les vôtres en combinant des qualités, comme [whispering, fearful], ou en décrivant la situation ou le personnage derrière une réplique.
  • Les Audio Tags fonctionnent via ElevenAPI sur Eleven v4, Eleven v4 Turbo et Eleven v3.

Que sont les Audio Tags d’ElevenLabs ?

Les Audio Tags sont des indications en langage naturel que vous pouvez intégrer à votre texte entre crochets. Eleven v4 les lit comme des marqueurs d’interprétation et les utilise comme directives pour modifier sa façon de prononcer certains mots ou phrases. Insérez-les directement dans votre script dans l’application ElevenLabs Text to Speech et regardez nos modèles leur donner vie.

Eleven v4 est le modèle TTS le mieux classé dans l’Artificial Analysis Speech Arena, où les auditeurs élisent le text to speech au rendu le plus naturel.1 Les Audio Tags vous permettent d’aller encore plus loin en dirigeant précisément l’interprétation de chaque ligne.

Voici comment utiliser les Audio Tags dans un script :

  • Placez un tag avant les mots qu’il affecte : lorsque vous écrivez « [shouts] I can’t believe you said that to me », toute la réplique est criée.
  • L’émotion se prolonge : lorsque vous ajoutez un tag, son émotion se prolonge sur toute la ligne. Vous n’avez donc besoin d’ajouter un autre tag que lorsque vous souhaitez modifier l’interprétation. Par exemple : « [proud] I’ve been cooking for over a decade. I know how to boil an egg. [startled] What’s that burning smell? »
  • Combinez les tags pour superposer les directives : séparez les Audio Tags par une virgule dans une même paire de crochets, comme [whispering, playful], afin d’ajouter des nuances à votre interprétation TTS.
  • Associez les tags à la ponctuation : les Audio Tags définissent l’ambiance et l’interprétation, tandis que la ponctuation de votre script contrôle naturellement le rythme. Ajoutez des points de suspension, des tirets ou des majuscules pour façonner la prosodie d’une ligne.

Pour comprendre plus en détail le fonctionnement des tags et la façon dont ils remplacent SSML, consultez notre guide complet des Audio Tags.

Text-to-speech leaderboard: Eleven v4 leads with 1319 Elo, ahead of Sonic 3.6. Take this further by selecting from the ElevenLabs Audio Tags list

Liste des Audio Tags d’émotion

La roue des émotions d’Eleven v4 présente des dizaines d’émotions, chacune interprétée par v4 afin que vous puissiez entendre la différence avant même d’écrire un tag. 

Cliquez sur une émotion ci-dessous pour l’écouter sur la roue, ou testez directement une phrase et une émotion pour entendre Eleven v4 donner vie aux Audio Tags émotionnels.

Bien que nous ayons présenté ici quelques émotions, vous pouvez utiliser le langage naturel pour exprimer toutes les émotions de votre choix. Dans l’exemple ci-dessous, nous utilisons différents Audio Tags qui ne figurent pas plus haut pour illustrer ce que permet le prompt en langage naturel.

[jittery] Okay, final question of the pub quiz, and we're tied for first. [intrigued] "Which planet has the most moons?" Hmm. [smug] Easy. It's Saturn, everyone knows that. [puzzled] Wait, why is Priya shaking her head? [disgusted] Jupiter? You want to write down Jupiter? [frazzled] We only have ten seconds, just pick one, pick one! [hopeful] [nervous] Fine. Saturn. Hand it in. [long pause] [triumphant] YES! Saturn! We won! [mischievous] [slightly pause] Priya, I believe you owe me a drink.
0:00

Cet exemple a pris vie avec Jonathan Livingston.

Liste des Audio Tags d’interprétation et de volume

Les tags d’interprétation et de volume contrôlent l’intensité ou le volume d’une réplique, indépendamment de l’émotion que vous lui associez. Pour donner à v4 une direction plus précise, superposez des tags d’interprétation et d’émotion afin d’obtenir un contrôle plus fin.

Voici quelques exemples :

  • [whispers] Ne bougez pas, c’est juste derrière vous.
  • [shouts] Tout le monde évacue le bâtiment, maintenant ! 
  • [softly] Vous avez fait tout ce que vous pouviez. 
  • [quietly] Je pense qu’ils sont partis. 
  • [low, threatening] Vous n’auriez vraiment pas dû venir ici.

Voyons le contrôle du volume et de l’interprétation en action.

[hushed] Eighteenth hole. One putt to win the championship, and the crowd has gone completely silent. [barely audible] He's lining it up now. The ball is rolling... still rolling... [booming] IT'S IN! HE'S DONE IT! The championship is his, and this place has gone absolutely wild! [disbelief] Twenty years I've been calling golf, and I have never seen anything like that.
0:00

L’exemple ci-dessus a pris vie avec Rod.

Liste des Audio Tags de rythme

Les Audio Tags de rythme modifient la vitesse d’une réplique. Ajoutez-les pour créer du suspense ou installer le moment comique parfait. Lorsque le timing compte autant que les mots, utilisez des tags de rythme.

Autre conseil : la ponctuation améliore naturellement le rendu du text to speech. Combinez-les pour contrôler pleinement la phrase : 

  • [slowly] Et le gagnant est... 
  • [rushed] Désolé, je suis en retard, le train est tombé en panne, j’ai couru tout le long. 
  • [pause] Puis le téléphone a sonné. 
  • [drawn out] Nooon, pas possible.
[slowly] Ten... nine... eight... seven... [rushed] Wait, wait, wait, hold the countdown, someone left their coffee on the console! [snappy] Can you get that out of here? [long pause] [drawn out] Okaaay, thank you. It's been moved. [excited] Resume the count! [speedy] Three... two... one... LIFTOFF!
0:00

Adam est la voix qui a donné vie à cet exemple.

Liste des Audio Tags de réactions humaines

Les tags de réaction ajoutent à vos phrases des sons tels que les rires, les halètements, les pleurs, les toux et les soupirs. Ils donnent réellement vie à votre texte et rendent un extrait audio TTS naturel, comme une personne qui parle spontanément plutôt que de lire un script.

Voici quelques Audio Tags de réaction :

  • [laughs] Vous êtes vraiment tombé dans le panneau ? 
  • [sighs] Très bien. Je ferai la vaisselle. 
  • [gasps] C’est un vrai diamant ? 
  • [clears throat] Si je pouvais avoir l’attention de tout le monde. 
  • [crying] Je ne pensais pas que vous reviendriez.

Eleven v4 ajoute aussi de petites touches humaines lorsque l’émotion l’exige. Écoutez la roue des émotions et vous entendrez des répliques comme « T-tu es revenu ? » et « Pff, c’est réel ? », où v4 a ajouté spontanément un bégaiement ou un grognement.

[clears throat] Hi, everyone. For those who don't know me, I'm the best man. [laughs] Well, I'm the only man Tom could find at short notice. [sighs] When Tom first told me about Adam, I thought, there's no way he’s real. [gasps] Sorry, is that the cake? It's enormous. Anyway. [starts crying] I've never seen him this happy. [laughs] Okay, I'm fine. I'm fine. To Tom and Adam!
0:00

Pour utiliser cette voix dans vos propres productions, recherchez Jack John. 

Liste des Audio Tags d’accent et de personnage

Créer des scènes riches avec différents accents ou voix de personnages n’a jamais été aussi simple avec Eleven v4. Avec quelques Audio Tags, vous pouvez faire évoluer une voix vers un nouveau personnage tout en préservant ses qualités fondamentales. Une seule voix peut interpréter toute une distribution en une génération.

  • [British accent] Envie d’une tasse de thé ?
  • [French accent] Bienvenue dans mon petit café.
  • [Australian accent] Pas de souci, mon pote, on va régler ça.
  • [pirate voice] Hisser les voiles et passez le rhum.
Let's visit four stops in thirty seconds. First, London. [British accent] Mind the gap. Lovely weather we're having. [excited] Next, Dublin! [Irish accent] Grand day for it, isn't it? Sure, a bit of rain never hurt anyone. [rushed] No time, no time, on to Sydney! [Australian accent] G'day! Watch out for the seagulls, they'll nick your chips. [pirate voice] Arg, now the high seas, where the tour ends and the treasure begins!
0:00

Lauren a contribué à donner vie à cet exemple.

Liste des Audio Tags d’effets sonores

Les Audio Tags d’effets sonores introduisent des événements non vocaux directement dans vos générations. Par exemple, pour créer une scène narrative ou une bande-son de jeu vidéo, vous pouvez les utiliser pour dramatiser la scène sans piste SFX distincte. Pour un effet spécifique, vous pouvez aussi utiliser le générateur d’effets sonores IA. 

  • [thunder rumbling] Ça se rapproche.
  • [footsteps] Quelqu’un monte les escaliers.
  • [door creaking] Allô ? Il y a quelqu’un ?
  • [clapping] Merci, merci, vous êtes trop gentils.
[owl hooting] [nervous] Did you hear that? [gulp] It's just an owl, right? [twig snapping] [nervous] Okay, owls don't do that. [many footsteps] [scared] Something's walking around the tent. [zipper opening] [startled] Wait, who just opened the tent? [dog barking] [laughs] Biscuit! You scared me half to death. [sighs] Fine, you can sleep in here too.
0:00

La voix de l’extrait ci-dessus est Siren.

Créez vos propres Audio Tags en langage naturel

Tous les Audio Tags affichés ci-dessus constituent un excellent point de départ. Mais la force du TTS d’ElevenLabs réside dans la possibilité de rédiger tout nouvel Audio Tag en langage naturel pour fournir au modèle un contexte supplémentaire. 

Sinon, si aucun tag d’un seul mot ne traduit ce que vous recherchez, écrivez une indication plus complète.

  • Combinez émotions et qualités : [tense, cautious] ou [whispering, fearful]
  • Décrivez la manière : [like a sports commentator, speeding up]
  • Décrivez la situation : [out of breath after running up the stairs]
  • Décrivez le personnage : [a tired detective who has heard it all before]
  • Décrivez l’évolution : [starting calm, then losing patience]
[hushed and reverent, like a nature documentary narrator] Here, in the quiet of the office kitchen, a rare creature emerges. [barely containing excitement] The intern. [slow and suspenseful] He approaches the last slice of birthday cake. He has been waiting for this moment all afternoon. [speeding up, like a sports commentator] He's going for it, he's reaching, he's almost there, he's- [sudden, crushed disappointment] Someone from accounts got there first. [hushed and reverent] Nature, as always, is cruel.
0:00

Donnez vie à votre scène avec Spuds Oxley. 

Conseils pour choisir vos Audio Tags 

Écrire en langage naturel vous donne une grande souplesse pour créer des extraits audio de text to speech, mais obtenir le résultat parfait peut aussi nécessiter quelques ajustements.

Pour une expérience TTS aussi fluide que possible avec Eleven v4, voici quelques conseils pour utiliser les Audio Tags :

  • Écoutez avant d’écrire : jouez quelques émotions sur la roue des émotions pour entendre comment v4 les interprète, ou vous en inspirer, puis choisissez celle qui correspond le mieux à votre réplique.
  • Changez le tag avant de réécrire la ligne : si l’interprétation ne convient pas, essayez une émotion voisine, comme [let down] plutôt que [despair], puis régénérez.
  • Utilisez un tag par proposition : des tags contradictoires sur les mêmes mots peuvent brouiller l’interprétation. Ajoutez un nouveau tag au moment où vous souhaitez que l’émotion change.
  • Donnez au modèle une scène complète : Eleven v4 est plus performant avec du contexte. Avec une fenêtre pouvant atteindre 10 000 caractères par génération dans l’application Text to Speech, vous disposez de l’espace nécessaire pour construire des directives détaillées et créer une scène saisissante.
  • Commencez par un préréglage, puis précisez. Si [nervous] est proche du résultat souhaité sans être tout à fait juste, décrivez ce qui manque : [nervous, trying to sound confident].

Mais surtout, ouvrez l’application TTS d’ElevenLabs et expérimentez : c’est la meilleure façon de vous familiariser rapidement avec l’outil et de produire un audio TTS de haute qualité.

Guide to six ElevenLabs audio tag list types and layering multiple cues with comma-separated tags.

Créez un audio immersif avec Eleven v4

Il n’existe pas de liste définitive des Audio Tags d’ElevenLabs, car vous pouvez créer toutes les combinaisons de votre choix en écrivant en langage naturel. Tous les tags de cette liste fonctionnent avec Eleven v4, tout comme ceux que vous imaginerez en écrivant votre scène.

Choisissez l’une des plus de 17 500 voix de la Voice Library, collez votre script et ajoutez votre premier Audio Tag pour commencer. 

En savoir plus sur Eleven v4 ou S'inscrire pour créer des interprétations audio remarquables.

FAQ sur les Audio Tags d’ElevenLabs

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 septembre 2026

Articles similaires

Créez avec l'audio IA de la plus haute qualité