Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Guide du dictionnaire de prononciation : corrigez n’importe quel mot en TTS avec Eleven v4

Rédigé par
Jack Limebear
Publié

ÉcouterÉcouter cet article

Eleven v4 établit une nouvelle référence en matière de prononciation pour les modèles Text to Speech. Il traite les abréviations, termes techniques, noms et textes multilingues avec une précision inédite. Chaque marque possède toutefois son propre vocabulaire, des noms de produits uniques au jargon sectoriel. Vous devez donc garder un contrôle total sur la façon dont ces mots sont prononcés.

Eleven v4 propose plusieurs moyens de corriger la prononciation et vous offre un contrôle précis sur la façon dont le modèle s’exprime. Créez un dictionnaire de prononciation complet applicable à tous les scripts que vous rédigez dans l’application TTS. Vous pouvez aussi écrire directement l’API dans votre texte pour une correction ponctuelle.

Voici un bref exemple d’Eleven v4 interprétant un script rempli de termes complexes :

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

Ce guide explique comment créer et utiliser un dictionnaire de prononciation TTS, ainsi que les stratégies à employer pour que votre audio corresponde au plus près à ce que vous aviez imaginé.

En résumé

  • Un dictionnaire de prononciation est un ensemble de règles que vous rédigez pour indiquer à un modèle Text to Speech comment prononcer des mots ou expressions spécifiques.
  • Les règles de prononciation TTS reposent soit sur des alias, qui remplacent le texte, soit sur des phonèmes, qui utilisent une transcription phonétique.
  • Eleven v4 prend en charge les règles de phonèmes et l’API en ligne (Alphabet phonétique international).
  • Les balises SSML phoneme et break ne fonctionnent pas avec Eleven v4, mais vous pouvez utiliser un dictionnaire de prononciation ou des Audio Tags comme alternative en langage naturel.
  • Vous pouvez appliquer jusqu’à trois dictionnaires de prononciation par requête via ElevenAPI.

Qu’est-ce qu’un dictionnaire de prononciation ?

Un dictionnaire de prononciation vous permet de configurer précisément la manière dont un modèle Text to Speech prononce certains mots. En y ajoutant des mots ou expressions, vous définissez leur prononciation chaque fois qu’ils apparaissent dans un script TTS.

Les dictionnaires de prononciation sont généralement utilisés pour :

  • Noms de marque : Les noms de marque sont fréquemment ajoutés aux dictionnaires de prononciation, notamment lorsqu’ils présentent une orthographe unique ou inhabituelle.
  • Acronymes : Certains acronymes ont une prononciation précise. Par exemple, AEO doit se prononcer /ˌeɪ.iːˈoʊ/ (« A-E-O »), et non /eɪˈjoʊ/ (« ay-yo »). Une règle stricte du dictionnaire garantit que le modèle le prononce correctement à chaque occurrence.
  • Noms de lieux et autres noms propres : Certains noms de lieux peuvent se prononcer très différemment de ce que leur orthographe laisse imaginer. Worcestershire en est un exemple célèbre, pour lequel un guide de prononciation peut éviter tout problème.
  • Termes sectoriels : Le jargon professionnel ou les termes spécialisés des domaines médical ou juridique, par exemple, peuvent nécessiter un dictionnaire de prononciation si le modèle n’a pas été explicitement entraîné sur des données de ces secteurs.

En dehors du Text to Speech, les dictionnaires de prononciation sont généralement des répertoires participatifs d’extraits audio enregistrés par des locuteurs natifs. Les apprenants les utilisent pour entendre la prononciation de certains mots.

Different uses of pronunciation dictionaries in TTS apps

Comment contrôler la prononciation TTS avec Eleven v4

Eleven v4 est classé comme le modèle Text to Speech de la plus haute qualité par Provider Voice Arena d’Artificial Analysis.1 La capacité du modèle à traiter des textes complexes tout en produisant un rendu naturel contribue à faire d’Eleven v4 un leader du marché.

Pour offrir aux utilisateurs la meilleure expérience possible avec Eleven v4, le modèle propose plusieurs façons de personnaliser la prononciation afin que chaque résultat réponde à vos exigences de précision.

Voici comment contrôler la prononciation avec Eleven v4 :

  • API en ligne : Vous pouvez écrire l’API dans vos scripts entre des barres obliques afin d’indiquer la prononciation sans utiliser de dictionnaire. Nous détaillerons cette méthode un peu plus loin.
  • Règles de phonèmes dans les dictionnaires : Ajoutez des règles basées sur les phonèmes à vos dictionnaires de prononciation pour contrôler la prononciation phonétique des mots récurrents.
  • Prononciation fluide dans toutes les langues : Eleven v4 peut générer une parole naturelle dans plus de 90 langues. Préservez la prononciation native dans chaque langue tout en utilisant la même voix, pour une expérience de branding sonore cohérente.

Voici comment les différents modèles TTS d’ElevenLabs se comparent pour le contrôle de la prononciation :

Modèle

Règles d’alias (dictionnaire)

Règles de phonèmes (dictionnaire)

API en ligne (/.../)

Balises de phonèmes SSML (<phoneme>)

Eleven v4

Oui

Oui

Oui

Non

Eleven v4 Turbo

Oui

Oui

Oui

Non

Eleven v3

Oui

Oui

Oui

Non

Eleven Flash v2

Oui

Oui

Non

Oui (anglais uniquement)

Eleven Turbo v2

Oui

Non

Non

Oui (anglais uniquement)

Eleven Multilingual v2

Oui

Non

Non

Non

Pronunciation dictionary guide on ElevenLabs across different models

Quelle est la différence entre les règles d’alias et de phonèmes dans un dictionnaire de prononciation ?

Les règles de prononciation par alias remplacent un texte par un autre avant que le modèle ne prononce le mot. Cette opération s’effectue en arrière-plan chaque fois qu’un modèle génère de l’audio, en remplaçant la prononciation d’un mot ou d’une expression par celle définie dans votre dictionnaire de prononciation.

Voici quelques exemples de règles de prononciation par alias :

  • « SaaS » devient « sass »
  • « UN » devient « United Nations »
  • « OAuth » devient « oh auth »

À l’inverse, les règles de phonèmes fournissent au modèle une transcription phonétique exacte. Elles sont plus difficiles à créer, car vous devez rédiger ou générer vous-même la transcription API, puis l’ajouter à votre dictionnaire. Par exemple, « Kubernetes » devient /ˌkuː.bərˈnɛt.iːz/.

Comment corriger la prononciation d’un nom de marque dans un modèle TTS

Les noms de marque comptent parmi les entrées les plus fréquentes dans les dictionnaires de prononciation, car ce ne sont pas toujours de vrais mots. Si votre entreprise a inventé un mot ou une orthographe unique pour votre marque, les modèles TTS peuvent avoir du mal à le prononcer correctement, faute de données d’entraînement accessibles contenant cette prononciation précise.

Voici comment corriger la prononciation d’un nom de marque dans Eleven v4 :

  1. Testez la prononciation par défaut : Ouvrez l’application Text to Speech et saisissez votre nom de marque. Générez un extrait et écoutez le résultat. En cas d’erreur de prononciation, passez à l’étape suivante.
  2. Essayez une règle d’alias : La manière la plus simple de corriger une erreur de prononciation d’une marque consiste à créer une règle d’alias. Elles sont rapides à rédiger et intuitives.
  3. Passez à une règle de phonèmes : Si votre règle d’alias ne fonctionne pas parfaitement, utilisez l’API. Transcrivez le nom de votre marque en API, puis créez une règle dans le dictionnaire de prononciation Text to Speech pour en corriger la prononciation.
  4. Couvrez toutes les capitalisations : Veillez à inclure la transcription API pour les versions en minuscules et en majuscules du nom de votre marque, si vous utilisez les deux.
  5. Utilisez l’API en ligne pour les modifications ponctuelles : Si vous souhaitez uniquement une correction rapide pour une génération ponctuelle, ajoutez simplement l’API directement à votre script plutôt que de configurer une entrée de dictionnaire.

Une fois la règle de nom de marque établie, elle sera disponible dans tous vos projets partagés, que ce soit dans votre agent IA ou via une API.

Comment créer un dictionnaire de prononciation avec ElevenLabs

Vous pouvez créer un dictionnaire de prononciation en ajoutant des règles dans l’application Text to Speech, en important un fichier .pls ou via ElevenAPI. Dans ce guide, nous abordons la première option, qui ne demande que quelques étapes.

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

Voici les étapes à suivre pour créer un dictionnaire de prononciation :

  1. Ouvrez le panneau des dictionnaires de prononciation : Depuis la page Text to Speech, cliquez sur la barre de recherche en haut, saisissez « Pronunciation dictionary », puis sélectionnez Pronunciation dictionaries sous Actions.
  2. Créez ou choisissez un dictionnaire : Cliquez sur New pour créer un dictionnaire ou sélectionnez-en un existant dans la liste à gauche.
  3. Ajoutez une règle : Cliquez sur Add rule pour créer une ligne. Saisissez le mot à corriger. Dans le champ Input, entrez le mot ou l’expression exactement comme il apparaît dans vos scripts. Les règles tiennent compte des majuscules et minuscules, veillez donc à respecter la capitalisation utilisée.
  4. Choisissez le type de règle : Sélectionnez Alias pour remplacer le texte ou Phoneme pour saisir une transcription API ou CMU.
  5. Saisissez le remplacement : Saisissez l’alias ou la transcription phonétique dans le champ Output. Utilisez le sélecteur de voix en haut du panneau pour écouter la règle avec la voix sur laquelle vous travaillez.
  6. Enregistrez vos modifications : Cliquez sur Save changes en bas du panneau.

Pour associer un guide de prononciation à un agent ou en appliquer un via l’API, consultez notre documentation sur les dictionnaires de prononciation.

Comment utiliser l’API dans le Text to Speech avec Eleven v4

Pour de petites modifications ou des mots peu courants, vous n’avez pas nécessairement besoin de créer une entrée dans votre dictionnaire de prononciation TTS pour corriger une erreur. Utilisez plutôt l’API en ligne pour indiquer précisément comment le modèle doit prononcer un mot.

Dans Eleven v4, activez l’API en ligne à l’aide de barres obliques. Comme les Audio Tags, elle s’insère directement dans votre script pour simplifier le processus. Voici quelques exemples d’API dans Eleven v4 :

  • Termes techniques : Le terme « /ˌbaɪoʊˈkemɪstri/ » désigne l’étude des processus chimiques.
  • Vocabulaire médical : « /ɡluːˈkoʊs/ » et « /ˈɪnsjəlɪn/ » sont couramment utilisés pour traiter des pathologies telles que « /ˌdaɪəˈbiːtiːz/ ».
  • Noms de marques et de produits : Nos serveurs fonctionnent avec « /ˌɛndʒɪnˈɛks/ » pour gérer les pics de trafic.

À titre indicatif, et pour les personnes sans formation en linguistique, un convertisseur API vous aidera à obtenir la transcription API adaptée à coller dans votre script à partir d’une saisie en langage naturel.

Pourquoi les balises de phonèmes SSML ne fonctionnent pas avec Eleven v4

Eleven v4 ne prend pas en charge le SSML. Il privilégie des fonctionnalités plus flexibles, telles que les Audio Tags et les dictionnaires de prononciation, qui vous donnent davantage de contrôle sur la production audio finale.

Chaque fonctionnalité du SSML dispose d’un équivalent direct dans v4 :

Balise SSML

Fonction

Équivalent dans Eleven v4

<phoneme>

Définit une prononciation phonétique

API en ligne (/…/) ou règle de phonèmes dans un dictionnaire

<sub alias>

Remplace le texte avant la prononciation

Règle d’alias dans un dictionnaire

<break>

Ajoute une pause

Des Audio Tags tels que [pause], des points de suspension ou des sauts de ligne

<prosody rate>

Modifie le débit de parole

Des Audio Tags de rythme tels que [slowly] ou [rushed]

<emphasis>

Accentue un mot

Des majuscules ou un Audio Tag d’interprétation

Commencez à créer des prononciations Text to Speech naturelles avec Eleven v4

Grâce aux nombreux outils qui améliorent la précision des prononciations dans Eleven v4, rédigez des scripts détaillés et laissez le modèle les interpréter comme vous l’aviez imaginé.

Créez des dictionnaires de prononciation dans l’application Text to Speech d’ElevenLabs et appliquez-les à grande échelle avec ElevenAPI.

S'inscrire pour commencer ou en savoir plus sur Eleven v4 dès aujourd’hui.

FAQ

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 septembre 2026

Articles similaires

Créez avec l'audio IA de la plus haute qualité