Bonnes pratiques
Découvrez comment contrôler l’interprétation, la prononciation et l’émotion, et optimiser le texte pour la synthèse vocale.
Ce guide présente des techniques pour améliorer les résultats de synthèse vocale avec les modèles ElevenLabs. Testez ces méthodes pour déterminer celles qui répondent le mieux à vos besoins.
Contrôles
Nous travaillons activement sur le Director’s Mode pour vous donner encore plus de contrôle sur les résultats.
Ces techniques offrent une approche pratique pour obtenir des résultats nuancés en attendant le déploiement de fonctionnalités avancées comme le Director’s Mode.
Pauses
Eleven v4 et Eleven v3 ne prennent pas en charge les balises de pause SSML. Utilisez les techniques décrites dans la section Instructions pour Eleven v4 pour contrôler les pauses.
Utilisez <break time="x.xs" /> pour des pauses naturelles allant jusqu’à 3 secondes.
L’utilisation d’un trop grand nombre de balises break dans une même génération peut entraîner une instabilité. L’IA peut accélérer ou introduire des bruits supplémentaires ou des artefacts audio. Nous travaillons à résoudre ce problème.
- Cohérence : utilisez les balises
<break>de manière cohérente pour préserver un flux de parole naturel. Une utilisation excessive peut entraîner une instabilité. - Comportement propre à chaque voix : les voix peuvent gérer les pauses différemment, en particulier celles entraînées avec des sons d’hésitation comme « uh » ou « ah ».
Les alternatives à <break> comprennent les tirets (- ou —) pour les courtes pauses ou les points de suspension (…) pour un ton hésitant. Elles sont toutefois moins cohérentes.
Prononciation
API avec Eleven v4
Eleven v4 (eleven_v4) intègre une meilleure prise en charge native de l’Alphabet phonétique international, ou API, vous offrant un contrôle plus précis de la prononciation des noms, termes techniques et autres mots nécessitant un traitement particulier. La prononciation API est plus cohérente que dans les modèles précédents, mais les résultats peuvent encore varier selon la voix et l’expression. Nous vous recommandons de tester les prononciations importantes avec la voix choisie avant de vous y fier en production.
Contrairement aux anciens modèles qui nécessitent des balises de phonèmes de type XML, Eleven v4 comprend les symboles API lorsqu’ils sont placés entre des barres obliques dans votre texte :
La transcription API doit être :
- Placée entre des barres obliques (
/) au début et à la fin - Écrite avec des symboles API standard
- Placée entre guillemets doubles lorsqu’elle est transmise comme paramètre de chaîne
Exemples de code
Vous pouvez inclure plusieurs transcriptions API dans une même chaîne de texte :
Bonnes pratiques
- Utilisez les symboles API standard du tableau de l’Alphabet phonétique international
- Incluez les marques d’accentuation : accent tonique primaire (ˈ) et secondaire (ˌ) pour les mots à plusieurs syllabes
- Appliquez-les de manière sélective : encadrez uniquement les mots ou expressions nécessitant un contrôle de la prononciation
- Testez avec votre voix : les différentes voix peuvent interpréter l’API de façon légèrement différente
Résolution des problèmes
La prononciation reste incorrecte
Vérifiez l’exactitude de votre transcription API à l’aide d’un dictionnaire API. Incluez les marques d’accentuation (ˈ pour l’accent primaire, ˌ pour l’accent secondaire) pour les mots à plusieurs syllabes. Testez avec différentes voix, car certaines peuvent interpréter l’API plus précisément que d’autres.
Résultats incohérents avec la même transcription API
La prononciation API est plus cohérente que dans les modèles précédents, mais les résultats peuvent encore varier selon la voix et l’expression. Nous vous recommandons de tester les prononciations importantes avec la voix choisie avant de vous y fier en production. Si vous avez besoin d’un résultat cohérent, générez plusieurs fois et sélectionnez le meilleur résultat.
Balises de phonèmes pour les modèles v2
Spécifiez la prononciation à l’aide des balises de phonèmes SSML avec les modèles v2. Les alphabets pris en charge incluent l’Arpabet CMU et l’Alphabet phonétique international (API).
Les balises de phonèmes sont uniquement compatibles avec le modèle eleven_flash_v2.
Nous recommandons d’utiliser CMU Arpabet pour obtenir des résultats cohérents et prévisibles avec les modèles v2. Bien que l’API puisse être efficace, CMU Arpabet offre généralement des performances plus fiables.
Les balises de phonèmes ne fonctionnent que pour les mots individuels. Si vous avez un nom composé d’un prénom et d’un nom que vous souhaitez faire prononcer d’une certaine manière, vous devrez créer une balise de phonème pour chaque mot.
Veillez à marquer correctement l’accentuation des mots à plusieurs syllabes afin de conserver une prononciation exacte :
Balises d’alias
Pour les modèles qui ne prennent pas en charge les balises de phonèmes, vous pouvez essayer d’écrire les mots de manière plus phonétique. Vous pouvez également utiliser diverses astuces, comme les majuscules, les tirets, les apostrophes, ou même des guillemets simples autour d’une ou plusieurs lettres.
Par exemple, un mot comme « trapezii » pourrait s’écrire « trapezIi » pour accentuer davantage le « ii » du mot.
Vous pouvez remplacer le mot directement dans votre texte ou, si vous souhaitez spécifier une prononciation à l’aide d’autres mots ou expressions lorsque vous utilisez un dictionnaire de prononciation, vous pouvez utiliser des balises d’alias. Cela peut être utile si vous générez du contenu avec Multilingual v2, qui ne prend pas en charge les balises de phonèmes. Vous pouvez utiliser des dictionnaires de prononciation avec ElevenCreative Studio, Dubbing Studio et la synthèse vocale via l’API.
Par exemple, si votre texte comprend un nom dont la prononciation inhabituelle peut poser problème à l’IA, vous pouvez utiliser une balise d’alias pour préciser comment vous souhaitez qu’il soit prononcé :
Si vous voulez vous assurer qu’un acronyme est toujours prononcé d’une certaine manière lorsqu’il apparaît dans votre texte, vous pouvez utiliser une balise d’alias pour le préciser :
Dictionnaires de prononciation
Certains de nos outils, comme ElevenCreative Studio et Dubbing Studio, vous permettent de créer et d’importer un dictionnaire de prononciation. Ils vous permettent de spécifier la prononciation de certains mots, comme les noms de personnages ou de marques, ou de définir la manière dont les acronymes doivent être lus.
Les dictionnaires de prononciation offrent cette fonctionnalité en vous permettant d’importer un fichier de lexique ou de dictionnaire qui spécifie des paires de mots et leur prononciation, à l’aide d’un alphabet phonétique ou de substitutions de mots.
Lorsqu’un de ces mots est rencontré dans un projet, le modèle IA prononce le mot à l’aide du remplacement spécifié.
Pour fournir un fichier de dictionnaire de prononciation, ouvrez les paramètres d’un projet et importez un fichier au format TXT ou .PLS. Lorsqu’un dictionnaire est ajouté à un projet, celui-ci recalcule automatiquement les parties du projet qui doivent être reconverties avec le nouveau fichier de dictionnaire et les marque comme non converties.
Actuellement, nous ne prenons en charge que les dictionnaires de prononciation qui spécifient des remplacements à l’aide de balises de phonèmes ou d’alias.
Les phonèmes comme les alias sont des ensembles de règles qui spécifient un mot ou une expression recherchés, appelés graphèmes, ainsi que leur remplacement. Veuillez noter que les recherches sont sensibles à la casse. Lors de la recherche d’un mot de remplacement dans un dictionnaire de prononciation, le dictionnaire est parcouru du début à la fin et seul le tout premier remplacement est utilisé.
Exemples de dictionnaires de prononciation
Voici des exemples de dictionnaires de prononciation en CMU Arpabet et en API, incluant un phonème pour spécifier la prononciation de « Apple » et un alias pour remplacer « UN » par « United Nations » :
Pour générer un fichier .pls de dictionnaire de prononciation, plusieurs outils open source sont disponibles :
- Sequitur G2P - Outil open source qui apprend les règles de prononciation à partir de données et peut générer des transcriptions phonétiques.
- Phonetisaurus - Système G2P open source entraîné sur des dictionnaires existants comme CMUdict.
- eSpeak - Synthétiseur vocal capable de générer des transcriptions de phonèmes à partir de texte.
- CMU Pronouncing Dictionary - Dictionnaire anglais préétabli avec des transcriptions phonétiques.
Émotion
Exprimez les émotions par le contexte narratif ou des balises de dialogue explicites. Cette approche aide l’IA à comprendre le ton et l’émotion à reproduire.
Les balises de dialogue explicites produisent des résultats plus prévisibles que le seul contexte. Toutefois, le modèle prononcera également les indications de jeu émotionnelles. Vous pouvez les supprimer en post-production à l’aide d’un éditeur audio si vous ne les souhaitez pas.
Rythme
Le rythme de l’audio est fortement influencé par l’audio utilisé pour créer la voix. Lors de la création de votre voix, nous recommandons d’utiliser des échantillons plus longs et continus afin d’éviter les problèmes de rythme, comme une parole anormalement rapide.
Pour contrôler la vitesse de l’audio généré, vous pouvez utiliser le paramètre de vitesse. Il vous permet d’accélérer ou de ralentir la parole générée. Le paramètre de vitesse est disponible dans Text to Speech sur le site web et via l’API, ainsi que dans ElevenCreative Studio et Agents Platform. Vous le trouverez dans les paramètres de la voix.
La valeur par défaut est 1,0, ce qui signifie que la vitesse n’est pas ajustée. Les valeurs inférieures à 1,0 ralentissent la voix, jusqu’à un minimum de 0,7. Les valeurs supérieures à 1,0 accélèrent la voix, jusqu’à un maximum de 1,2. Les valeurs extrêmes peuvent affecter la qualité de la parole générée.
Le rythme peut également être contrôlé en écrivant dans un style narratif naturel.
Conseils
Problèmes courants
Pauses incohérentes : assurez-vous d’utiliser la syntaxe
<break time=“x.xs” />pour les pauses.- Erreurs de prononciation : utilisez les balises de phonèmes CMU Arpabet ou API pour une prononciation précise.
Émotion inadéquate : ajoutez un contexte narratif ou des balises explicites pour guider l’émotion. N’oubliez pas de supprimer tout texte d’indication émotionnelle en post-production.
Conseils pour améliorer les résultats
Testez d’autres formulations pour obtenir le rythme ou l’émotion souhaités. Pour les effets sonores complexes, décomposez les prompts en éléments plus petits et séquentiels, puis combinez les résultats manuellement.
Contrôle créatif
Bien que nous développions activement un « Director’s Mode » pour donner aux utilisateurs encore plus de contrôle sur les résultats, voici quelques techniques provisoires pour maximiser la créativité et la précision :
Style narratif
Rédigez les prompts dans un style narratif, semblable à l’écriture de scénarios, afin d’orienter efficacement le ton et le rythme.
Résultats superposés
Générez les effets sonores ou la parole par segments et superposez-les à l’aide d’un logiciel d’édition audio pour créer des compositions plus complexes.
Expérimentation phonétique
Si la prononciation n’est pas parfaite, testez des orthographes alternatives ou des approximations phonétiques afin d’obtenir le résultat souhaité.
Normalisation du texte
Lors de l’utilisation de Text to Speech avec des éléments complexes comme les numéros de téléphone, les codes postaux et les emails, ils peuvent être mal prononcés. Cela s’explique souvent par le fait que ces éléments précis ne figurent pas dans l’ensemble d’entraînement et que les modèles plus petits ne parviennent pas à généraliser leur prononciation. Ce guide explique quand ces écarts se produisent et comment les faire prononcer correctement.
La normalisation est activée par défaut pour tous les modèles TTS afin d’améliorer la prononciation des nombres, des dates et d’autres éléments de texte complexes.
Pourquoi les modèles lisent-ils les entrées différemment ?
Certains modèles sont entraînés pour lire les nombres et les expressions de manière plus naturelle. Par exemple, l’expression « $1,000,000 » est correctement lue comme « one million dollars » par le modèle Eleven Multilingual v2. Cependant, la même expression est lue comme « one thousand thousand dollars » par le modèle Eleven Flash v2.5.
Cela s’explique par le fait que le modèle Multilingual v2 est plus grand et peut mieux généraliser la lecture des nombres de manière plus naturelle pour les auditeurs, tandis que le modèle Flash v2.5 est bien plus petit et ne le peut donc pas.
Exemples courants
Les modèles Text to Speech peuvent rencontrer des difficultés avec les éléments suivants :
- Numéros de téléphone (« 123-456-7890 »)
- Devises (« $47,345.67 »)
- Événements de calendrier (« 2024-01-01 »)
- Heure (« 9:23 AM »)
- Adresses (« 123 Main St, Anytown, USA »)
- URL (« example.com/link/to/resource »)
- Abréviations d’unités (« TB » au lieu de « Terabyte »)
- Raccourcis (« Ctrl + Z »)
Solutions
Utiliser des modèles entraînés
Le moyen le plus simple d’atténuer ce problème consiste à utiliser un modèle TTS entraîné pour lire les nombres et les expressions de manière plus naturelle, comme le modèle Eleven Multilingual v2. Cela n’est toutefois pas toujours possible, par exemple si vous avez un cas d’usage où une faible latence est essentielle, comme les agents conversationnels.
Appliquer la normalisation dans les prompts LLM
Si vous utilisez un LLM pour générer le texte destiné au TTS, vous pouvez ajouter des instructions de normalisation au prompt.
Utilisez des prompts clairs et explicites
Les LLM répondent mieux à des instructions structurées et explicites. Votre prompt doit clairement indiquer que vous souhaitez convertir le texte dans un format lisible à voix haute.
Gérez les différents formats numériques
Tous les nombres ne se lisent pas de la même façon. Réfléchissez à la manière dont les différents types de nombres doivent être prononcés :
- Nombres cardinaux : 123 → « cent vingt-trois »
- Nombres ordinaux : 2nd → « deuxième »
- Valeurs monétaires : $45.67 → « quarante-cinq dollars et soixante-sept cents »
- Numéros de téléphone : « 123-456-7890 » → « un deux trois, quatre cinq six, sept huit neuf zéro »
- Décimales et fractions : « 3.5 » → « trois virgule cinq », « ⅔ » → « deux tiers »
- Chiffres romains : « XIV » → « quatorze » (ou « le quatorzième » s’il s’agit d’un titre)
Supprimez ou développez les abréviations
Les abréviations courantes doivent être développées pour plus de clarté :
- « Dr. » → « Docteur »
- « Ave. » → « Avenue »
- « St. » → « Rue » (mais « St. Patrick » doit rester inchangé)
Vous pouvez demander un développement explicite dans votre prompt :
Développez toutes les abréviations dans leur forme complète à prononcer.
Normalisation alphanumérique
La normalisation ne concerne pas uniquement les nombres. Certaines expressions alphanumériques doivent également être normalisées pour plus de clarté :
- Raccourcis : « Ctrl + Z » → « contrôle z »
- Abréviations d’unités : « 100km » → « cent kilomètres »
- Symboles : « 100% » → « cent pour cent »
- URL : « elevenlabs.io/docs » → « eleven labs point io barre oblique docs »
- Événements de calendrier : « 2024-01-01 » → « premier janvier deux mille vingt-quatre »
Prenez en compte les cas particuliers
Différents contextes peuvent nécessiter différentes conversions :
- Dates : « 01/02/2023 » → « deux janvier deux mille vingt-trois » ou « premier février deux mille vingt-trois » (selon les paramètres régionaux)
- Heure : « 14:30 » → « quatorze heures trente »
Si vous avez besoin d’un format précis, indiquez-le explicitement dans le prompt.
Tout réunir
Ce prompt constitue un bon point de départ pour la plupart des cas d’usage :
Utiliser des expressions régulières pour le prétraitement
Si vous utilisez du code pour envoyer un prompt à un LLM, vous pouvez utiliser des expressions régulières pour normaliser le texte avant de le fournir au modèle. Cette technique est plus avancée et nécessite quelques connaissances en expressions régulières. Voici quelques exemples simples :
Instructions pour Eleven v4
Cette section est consacrée à Eleven v4. Bon nombre des techniques ci-dessous s’appliquent également à Eleven v3. En général, Eleven v4 constitue une amélioration globale par rapport à Eleven v3 et offre de meilleurs résultats dans presque tous les cas. Nous vous recommandons vivement de passer à v4 et de la tester avec vos propres voix et contenus pour constater la différence. Quelques cas particuliers peuvent nécessiter une autre solution, mais v4 devrait être le meilleur choix pour la plupart des utilisateurs.
Pour en savoir plus sur les changements apportés au modèle, notamment le clonage de voix, la gestion des accents, les variantes et les comparaisons, consultez Eleven v4.
Eleven v4 et Eleven v3 ne prennent pas en charge les balises de pause SSML. Utilisez des balises audio, la ponctuation (points de suspension) et la structure du texte pour contrôler les pauses et le rythme.
Sélection de voix
La voix reste importante. Une interprétation déjà présente dans les données d’entraînement, comme un chuchotement, un cri ou une manière de parler particulière, est plus facile à reproduire pour le modèle. Demander quelque chose qui ne figure pas dans ces données est plus difficile. Eleven v4 suit les balises audio de façon plus fiable que les modèles précédents, même lorsque la voix n’a pas été entraînée pour cette interprétation. Une voix qui n’a jamais chuchoté devrait tout de même pouvoir suivre [whispering], et une voix qui n’a jamais crié devrait pouvoir suivre [shouting]. Cela peut toutefois être moins fiable et le résultat peut ne pas être optimal. Les premiers tests indiquent que cela fonctionne plutôt bien. Nous vous recommandons vivement de le tester vous-même avec la voix souhaitée et pour votre cas d’utilisation précis.
Balises audio
Les balises audio, par exemple [whispering], [shouting] et [laughing], vous permettent de diriger l’interprétation avec précision. Eleven v4 les gère avec un niveau de nuance supérieur à celui des modèles précédents. Elles ne sont pas encore parfaites, et nous continuons d’itérer pour améliorer la fiabilité avec laquelle le modèle suit leurs instructions. C’est un domaine dans lequel nous continuons d’investir, et les résultats continueront de s’améliorer.
Être explicite sur ce que vous souhaitez aide beaucoup. Comme Eleven v4 est entraîné à générer à la fois des styles d’interprétation vocale et des effets sonores, une balise peut parfois être interprétée comme une demande d’effet sonore plutôt que comme une instruction d’interprétation, ou inversement. Rédiger des balises qui décrivent clairement la qualité vocale souhaitée, par exemple [low, gravelly voice] plutôt qu’un texte pouvant être lu comme un signal sonore, aide le modèle à produire le résultat attendu. Nous vous recommandons de tester vos balises et formulations spécifiques pour votre cas d’utilisation. Cela devrait continuer de s’améliorer.
Les balises sont suivies plus facilement lorsque l’interprétation figure déjà dans les données d’entraînement de la voix. Eleven v4 peut
tout de même suivre une balise pour laquelle la voix n’a pas été entraînée, telle que [whispering] ou [shouting], bien que
le résultat puisse ne pas être optimal.
Liées à la voix
Ces balises contrôlent l’interprétation vocale et l’expression émotionnelle :
[laughs],[laughs harder],[starts laughing],[wheezing][whispers][sighs],[exhales][sarcastic],[curious],[excited],[crying],[snorts],[mischievously]
Effets sonores
Ajoutez des sons et effets d’ambiance :
[gunshot],[applause],[clapping],[explosion][swallows],[gulps]
Uniques et spéciaux
Balises expérimentales pour les applications créatives :
[strong X accent](remplacez X par l’accent souhaité)[sings],[woo],[fart]
Certaines balises expérimentales peuvent être moins cohérentes selon les voix. Testez-les minutieusement avant de les utiliser en production.
Ponctuation
La ponctuation influence fortement l’interprétation dans v4 :
- Les points de suspension (…) ajoutent des pauses et du poids
- Les majuscules renforcent l’emphase
- La ponctuation standard apporte un rythme naturel à la parole
Exemples à un seul locuteur
Utilisez les balises de manière intentionnelle et adaptez-les au caractère de la voix. Une voix méditative ne devrait pas crier ; une voix enthousiaste ne chuchotera pas de manière convaincante.
Monologue expressif
Dynamique et humoristique
Simulation de service client
Dialogue à plusieurs locuteurs
v4 peut gérer efficacement les prompts à plusieurs voix. Attribuez des voix distinctes de votre Voice Library à chaque locuteur pour créer des conversations réalistes.
Présentation de dialogue
Comédie absurde
Chevauchement temporel
Amélioration du texte saisi
Dans l’interface ElevenLabs, vous pouvez générer automatiquement des balises audio pertinentes pour votre texte en cliquant sur le bouton « Enhance ». En arrière-plan, cette fonctionnalité utilise un LLM pour améliorer votre texte avec le prompt suivant :
Conseils
Combinaisons de balises
Vous pouvez combiner plusieurs balises audio pour obtenir une interprétation émotionnelle complexe. Expérimentez différentes combinaisons afin de déterminer celles qui fonctionnent le mieux pour votre voix.
Correspondance avec la voix
Adaptez les balises au caractère et aux données d’entraînement de votre voix. Une voix sérieuse et professionnelle peut ne pas
bien répondre à des balises ludiques comme [giggles] ou [mischievously].
Structure du texte
La structure du texte influence fortement le résultat avec v4. Pour de meilleurs résultats, utilisez des schémas de parole naturels, une ponctuation appropriée et un contexte émotionnel clair.
Expérimentation
Il existe probablement de nombreuses balises efficaces au-delà de cette liste. Testez des états émotionnels et des actions descriptifs pour découvrir ce qui fonctionne pour votre cas d’utilisation précis.
Exemples
Interprétation vocale
Narration longue durée
Instructions pour Eleven v3
Les techniques de prompt décrites dans Instructions pour Eleven v4 s’appliquent également à Eleven v3, notamment la sélection de voix, les balises audio, la ponctuation et les dialogues à plusieurs locuteurs.
Les Professional Voice Clones (PVC) ne sont pas entièrement optimisés pour Eleven v3, ce qui peut entraîner une qualité de clonage inférieure à celle des modèles précédents. Les PVC sont pris en charge dans v4. Si vous souhaitez utiliser un Professional Voice Clone ou une voix de la Voice Library, nous vous recommandons plutôt d’essayer Eleven v4.