Conception de voix
Guide pour créer des voix à partir d’une invite textuelle.
Vue d’ensemble
La Conception de voix aide les créateurs à combler les lacunes lorsque la voix exacte qu’ils recherchent n’est pas disponible dans la Voice Library. Si vous ne trouvez pas de voix adaptée à votre projet, vous pouvez en créer une. La Conception de voix est idéale pour explorer et itérer rapidement, et la qualité du résultat peut varier selon votre invite et votre cas d’usage. Si vous avez besoin d’une qualité plus constante, prête pour la production, les clones de voix professionnels (PVC) sont actuellement les voix de la plus haute qualité sur notre plateforme. Si un PVC correspondant à vos besoins est disponible dans notre bibliothèque, nous vous recommandons donc de l’utiliser.
Vous trouverez la Conception de voix en allant dans Voix -> Mes voix -> Ajouter une nouvelle voix -> Conception de voix dans l’application ElevenLabs ou via l’API.
Lorsque vous cliquez sur générer, nous créons trois options de voix. La seule facturation liée à l’utilisation de la conception de voix correspond au nombre de crédits requis pour générer votre texte d’aperçu. Ces crédits ne sont facturés qu’une seule fois, même si nous générons trois échantillons. Vous pouvez voir le nombre de caractères qui sera déduit dans la zone de texte « Texte à prévisualiser ».
Après la génération, vous pouvez sélectionner et enregistrer l’une des voix générées, qui occupera un de vos emplacements de voix.
Guide de rédaction des invites
L’invite est le fondement de votre voix. Elle indique au modèle le type de voix que vous cherchez à créer : de l’accent et du type de personnage au genre et à l’atmosphère de la voix. Une invite bien rédigée peut faire la différence entre une voix générique et une voix qui correspond réellement à votre vision. En général, les invites plus descriptives et plus détaillées produisent des résultats plus précis et nuancés. Plus vous fournissez de détails, notamment sur l’âge, le genre, le ton, l’accent, le rythme, l’émotion, le style et bien plus encore, mieux le modèle peut interpréter votre demande et générer une voix intentionnelle et sur mesure.
Toutefois, des invites courtes et simples peuvent aussi fonctionner, notamment si vous recherchez une voix plus neutre ou polyvalente. Par exemple, « Un narrateur calme » peut vous donner exactement ce dont vous avez besoin sans entrer dans les détails, en particulier si vous ne cherchez pas à créer un personnage ou un style très précis. Le bon niveau de détail dépend de votre cas d’usage. Créez-vous un personnage fantastique ? Un assistant virtuel ? Une New-Yorkaise d’une soixantaine d’années, fatiguée, avec un humour pince-sans-rire ? Plus vous le définissez clairement dans votre invite, plus le résultat se rapprochera de ce que vous imaginez.
Format d’invite recommandé
Pour des résultats cohérents, structurez votre invite selon ce format :
Exemple :
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
Erreurs fréquentes à éviter
- N’utilisez pas « accent » lorsque vous voulez dire « intonation » : cela peut entraîner des changements de dialecte indésirables. Décrivez plutôt l’intonation, l’accentuation ou les modes de diction.
- Évitez les termes d’effets sonores : des termes comme « reverb », « echo », « phone » ou « tape » peuvent nuire à la qualité du résultat.
- Indiquez explicitement la langue et le dialecte : précisez toujours la langue et la variante régionale dans la première phrase afin d’éviter les dérives.
Qualité audio
La qualité audio désigne la clarté, la netteté et la fidélité globale de la voix générée. Par défaut, ElevenLabs vise à produire un audio clair et naturel. Si votre projet exige un niveau de qualité spécifique, il est préférable de le préciser explicitement dans votre invite.
Pour des résultats de haute qualité, vous pouvez aider le modèle en ajoutant une expression telle que « perfect audio quality » ou « studio-quality recording » à votre description de voix. Cela permet de garantir un rendu vocal d’une clarté maximale, avec une distorsion minimale et une finition soignée.
Vous pouvez aussi utiliser des descripteurs de qualité précis qui produisent des résultats cohérents :
- Qualité correcte
- Bonne qualité
- Très bonne qualité
- Excellente qualité
- Qualité studio
- Qualité diffusion
Ces descripteurs aident à obtenir une qualité audio élevée lorsqu’ils sont inclus dans votre invite.
L’inclusion de ce type d’expressions peut parfois réduire la précision globale de l’invite si la voix est très spécifique ou de niche.
Dans certains cas créatifs, une qualité audio inférieure peut aussi être intentionnelle, par exemple pour simuler un appel téléphonique, une ancienne émission de radio ou des images trouvées. Dans ces situations, n’utilisez aucun descripteur de qualité ou incluez explicitement des expressions comme :
- « Audio basse fidélité »
- « Mauvaise qualité audio »
- « Sonne comme un message vocal »
- « Étouffé et lointain, comme sur un vieux magnétophone »
L’emplacement de cette expression dans votre invite est flexible : elle peut apparaître au début ou à la fin, et nous avons constaté que les deux fonctionnent bien.
Âge, ton/timbre et genre
Ces trois caractéristiques constituent la base de la conception vocale, car elles façonnent l’identité globale et la résonance émotionnelle de la voix. Plus vous fournissez de détails, plus l’IA peut facilement produire une voix qui correspond à votre vision créative, que vous créiez un personnage crédible, conceviez un narrateur captivant ou développiez un assistant virtuel.
Âge
Décrire l’âge perçu de la voix permet de définir sa maturité, sa texture vocale et son énergie. Utilisez des termes précis pour orienter l’IA vers la bonne qualité vocale.
Descripteurs utiles :
- « Adolescent » / « adolescente »
- « Jeune adulte » / « dans la vingtaine » / « au début de la trentaine »
- « Homme d’âge mûr » / « femme dans la quarantaine »
- « Homme âgé » / « femme âgée » / « homme dans la quatre-vingtaine »
Ton/timbre
Désigne la qualité physique de la voix, façonnée par la hauteur, la résonance et la texture vocale. Il se distingue de l’expression émotionnelle ou de l’attitude.
Descripteurs courants de ton/timbre :
- « Profond » / « grave »
- « Doux » / « riche »
- « Rauque » / « éraillé »
- « Nasillard » / « strident »
- « Aérien » / « soufflé »
- « Puissant » / « résonant »
- « Léger » / « fin »
- « Chaud » / « feutré »
- « Métallique » / « ferreux »
Genre
Le genre influence souvent la hauteur, le poids vocal et la présence tonale, mais vous pouvez dépasser les catégories simples en décrivant le son plutôt que l’identité.
Exemples :
- « Une voix féminine grave et rauque »
- « Une voix masculine profonde et résonante »
- « Un genre neutre, doux et de hauteur moyenne »
Accent
L’accent joue un rôle essentiel dans la définition de l’identité régionale, culturelle et émotionnelle d’une voix. Si votre projet repose sur un son authentique, qu’il s’inscrive dans le réalisme ou soit stylisé pour un personnage, il est essentiel d’indiquer clairement et précisément l’accent souhaité.
Le choix des termes compte : certains produisent des résultats plus cohérents. Par exemple, « prononcé » donne souvent de meilleurs résultats que « fort » pour décrire l’intensité d’un accent. Cela demande beaucoup d’essais et d’ajustements ; nous vous encourageons à expérimenter les formulations et à être aussi créatif et descriptif que possible.
Soyez prudent avec le mot « accent » : si vous désignez des schémas d’intonation ou d’emphase plutôt qu’un dialecte régional, utilisez plutôt ces termes. Employer « accent » pour parler d’intonation peut entraîner des changements de dialecte indésirables.
- Exemples de prompts d’accent clairs :
- « Un homme d’âge mûr avec un accent français prononcé »
- « Une jeune femme avec un léger accent traînant du Sud »
- « Un vieil homme avec un fort accent d’Europe de l’Est »
- « Une femme enjouée parlant avec un accent britannique net »
- « Un jeune homme avec une légère intonation irlandaise »
- « Une voix autoritaire avec un accent américain neutre »
- « Un homme avec un accent régional australien, décontracté et nasillard »
Évitez les descripteurs trop vagues comme « étranger » ou « exotique » : ils manquent de précision et peuvent produire des résultats incohérents.
Associez l’accent à d’autres caractéristiques comme le ton, l’âge ou le rythme pour mieux contrôler le résultat. Par exemple : « Une vieille femme sarcastique avec un fort accent new-yorkais, qui parle lentement. »
Pour les voix fantastiques ou fictives, vous pouvez proposer des accents réels comme source d’inspiration :
- « Un elfe avec un bon gros accent britannique. Il est royal et lyrique. »
- « Un gobelin avec un accent rauque d’Europe de l’Est. »
Rythme
Le rythme désigne la vitesse et la cadence auxquelles une voix parle. C’est un élément clé pour façonner la personnalité, le ton émotionnel et la clarté de la voix. Il est essentiel d’être explicite sur le rythme, en particulier lors de la conception de voix pour des cas d’usage précis comme la narration, la publicité, les dialogues de personnages ou le contenu pédagogique.
Utilisez un langage clair pour décrire à quelle vitesse la voix doit parler. Vous pouvez aussi décrire la sensation produite par le rythme, qu’il soit régulier, irrégulier, posé ou léger. Si le rythme change, indiquez clairement où et pourquoi.
Exemples de descripteurs de rythme :
- « Parle rapidement » / « à un rythme rapide »
- « À un rythme normal » / « parle normalement »
- « Parle lentement » / « avec un rythme lent »
- « Rythme posé et mesuré »
- « Étire les mots, comme pour savourer chacun d’eux »
- « Avec une cadence précipitée, comme s’il était pressé »
- « Rythme détendu et conversationnel »
- « Rythme cadencé et musical »
- « Rythme irrégulier, avec des pauses et accélérations soudaines »
- « Rythme régulier, avec un intervalle constant entre les mots »
- « Débit saccadé »
Texte d’aperçu
Une fois que vous avez rédigé un prompt vocal solide, le texte utilisé pour prévisualiser cette voix joue un rôle crucial dans le rendu sonore réel. Le texte d’aperçu agit comme un script d’interprétation : il définit le ton, le rythme et l’expression émotionnelle que la voix tentera de reproduire.
Pour obtenir les meilleurs résultats, votre texte d’aperçu doit compléter la description de la voix, et non la contredire. Par exemple, si votre prompt décrit « une jeune voix féminine calme et réfléchie avec un léger accent japonais », utiliser une phrase comme « Hé ! Je ne supporte pas ce que tu as fait de ce fichu endroit !!! » ira à l’encontre de cette intention. Le modèle tentera de concilier ce décalage, ce qui produit souvent des résultats peu naturels ou incohérents.
Utilisez plutôt un exemple de texte qui reflète la personnalité et le ton émotionnel visés pour la voix. Pour l’exemple ci-dessus, une phrase comme « C’est calme ces derniers temps… J’ai eu le temps de réfléchir, et c’est peut-être ce dont j’avais le plus besoin. » soutient le prompt et aide à générer une voix plus naturelle et cohérente.
Nous avons également constaté que les textes d’aperçu plus longs tendent à produire des résultats plus stables et expressifs. Les phrases courtes peuvent parfois sembler abruptes ou incohérentes, surtout lors de l’évaluation de qualités subtiles comme le ton ou le rythme. Donner davantage de contexte au modèle, une phrase complète ou même un court paragraphe, lui permet de produire une représentation plus fluide et fidèle de la voix.
Paramètres
Volume sonore
Contrôle le volume de la génération Text to Preview et, à terme, celui de la voix une fois enregistrée.
Échelle de guidage
Détermine dans quelle mesure le prompt est suivi. Des valeurs élevées suivent le prompt plus strictement, mais peuvent entraîner une qualité audio moindre si le prompt est très spécifique. Des valeurs faibles permettent au modèle d’être plus créatif, au détriment de la fidélité au prompt. Utilisez une valeur faible si l’interprétation et la qualité audio sont globalement plus importantes que le respect parfait du prompt. Des valeurs élevées sont recommandées lorsque la précision de l’accent ou du ton est primordiale.
Attributs et exemples
Expérimentez la manière dont ces descripteurs sont formulés. Par exemple, « Qualité audio parfaite » peut aussi s’écrire « la qualité audio est parfaite ». Ces formulations peuvent parfois produire des résultats différents.