Conception de voix

Guide pour créer des voix à partir d’une invite textuelle.

Conception de voix

Vue d’ensemble

La Conception de voix aide les créateurs à combler les lacunes lorsque la voix exacte qu’ils recherchent n’est pas disponible dans la Voice Library. Si vous ne trouvez pas de voix adaptée à votre projet, vous pouvez en créer une. La Conception de voix est idéale pour explorer et itérer rapidement, et la qualité du résultat peut varier selon votre invite et votre cas d’usage. Si vous avez besoin d’une qualité plus constante, prête pour la production, les clones de voix professionnels (PVC) sont actuellement les voix de la plus haute qualité sur notre plateforme. Si un PVC correspondant à vos besoins est disponible dans notre bibliothèque, nous vous recommandons donc de l’utiliser.

Vous trouverez la Conception de voix en allant dans Voix -> Mes voix -> Ajouter une nouvelle voix -> Conception de voix dans l’application ElevenLabs ou via l’API.

Lorsque vous cliquez sur générer, nous créons trois options de voix. La seule facturation liée à l’utilisation de la conception de voix correspond au nombre de crédits requis pour générer votre texte d’aperçu. Ces crédits ne sont facturés qu’une seule fois, même si nous générons trois échantillons. Vous pouvez voir le nombre de caractères qui sera déduit dans la zone de texte « Texte à prévisualiser ».

Après la génération, vous pouvez sélectionner et enregistrer l’une des voix générées, qui occupera un de vos emplacements de voix.

Guide de rédaction des invites

L’invite est le fondement de votre voix. Elle indique au modèle le type de voix que vous cherchez à créer : de l’accent et du type de personnage au genre et à l’atmosphère de la voix. Une invite bien rédigée peut faire la différence entre une voix générique et une voix qui correspond réellement à votre vision. En général, les invites plus descriptives et plus détaillées produisent des résultats plus précis et nuancés. Plus vous fournissez de détails, notamment sur l’âge, le genre, le ton, l’accent, le rythme, l’émotion, le style et bien plus encore, mieux le modèle peut interpréter votre demande et générer une voix intentionnelle et sur mesure.

Toutefois, des invites courtes et simples peuvent aussi fonctionner, notamment si vous recherchez une voix plus neutre ou polyvalente. Par exemple, « Un narrateur calme » peut vous donner exactement ce dont vous avez besoin sans entrer dans les détails, en particulier si vous ne cherchez pas à créer un personnage ou un style très précis. Le bon niveau de détail dépend de votre cas d’usage. Créez-vous un personnage fantastique ? Un assistant virtuel ? Une New-Yorkaise d’une soixantaine d’années, fatiguée, avec un humour pince-sans-rire ? Plus vous le définissez clairement dans votre invite, plus le résultat se rapprochera de ce que vous imaginez.

Format d’invite recommandé

Pour des résultats cohérents, structurez votre invite selon ce format :

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Exemple :

Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.

Erreurs fréquentes à éviter

  • N’utilisez pas « accent » lorsque vous voulez dire « intonation » : cela peut entraîner des changements de dialecte indésirables. Décrivez plutôt l’intonation, l’accentuation ou les modes de diction.
  • Évitez les termes d’effets sonores : des termes comme « reverb », « echo », « phone » ou « tape » peuvent nuire à la qualité du résultat.
  • Indiquez explicitement la langue et le dialecte : précisez toujours la langue et la variante régionale dans la première phrase afin d’éviter les dérives.

Qualité audio

La qualité audio désigne la clarté, la netteté et la fidélité globale de la voix générée. Par défaut, ElevenLabs vise à produire un audio clair et naturel. Si votre projet exige un niveau de qualité spécifique, il est préférable de le préciser explicitement dans votre invite.

Pour des résultats de haute qualité, vous pouvez aider le modèle en ajoutant une expression telle que « perfect audio quality » ou « studio-quality recording » à votre description de voix. Cela permet de garantir un rendu vocal d’une clarté maximale, avec une distorsion minimale et une finition soignée.

Vous pouvez aussi utiliser des descripteurs de qualité précis qui produisent des résultats cohérents :

  • Qualité correcte
  • Bonne qualité
  • Très bonne qualité
  • Excellente qualité
  • Qualité studio
  • Qualité diffusion

Ces descripteurs aident à obtenir une qualité audio élevée lorsqu’ils sont inclus dans votre invite.

L’inclusion de ce type d’expressions peut parfois réduire la précision globale de l’invite si la voix est très spécifique ou de niche.

Dans certains cas créatifs, une qualité audio inférieure peut aussi être intentionnelle, par exemple pour simuler un appel téléphonique, une ancienne émission de radio ou des images trouvées. Dans ces situations, n’utilisez aucun descripteur de qualité ou incluez explicitement des expressions comme :

  • « Audio basse fidélité »
  • « Mauvaise qualité audio »
  • « Sonne comme un message vocal »
  • « Étouffé et lointain, comme sur un vieux magnétophone »

L’emplacement de cette expression dans votre invite est flexible : elle peut apparaître au début ou à la fin, et nous avons constaté que les deux fonctionnent bien.

Âge, ton/timbre et genre

Ces trois caractéristiques constituent la base de la conception vocale, car elles façonnent l’identité globale et la résonance émotionnelle de la voix. Plus vous fournissez de détails, plus l’IA peut facilement produire une voix qui correspond à votre vision créative, que vous créiez un personnage crédible, conceviez un narrateur captivant ou développiez un assistant virtuel.

Âge

Décrire l’âge perçu de la voix permet de définir sa maturité, sa texture vocale et son énergie. Utilisez des termes précis pour orienter l’IA vers la bonne qualité vocale.

Descripteurs utiles :

  • « Adolescent » / « adolescente »
  • « Jeune adulte » / « dans la vingtaine » / « au début de la trentaine »
  • « Homme d’âge mûr » / « femme dans la quarantaine »
  • « Homme âgé » / « femme âgée » / « homme dans la quatre-vingtaine »

Ton/timbre

Désigne la qualité physique de la voix, façonnée par la hauteur, la résonance et la texture vocale. Il se distingue de l’expression émotionnelle ou de l’attitude.

Descripteurs courants de ton/timbre :

  • « Profond » / « grave »
  • « Doux » / « riche »
  • « Rauque » / « éraillé »
  • « Nasillard » / « strident »
  • « Aérien » / « soufflé »
  • « Puissant » / « résonant »
  • « Léger » / « fin »
  • « Chaud » / « feutré »
  • « Métallique » / « ferreux »

Genre

Le genre influence souvent la hauteur, le poids vocal et la présence tonale, mais vous pouvez dépasser les catégories simples en décrivant le son plutôt que l’identité.

Exemples :

  • « Une voix féminine grave et rauque »
  • « Une voix masculine profonde et résonante »
  • « Un genre neutre, doux et de hauteur moyenne »

Accent

L’accent joue un rôle essentiel dans la définition de l’identité régionale, culturelle et émotionnelle d’une voix. Si votre projet repose sur un son authentique, qu’il s’inscrive dans le réalisme ou soit stylisé pour un personnage, il est essentiel d’indiquer clairement et précisément l’accent souhaité.

Le choix des termes compte : certains produisent des résultats plus cohérents. Par exemple, « prononcé » donne souvent de meilleurs résultats que « fort » pour décrire l’intensité d’un accent. Cela demande beaucoup d’essais et d’ajustements ; nous vous encourageons à expérimenter les formulations et à être aussi créatif et descriptif que possible.

Soyez prudent avec le mot « accent » : si vous désignez des schémas d’intonation ou d’emphase plutôt qu’un dialecte régional, utilisez plutôt ces termes. Employer « accent » pour parler d’intonation peut entraîner des changements de dialecte indésirables.

  • Exemples de prompts d’accent clairs :
    • « Un homme d’âge mûr avec un accent français prononcé »
    • « Une jeune femme avec un léger accent traînant du Sud »
    • « Un vieil homme avec un fort accent d’Europe de l’Est »
    • « Une femme enjouée parlant avec un accent britannique net »
    • « Un jeune homme avec une légère intonation irlandaise »
    • « Une voix autoritaire avec un accent américain neutre »
    • « Un homme avec un accent régional australien, décontracté et nasillard »

Évitez les descripteurs trop vagues comme « étranger » ou « exotique » : ils manquent de précision et peuvent produire des résultats incohérents.

Associez l’accent à d’autres caractéristiques comme le ton, l’âge ou le rythme pour mieux contrôler le résultat. Par exemple : « Une vieille femme sarcastique avec un fort accent new-yorkais, qui parle lentement. »

Pour les voix fantastiques ou fictives, vous pouvez proposer des accents réels comme source d’inspiration :

  • « Un elfe avec un bon gros accent britannique. Il est royal et lyrique. »
  • « Un gobelin avec un accent rauque d’Europe de l’Est. »

Rythme

Le rythme désigne la vitesse et la cadence auxquelles une voix parle. C’est un élément clé pour façonner la personnalité, le ton émotionnel et la clarté de la voix. Il est essentiel d’être explicite sur le rythme, en particulier lors de la conception de voix pour des cas d’usage précis comme la narration, la publicité, les dialogues de personnages ou le contenu pédagogique.

Utilisez un langage clair pour décrire à quelle vitesse la voix doit parler. Vous pouvez aussi décrire la sensation produite par le rythme, qu’il soit régulier, irrégulier, posé ou léger. Si le rythme change, indiquez clairement où et pourquoi.

Exemples de descripteurs de rythme :

  • « Parle rapidement » / « à un rythme rapide »
  • « À un rythme normal » / « parle normalement »
  • « Parle lentement » / « avec un rythme lent »
  • « Rythme posé et mesuré »
  • « Étire les mots, comme pour savourer chacun d’eux »
  • « Avec une cadence précipitée, comme s’il était pressé »
  • « Rythme détendu et conversationnel »
  • « Rythme cadencé et musical »
  • « Rythme irrégulier, avec des pauses et accélérations soudaines »
  • « Rythme régulier, avec un intervalle constant entre les mots »
  • « Débit saccadé »

Texte d’aperçu

Une fois que vous avez rédigé un prompt vocal solide, le texte utilisé pour prévisualiser cette voix joue un rôle crucial dans le rendu sonore réel. Le texte d’aperçu agit comme un script d’interprétation : il définit le ton, le rythme et l’expression émotionnelle que la voix tentera de reproduire.

Pour obtenir les meilleurs résultats, votre texte d’aperçu doit compléter la description de la voix, et non la contredire. Par exemple, si votre prompt décrit « une jeune voix féminine calme et réfléchie avec un léger accent japonais », utiliser une phrase comme « Hé ! Je ne supporte pas ce que tu as fait de ce fichu endroit !!! » ira à l’encontre de cette intention. Le modèle tentera de concilier ce décalage, ce qui produit souvent des résultats peu naturels ou incohérents.

Utilisez plutôt un exemple de texte qui reflète la personnalité et le ton émotionnel visés pour la voix. Pour l’exemple ci-dessus, une phrase comme « C’est calme ces derniers temps… J’ai eu le temps de réfléchir, et c’est peut-être ce dont j’avais le plus besoin. » soutient le prompt et aide à générer une voix plus naturelle et cohérente.

Nous avons également constaté que les textes d’aperçu plus longs tendent à produire des résultats plus stables et expressifs. Les phrases courtes peuvent parfois sembler abruptes ou incohérentes, surtout lors de l’évaluation de qualités subtiles comme le ton ou le rythme. Donner davantage de contexte au modèle, une phrase complète ou même un court paragraphe, lui permet de produire une représentation plus fluide et fidèle de la voix.

Paramètres

Volume sonore

Contrôle le volume de la génération Text to Preview et, à terme, celui de la voix une fois enregistrée.

Échelle de guidage

Détermine dans quelle mesure le prompt est suivi. Des valeurs élevées suivent le prompt plus strictement, mais peuvent entraîner une qualité audio moindre si le prompt est très spécifique. Des valeurs faibles permettent au modèle d’être plus créatif, au détriment de la fidélité au prompt. Utilisez une valeur faible si l’interprétation et la qualité audio sont globalement plus importantes que le respect parfait du prompt. Des valeurs élevées sont recommandées lorsque la précision de l’accent ou du ton est primordiale.

Attributs et exemples

Expérimentez la manière dont ces descripteurs sont formulés. Par exemple, « Qualité audio parfaite » peut aussi s’écrire « la qualité audio est parfaite ». Ces formulations peuvent parfois produire des résultats différents.

AttributExemples
ÂgeJeune, plus jeune, adulte, vieux, âgé, dans la quarantaine
AccentAccent écossais « prononcé », léger accent asiatique-américain, accent du sud des États-Unis
GenreMasculin, féminin, neutre, genre ambigu
Ton/timbre/hauteurProfond, chaud, rauque, doux, strident, onctueux, éraillé, nasillard, guttural, rude, robotique, éthéré
RythmeCadence normale, rapide, rapidement, lentement, étiré, rythme calme, rythme naturel/conversationnel
Qualité audioQualité audio parfaite, qualité audio « correcte », mauvaise qualité audio
Personnage / professionPirate, homme d’affaires, agriculteur, politicien, thérapeute, ogre, être divin, présentateur TV
ÉmotionÉnergique, enthousiaste, triste, émotif, sarcastique, pince-sans-rire
HauteurGrave, aiguë, hauteur normale

Exemples de prompts et aperçus de texte

Type de voixPrompt/DescriptionAperçu du texteÉchelle de guidage
Commentatrice sportiveUne commentatrice sportive énergique avec un fort accent britannique, commentant avec passion et à un rythme très rapide un match de football, action par action. Sa voix est vive, enthousiaste et totalement plongée dans l’action.OH LÀ LÀ, QUEL BUT ! Elle récupère le ballon juste après le milieu de terrain, élimine DEUX défenseuses comme si elles n’étaient même pas LÀ, et l’ENVOIE avec une force incroyable dans la lucarne ! La gardienne n’avait AUCUNE CHANCE ! C’est du NIVEAU MONDIAL de la part de la jeune attaquante, et la foule est DEBOUT ! Ce match s’est ENFLAMMÉ, et on SENT que la dynamique est en train de CHANGER !25 %
Instructeur militaireUn instructeur militaire qui crie sur son équipe de soldats. Il semble en colère et parle rapidement.ÉCOUTEZ-MOI, bande de bons à rien ! Je ne suis pas venu ici pour faire du baby-sitting, je suis venu pour FORMER DES SOLDATS ! Vous bougez quand je vous dis de bouger, et vous respirez quand je vous dis de respirer ! Vous avez dix secondes pour vous mettre en rang ou vous le regretterez !!25 %
Ogre maléfiqueUn immense ogre maléfique qui parle rapidement. Son ton est ridicule et résonnant.« Vos armes ne sont pour moi que des cure-dents. [laughs] Rendez-vous maintenant, et je vous accorderai peut-être une fin rapide. J’ai renversé des royaumes et dévoré des armées. Quel espoir avez-vous contre moi ? »30 %
Entrepreneur britannique accessibleExcellente qualité audio. Un homme entre 30 et 40 ans, avec un fort accent britannique, qui parle à un rythme naturel comme s’il s’adressait à un ami.[laughs] Vous voyez, c’est ça le truc. VOUS voyez une entreprise, tandis que moi, je vois… [lip smacks] je vois une promesse, vous voyez ce que je veux dire ? [exhales] On ne construit pas seulement pour faire du profit, on construit pour, pour ÉLEVER LES AUTRES ! Si notre technologie ne laisse pas le monde plus bienveillant, plus intelligent et plus connecté que nous ne l’avons trouvé… [sighs] alors qu’est-ce qu’on fait ici, au juste ?40 %
Femme du SudUne femme âgée avec un fort accent du Sud des États-Unis. Elle est douce et sarcastique.« Eh bien ma chérie, si tout ce qu’on fait, c’est courir après les titres et les trophées, on va rater l’essentiel. [light chuckle] Je préfère créer quelque chose qui simplifie la vie des gens, et si je peux le faire en talons, avec le sourire et une pointe d’impertinence, c’est encore mieux. »35 %
Voix de bande-annonceVoix dramatique, utilisée pour créer de l’anticipation dans les bandes-annonces de films, généralement associée aux films d’action ou aux thrillers« Dans un monde au bord du chaos, un héros se lèvera. Préparez-vous à une histoire aux proportions épiques, bientôt sur grand écran. »20 %
Souris qui couineUne adorable petite souris qui couine« Je suis peut-être petite, mais je n’ai pas un petit caractère ! [giggles] Attention où vous mettez vos grands pieds, sinon je vais vous mordre les orteils, et vous ne l’oublierez pas ! »20 %
Pirate en colèreUn vieux pirate en colère, bruyant et tonitruant« J’ai affronté des tempêtes qui vous blanchiraient les cheveux et des monstres marins qui feraient trembler vos genoux. Vous pensez pouvoir défier le capitaine Blackheart et vivre pour raconter l’histoire ? »30 %
New-YorkaisFort accent new-yorkais, voix grave et rocailleuse, dure et usée par la vie, souvent cynique« Je parcours ces rues depuis bien plus longtemps que vous ne pouvez l’imaginer, petit. Il n’y a plus rien que vous puissiez dire ou faire pour me surprendre. »40 %
Agente d’assistance espagnoleEspagnol natif, espagnol européen (sans traits de l’espagnol latino-américain). Femme, 35 à 40 ans. Qualité correcte. Persona : opératrice d’assistance fiable. Émotion : rassurante, attentive, sûre d’elle.Timbre fluide et naturel, avec une intonation douce, une proximité marquée et un signal sans bruit. Communique les mises à jour à un rythme détendu, en mettant clairement l’accent sur les informations utiles, et projette empathie et professionnalisme.30 %
Service client arabeArabe natif, légère influence de l’accent du Golfe (Émirats arabes unis). Femme, 30 à 40 ans. Excellente qualité. Persona : agente professionnelle du service client. Émotion : chaleureuse, sûre d’elle, polie.Timbre velouté, ton calme, rythme mesuré et intonation douce, avec une proximité de microphone pour un signal haute fidélité sans artefact. Présence claire et légère insistance sur les formules adaptées aux clients pour garantir une compréhension aisée.35 %
Narrateur créatif polonaisPolonais natif. Homme, 48 à 58 ans. Excellente qualité. Persona : rêveur créatif. Émotion : curieuse, douce, invitante.La voix est fluide et sans artefact, avec une texture chaleureuse et engageante ainsi qu’un rythme régulier, restituée avec une proximité naturelle. Une intonation lumineuse et une emphase précise guident l’auditeur à travers le récit.32 %
Savant fouLa voix d’un génie scientifique excentrique, avec des schémas de parole rapides et erratiques qui s’accélèrent sous l’effet de l’excitation. Son accent teinté d’allemand devient plus prononcé lorsqu’il s’agite. La hauteur de sa voix varie fortement, de murmures contemplatifs à des exclamations maniaques, avec de fréquents éclats de rire dément.« Je suis le docteur Heinrich, génie révolutionnaire rejeté par l’establishment scientifique à l’esprit étroit ! Bah ! Ils ont qualifié mes théories d’impossibles, mes méthodes de contraires à l’éthique, mais qui rit maintenant ? (rire maniaque) Pendant vingt ans, j’ai perfectionné ma création dans ce laboratoire de montagne, exploitant des énergies qui dépassent l’entendement des mortels ! Les imbéciles de l’académie regretteront leurs moqueries lorsque mon déstabilisateur quantique révélera le multivers. Ou peut-être de nouvelles formes de vie… l’expérience comporte certaines variables imprévisibles… FASCINANTES ! »38 %

FAQ

Voice Design vous permet de créer une voix unique à partir d’un prompt textuel.

Cette fonctionnalité est conçue pour vous aider lorsque vous ne trouvez pas la voix exacte dont vous avez besoin dans notre Voice Library. Au lieu de choisir parmi les options existantes, vous pouvez désormais générer une voix personnalisée en la décrivant avec vos propres mots.

Pour commencer, saisissez simplement un prompt décrivant la voix souhaitée. Vous pouvez inclure des détails tels que l’accent, le genre, le rythme, le ton et le style de parole. Plus votre prompt est précis, plus la voix correspondra à votre intention. En cas de doute, un prompt simple comme « un narrateur calme » fonctionne également.

Les voix créées avec Voice Design fonctionnent avec Eleven v4, notre modèle le plus récent, ainsi qu’avec des modèles antérieurs, dont Eleven v3. Elles prennent en charge les balises audio. Avec Eleven v4, elles peuvent être moins expressives qu’avec les modèles antérieurs.

Pour plus de conseils sur la rédaction de prompts efficaces, consultez notre guide Voice Design.

Remarque : Voice Design est encore expérimental. Les clones vocaux professionnels offrent la meilleure qualité et la meilleure cohérence. Si vous trouvez un PVC qui répond à vos besoins, nous vous recommandons de l’utiliser. Les clones vocaux professionnels sont entièrement pris en charge par Eleven v4. Ils ne sont pas entièrement optimisés pour Eleven v3.

Voice Design peut générer un large éventail de voix, des voix réalistes et proches de l’humain aux voix plus créatives de type personnage.

Si vous ne savez pas par où commencer, essayez un prompt simple comme « présentatrice de journal d’âge moyen ». Toutefois, des prompts plus détaillés produisent généralement des résultats plus précis et nuancés.

Vous pouvez inclure diverses caractéristiques dans votre prompt, telles que :

  • l’âge
  • le genre
  • l’accent
  • le ton
  • le rythme
  • l’émotion
  • le style de parole
  • la qualité audio

Deux contrôles supplémentaires vous aident à façonner le résultat :

  • Volume ajuste le volume de l’aperçu et de la voix enregistrée.
  • Échelle de guidage détermine dans quelle mesure la voix générée suit votre prompt.

Pour obtenir plus d’aide dans la rédaction de vos prompts, consultez notre guide Voice Design.

Voice Design consomme des crédits uniquement lorsque vous générez des voix.

Chaque fois que vous cliquez sur Générer une voix, nous créons trois options vocales à partir de votre prompt. Le montant facturé dépend du nombre de caractères dans votre texte d’aperçu.

Vous pouvez saisir votre propre texte d’aperçu ou utiliser le bouton Générer automatiquement pour en créer un automatiquement. Les aperçus générés automatiquement incluent des balises audio pertinentes.

Pour en savoir plus, consultez notre guide Voice Design.

No results