Text to Dialogue

Découvrez comment créer des dialogues immersifs au rendu naturel avec ElevenLabs.

Présentation

L’API ElevenLabs Text to Dialogue génère des dialogues naturels et expressifs à partir de texte avec Eleven v4 et Eleven v3. Nous recommandons Eleven v4. Cas d’utilisation fréquents :

  • Générer des conversations parfaitement adaptées aux jeux vidéo
  • Créer des dialogues immersifs pour des podcasts et d’autres contenus audio
  • Donner vie aux livres audio grâce à une narration expressive

Plusieurs générations peuvent être nécessaires pour obtenir le résultat souhaité. Lors de l’intégration de Text to Dialogue dans votre application, envisagez de générer plusieurs versions et de permettre à l’utilisateur de sélectionner la meilleure.

Écoutez un exemple :

Options de voix

ElevenLabs propose des milliers de voix créées par différentes méthodes. Eleven v4 prend en charge plus de 90 langues et Eleven v3 plus de 70 langues.

En savoir plus sur nos options de voix.

Prompting

Les modèles interprètent directement le contexte émotionnel à partir du texte saisi. Par exemple, l’ajout de texte descriptif tel que « elle dit avec enthousiasme » ou l’emploi de points d’exclamation influencent l’émotion de la voix. Les réglages vocaux tels que la stabilité et la similarité permettent de contrôler la cohérence, tandis que l’émotion sous-jacente provient des indices textuels.

Consultez le guide de prompting pour en savoir plus.

Expressions émotionnelles avec des balises audio

Cette fonctionnalité est encore en cours de développement, les résultats peuvent varier.

Eleven v4 et Eleven v3 permettent d’utiliser des événements audio non verbaux pour influencer l’interprétation du dialogue. Pour cela, insérez les événements audio dans le texte saisi, entre crochets.

Dans Text to Dialogue, chaque tour de dialogue possède son propre texte et sa propre voix. Ajoutez des balises audio dans le texte du tour qu’elles doivent affecter. Le voice_id sélectionne toujours la voix du locuteur pour ce tour, tandis que les balises guident l’interprétation.

Par exemple, un locuteur peut utiliser une voix tandis que le texte commence par [giggling], puis le locuteur suivant peut utiliser une autre voix tandis que le texte commence par [whispering]. Pour un exemple d’API combinant des balises avec voice_id, consultez le démarrage rapide Text to Dialogue.

Les balises audio sont des instructions en langage naturel, et non un paramètre enum. Encadrez l’instruction de crochets et placez-la dans le texte à l’endroit où l’interprétation doit changer. Les exemples ci-dessous ne sont pas exhaustifs ; consultez le guide de prompting pour mieux utiliser les balises efficacement.

Les balises audio se présentent sous différentes formes :

Émotions et interprétation

Par exemple, [sad], [laughing] et [whispering]

Événements audio

Par exemple, [leaves rustling], [gentle footsteps] et [applause].

Orientation générale

Par exemple, [football], [wrestling match] et [auctioneer].

Quelques exemples :

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Vous pouvez également utiliser la ponctuation pour indiquer le déroulement du dialogue, notamment les interruptions :

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Les points de suspension peuvent indiquer des phrases inachevées :

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Le format de réponse par défaut est mp3, mais d’autres formats, tels que pcm et ulaw, sont disponibles.

  • MP3
    • Fréquences d’échantillonnage : 22,05 kHz à 44,1 kHz
    • Débits binaires : 32 kbps à 192 kbps
    • 22,05 kHz à 32 kbps
    • 44,1 kHz à 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
  • PCM (S16LE)
    • Fréquences d’échantillonnage : 16 kHz à 44,1 kHz
    • Débits binaires : 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
    • Profondeur de 16 bits
  • μ-law
    • Fréquence d’échantillonnage de 8 kHz
    • Optimisé pour les applications de téléphonie
  • A-law
    • Fréquence d’échantillonnage de 8 kHz
    • Optimisé pour les applications de téléphonie
  • Opus
    • Fréquence d’échantillonnage : 48 kHz
    • Débits binaires : 32 kbps à 192 kbps

Les options audio de qualité supérieure sont disponibles uniquement avec les forfaits payants. Consultez notre page des tarifs pour en savoir plus.

Langues prises en charge

Eleven v4 prend en charge plus de 90 langues. Eleven v3 prend en charge plus de 70 langues. Consultez Eleven v4 et Eleven v3 pour accéder aux listes complètes.

FAQ

Text to Dialogue est disponible avec les modèles Eleven v4 et Eleven v3.

Oui. Vous conservez la propriété de tout audio que vous générez. Toutefois, les droits d’utilisation commerciale sont uniquement disponibles avec les forfaits payants. Avec un abonnement payant, vous pouvez utiliser l’audio généré à des fins commerciales et monétiser les résultats si vous détenez les droits de propriété intellectuelle sur le contenu source.

Une régénération gratuite vous permet de générer à nouveau le même contenu de synthèse vocale sans frais supplémentaires, sous réserve des conditions suivantes :

  • Disponible uniquement dans le Dashboard ElevenLabs.
  • Vous pouvez régénérer chaque contenu jusqu’à 2 fois gratuitement.
  • Le contenu doit être exactement identique à la génération précédente. Toute modification du texte, des réglages vocaux ou d’autres paramètres nécessitera une nouvelle génération payante.

Les régénérations gratuites sont utiles en cas de légère distorsion de l’audio généré. Selon les évaluations internes d’ElevenLabs, les régénérations résolvent environ la moitié des problèmes de qualité, les problèmes restants étant généralement dus à des données d’entraînement insuffisantes.

Le nombre de locuteurs dans un dialogue n’est pas limité.

Les modèles sont non déterministes. Pour plus de cohérence, utilisez le paramètre seed facultatif, bien que de légères différences puissent subsister.

Pour une génération fiable, limitez la longueur totale de toutes les valeurs inputs[].text à 2 000 caractères par requête. Divisez les textes plus longs en segments et concaténez l’audio obtenu dans votre application.

Points clés

  • Modèles : disponible avec Eleven v4 et Eleven v3
  • Locuteurs : nombre de locuteurs illimité par dialogue
  • Taille de requête : limitez la longueur totale de toutes les valeurs inputs[].text à 2 000 caractères par requête
  • Déterminisme : le résultat est non déterministe, utilisez le paramètre seed pour des résultats plus cohérents
  • Régénérations gratuites : jusqu’à 2 régénérations gratuites par génération, même contenu, mêmes paramètres, Dashboard uniquement
  • Propriété : vous conservez la propriété de l’audio généré ; l’utilisation commerciale nécessite un forfait payant