Text to Dialogue
Découvrez comment créer des dialogues immersifs au rendu naturel avec ElevenLabs.
Présentation
L’API ElevenLabs Text to Dialogue génère des dialogues naturels et expressifs à partir de texte avec Eleven v4 et Eleven v3. Nous recommandons Eleven v4. Cas d’utilisation fréquents :
- Générer des conversations parfaitement adaptées aux jeux vidéo
- Créer des dialogues immersifs pour des podcasts et d’autres contenus audio
- Donner vie aux livres audio grâce à une narration expressive
Plusieurs générations peuvent être nécessaires pour obtenir le résultat souhaité. Lors de l’intégration de Text to Dialogue dans votre application, envisagez de générer plusieurs versions et de permettre à l’utilisateur de sélectionner la meilleure.
Écoutez un exemple :
Options de voix
ElevenLabs propose des milliers de voix créées par différentes méthodes. Eleven v4 prend en charge plus de 90 langues et Eleven v3 plus de 70 langues.
- Voice Library avec plus de 3 000 voix partagées par la communauté
- Clonage de voix professionnel pour des répliques d’une fidélité maximale
- Clonage de voix instantané pour reproduire rapidement une voix
- Création de voix pour générer des voix personnalisées à partir de descriptions textuelles
En savoir plus sur nos options de voix.
Prompting
Les modèles interprètent directement le contexte émotionnel à partir du texte saisi. Par exemple, l’ajout de texte descriptif tel que « elle dit avec enthousiasme » ou l’emploi de points d’exclamation influencent l’émotion de la voix. Les réglages vocaux tels que la stabilité et la similarité permettent de contrôler la cohérence, tandis que l’émotion sous-jacente provient des indices textuels.
Consultez le guide de prompting pour en savoir plus.
Expressions émotionnelles avec des balises audio
Eleven v4 et Eleven v3 permettent d’utiliser des événements audio non verbaux pour influencer l’interprétation du dialogue. Pour cela, insérez les événements audio dans le texte saisi, entre crochets.
Dans Text to Dialogue, chaque tour de dialogue possède son propre texte et sa propre voix. Ajoutez des balises audio dans le texte du tour qu’elles doivent affecter. Le voice_id sélectionne toujours la voix du locuteur pour ce tour, tandis que les balises guident l’interprétation.
Par exemple, un locuteur peut utiliser une voix tandis que le texte commence par [giggling], puis le locuteur suivant peut utiliser une autre voix tandis que le texte commence par [whispering]. Pour un exemple d’API combinant des balises avec voice_id, consultez le démarrage rapide Text to Dialogue.
Les balises audio sont des instructions en langage naturel, et non un paramètre enum. Encadrez l’instruction de crochets et placez-la dans le texte à l’endroit où l’interprétation doit changer. Les exemples ci-dessous ne sont pas exhaustifs ; consultez le guide de prompting pour mieux utiliser les balises efficacement.
Les balises audio se présentent sous différentes formes :
Émotions et interprétation
Par exemple, [sad], [laughing] et [whispering]
Événements audio
Par exemple, [leaves rustling], [gentle footsteps] et [applause].
Orientation générale
Par exemple, [football], [wrestling match] et [auctioneer].
Quelques exemples :
Vous pouvez également utiliser la ponctuation pour indiquer le déroulement du dialogue, notamment les interruptions :
Les points de suspension peuvent indiquer des phrases inachevées :
Formats de sortie pris en charge
Le format de réponse par défaut est mp3, mais d’autres formats, tels que pcm et ulaw, sont disponibles.
- MP3
- Fréquences d’échantillonnage : 22,05 kHz à 44,1 kHz
- Débits binaires : 32 kbps à 192 kbps
- 22,05 kHz à 32 kbps
- 44,1 kHz à 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Fréquences d’échantillonnage : 16 kHz à 44,1 kHz
- Débits binaires : 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- Profondeur de 16 bits
- μ-law
- Fréquence d’échantillonnage de 8 kHz
- Optimisé pour les applications de téléphonie
- A-law
- Fréquence d’échantillonnage de 8 kHz
- Optimisé pour les applications de téléphonie
- Opus
- Fréquence d’échantillonnage : 48 kHz
- Débits binaires : 32 kbps à 192 kbps
Les options audio de qualité supérieure sont disponibles uniquement avec les forfaits payants. Consultez notre page des tarifs pour en savoir plus.
Langues prises en charge
Eleven v4 prend en charge plus de 90 langues. Eleven v3 prend en charge plus de 70 langues. Consultez Eleven v4 et Eleven v3 pour accéder aux listes complètes.
FAQ
Quels modèles puis-je utiliser ?
Text to Dialogue est disponible avec les modèles Eleven v4 et Eleven v3.
Suis-je propriétaire de l’audio généré ?
Oui. Vous conservez la propriété de tout audio que vous générez. Toutefois, les droits d’utilisation commerciale sont uniquement disponibles avec les forfaits payants. Avec un abonnement payant, vous pouvez utiliser l’audio généré à des fins commerciales et monétiser les résultats si vous détenez les droits de propriété intellectuelle sur le contenu source.
Qu’est-ce qui donne droit à une régénération gratuite ?
Une régénération gratuite vous permet de générer à nouveau le même contenu de synthèse vocale sans frais supplémentaires, sous réserve des conditions suivantes :
- Disponible uniquement dans le Dashboard ElevenLabs.
- Vous pouvez régénérer chaque contenu jusqu’à 2 fois gratuitement.
- Le contenu doit être exactement identique à la génération précédente. Toute modification du texte, des réglages vocaux ou d’autres paramètres nécessitera une nouvelle génération payante.
Les régénérations gratuites sont utiles en cas de légère distorsion de l’audio généré. Selon les évaluations internes d’ElevenLabs, les régénérations résolvent environ la moitié des problèmes de qualité, les problèmes restants étant généralement dus à des données d’entraînement insuffisantes.
Combien de locuteurs mon dialogue peut-il comporter ?
Le nombre de locuteurs dans un dialogue n’est pas limité.
Pourquoi le résultat est-il parfois incohérent ?
Les modèles sont non déterministes. Pour plus de cohérence, utilisez le paramètre seed facultatif, bien que de légères différences puissent subsister.
Quelle est la bonne pratique pour convertir de longs textes ?
Pour une génération fiable, limitez la longueur totale de toutes les valeurs inputs[].text à 2 000 caractères par requête. Divisez les textes plus longs en segments et concaténez l’audio obtenu dans votre application.
Points clés
- Modèles : disponible avec Eleven v4 et Eleven v3
- Locuteurs : nombre de locuteurs illimité par dialogue
- Taille de requête : limitez la longueur totale de toutes les valeurs
inputs[].textà 2 000 caractères par requête - Déterminisme : le résultat est non déterministe, utilisez le paramètre
seedpour des résultats plus cohérents - Régénérations gratuites : jusqu’à 2 régénérations gratuites par génération, même contenu, mêmes paramètres, Dashboard uniquement
- Propriété : vous conservez la propriété de l’audio généré ; l’utilisation commerciale nécessite un forfait payant