Guide de démarrage rapide de Text to Dialogue

Découvrez comment générer des dialogues immersifs à partir de texte.

Ce guide explique comment générer des dialogues immersifs au son naturel à partir de texte avec l’API Text to Dialogue.

Pour une génération fiable, maintenez la longueur totale de toutes les valeurs inputs[].text à 2 000 caractères ou moins par requête. Divisez les scripts plus longs en segments et assemblez l’audio côté client.

Utiliser l’API Text to Dialogue

1

Créer une clé API

Créez une clé API dans le Dashboard ici, que vous utiliserez pour accéder à l’API de manière sécurisée.

Stockez la clé comme secret géré et transmettez-la aux SDK soit en tant que variable d’environnement via un fichier .env, soit directement dans la configuration de votre application, selon vos préférences.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Installer le SDK

Nous utiliserons également la bibliothèque dotenv pour charger notre clé API depuis une variable d’environnement.

pip install elevenlabs
pip install python-dotenv
3

Effectuer la requête API

Créez un fichier nommé example.py ou example.mts, selon le langage choisi, puis ajoutez le code suivant. Ajoutez des balises audio dans chaque valeur text pour guider l’interprétation de ce locuteur. Le voice_id sélectionne la voix du locuteur pour le même élément d’entrée.

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

Exécutez ensuite le programme :

python example.py

Vous devriez entendre le dialogue audio.

Streaming WebSocket

Pour un dialogue incrémentiel via une connexion persistante avec les modèles Eleven v3, consultez Text to Dialogue en temps réel. Pour comparer ce WebSocket au WebSocket TTS standard, consultez WebSockets Text to Speech et Text to Dialogue.

Étapes suivantes