Guía de inicio rápido de Texto a Diálogo

Aprende a generar diálogos inmersivos a partir de texto.

Esta guía te mostrará cómo generar diálogos inmersivos y naturales a partir de texto con la API de Texto a Diálogo.

Mantén la longitud total de todos los valores de inputs[].text en 2000 caracteres o menos por solicitud para obtener una generación fiable. Divide los guiones más largos en fragmentos y une el audio en el cliente.

1

Crear una clave de API

Crea una clave de API aquí, en el panel, que usarás para acceder a la API de forma segura.

Guarda la clave como un secreto gestionado y pásala a los SDK como variable de entorno mediante un archivo .env, o directamente en la configuración de tu aplicación, según prefieras.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Instalar el SDK

También usaremos la biblioteca dotenv para cargar nuestra clave de API desde una variable de entorno.

pip install elevenlabs
pip install python-dotenv
3

Hacer la solicitud a la API

Crea un archivo llamado example.py o example.mts, según el lenguaje que prefieras, y añade el siguiente código. Añade etiquetas de audio dentro de cada valor de text para guiar la entonación de ese hablante. El voice_id selecciona la voz del hablante para el mismo elemento de entrada.

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

Después, ejecútalo:

python example.py

Deberías oír cómo se reproduce el audio del diálogo.

Streaming con WebSocket

Para diálogos incrementales mediante una conexión de larga duración con modelos Eleven v3, sigue la guía de Texto a Diálogo en Tiempo Real. Para comparar este WebSocket con el WebSocket TTS estándar, consulta WebSockets de Texto a Voz y Texto a Diálogo.

Próximos pasos