Hoppa till navigering

Snabbstart för Text to Dialogue

Lär dig skapa uppslukande dialog från text.

Den här guiden visar hur du skapar uppslukande, naturligt klingande dialog från text med Text to Dialogue API:t.

Håll den sammanlagda längden för alla inputs[].text-värden på högst 2 000 tecken per begäran för tillförlitlig generering. Dela upp längre manus i delar och sammanfoga ljudet på klientsidan.

Använda Text to Dialogue API:t

1

Skapa en API-nyckel

Skapa en API-nyckel i kontrollpanelen här, som du använder för att säkert få åtkomst till API:et.

Spara nyckeln som en hanterad hemlighet och skicka den till SDK:erna antingen som en miljövariabel via en .env-fil eller direkt i appens konfiguration, beroende på vad du föredrar.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Installera SDK:t

Vi använder också biblioteket dotenv för att läsa in vår API-nyckel från en miljövariabel.

pip install elevenlabs
pip install python-dotenv
3

Gör API-begäran

Skapa en ny fil med namnet example.py eller example.mts, beroende på vilket språk du väljer, och lägg till följande kod. Lägg till ljudtaggar i varje text-värde för att styra talarens leverans. voice_id väljer talarrösten för samma indatavärde.

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

Kör sedan programmet:

python example.py

Du bör höra dialogljudet spelas upp.

WebSocket-streaming

För stegvis dialog över en långvarig anslutning med Eleven v3-modeller följer du Realtime Text to Dialogue. För att jämföra denna WebSocket med standard-WebSocket för TTS, se Text to Speech vs Text to Dialogue WebSockets.

Nästa steg