Text to Dialogue Schnellstart
Diese Anleitung zeigt Ihnen, wie Sie mit der Text-to-Dialogue-API aus Text immersive, natürlich klingende Dialoge erstellen.
Halten Sie die Gesamtlänge aller inputs[].text-Werte für eine zuverlässige Generierung pro Anfrage bei
höchstens 2.000 Zeichen. Teilen Sie längere Skripte in Abschnitte auf und fügen Sie das Audio clientseitig zusammen.
Text-to-Dialogue-API verwenden
API-Schlüssel erstellen
Erstellen Sie hier im Dashboard einen API-Schlüssel, den Sie für den sicheren Zugriff auf die API verwenden.
Speichern Sie den Schlüssel als verwaltetes Secret und übergeben Sie ihn je nach Präferenz an die SDKs entweder als Umgebungsvariable über eine .env-Datei oder direkt in der Konfiguration Ihrer App.
SDK installieren
SDK
CLI
Wir verwenden außerdem die Bibliothek dotenv, um unseren API-Schlüssel aus einer Umgebungsvariable zu laden.
API-Anfrage ausführen
SDK
CLI
Erstellen Sie je nach bevorzugter Sprache eine neue Datei namens example.py oder example.mts und fügen Sie den folgenden Code hinzu.
Fügen Sie Audio-Tags in jeden text-Wert ein, um die Sprechweise des jeweiligen Sprechers zu steuern. Die voice_id
wählt die Stimme für denselben Eingabeeintrag aus.
Führen Sie den Code anschließend aus:
Sie sollten die Audiowiedergabe des Dialogs hören.
WebSocket-Streaming
Für schrittweise generierte Dialoge über eine langlebige Verbindung mit Eleven v3-Modellen folgen Sie Realtime Text to Dialogue. Einen Vergleich dieses WebSockets mit dem Standard-TTS-WebSocket finden Sie unter Text to Speech vs Text to Dialogue WebSockets.