Text to Speech vs. Text to Dialogue WebSockets
Diese Anleitung zeigt Ihnen, wie Sie den passenden WebSocket für das Speech-Streaming auswählen und worin sich die beiden Protokolle unterscheiden.
ElevenLabs bietet zwei verschiedene WebSocket-Produkte für das Streaming synthetisierter Sprache. Sie lösen unterschiedliche Probleme, akzeptieren unterschiedliche Nachrichtenformate und sind für unterschiedliche Modelle ausgelegt.
Welchen WebSocket sollte ich verwenden?
Verwenden Sie den Text to Speech (TTS) WebSocket, wenn Sie einfachen Text für eine Stimme pro Verbindung streamen (die Stimme ist in der URL festgelegt) und keine v3-Modelle wie Flash oder Multilingual v2, optionales SSML, Chunk-Zeitpläne oder die Multi-Context-Variante zur Behandlung von Unterbrechungen im Agentenstil benötigen.
Verwenden Sie den Text to Dialogue (TTD) WebSocket, wenn Sie das Dialogverhalten von Eleven v3 benötigen: ausdrucksstarke Wiedergabe, **voice_id pro Chunk **, Sprecherwechselgrenzen (new_turn) und dieselbe dialogorientierte Pufferung, die auf dem Server für v3 verwendet wird.
Für Batch- oder HTTP-Streaming von Dialogen (vollständige Anfrage in einem Aufruf) verwenden Sie statt eines WebSockets Dialog erstellen oder Dialog streamen.
Vergleich
Wann der TTS WebSocket besser geeignet ist
- Sie integrieren bereits Flash oder Multilingual v2 für geringe Latenz oder Sprachabdeckung.
- Sie möchten eine Sprecherstimme pro Verbindung und ein einfaches Text-pro-Frame-Protokoll.
- Sie benötigen Multi-Context-Orchestrierung für Unterbrechungen und parallele Äußerungen (Multi-Context-Leitfaden).
Im Leitfaden Audio in Echtzeit generieren finden Sie eine vollständige Anleitung zum TTS WebSocket.
Wann der TTD WebSocket besser geeignet ist
- Sie verwenden Eleven v3 für Dialoge (ausdrucksstarke Tags, Gesprächsrhythmus, Zeilen mit mehreren Sprechern).
- Sie streamen skriptbasierte oder LLM-generierte Dialoge, bei denen die Sprecherstimme pro Zeile wechseln kann, ohne eine neue Verbindung zu öffnen.
- Sie möchten inkrementelle Eingaben im WebSocket-Format mit nur für v3 verfügbarer Dialoggenerierung auf dem Server.
Eine praktische Anleitung finden Sie unter Echtzeit-Text to Dialogue. Protokolldetails finden Sie in der API-Referenz.