Text to Speech- och Text to Dialogue-WebSockets
Den här guiden visar hur du väljer rätt WebSocket för att streama tal och hur de två protokollen skiljer sig åt.
ElevenLabs erbjuder två olika WebSocket-produkter för att streama syntetiserat tal. De löser olika problem, accepterar olika meddelandeformat och är avsedda för olika modeller.
Vilken WebSocket ska jag använda?
Använd Text to Speech (TTS)-WebSocket när du streamar vanlig text för en röst per anslutning (rösten är fast i URL:en) och vill använda icke-v3-modeller som Flash eller Multilingual v2, valfri SSML, delscheman eller varianten multi-context för hantering av avbrott i agentstil.
Använd Text to Dialogue (TTD)-WebSocket när du behöver dialogbeteendet i Eleven v3: uttrycksfull leverans, **voice_id per del **, turgränser (new_turn) och samma dialoginriktade buffring som används för v3 på servern.
För batch- eller HTTP-streaming av dialog (hela begäran i ett anrop), använd Create dialogue eller Stream dialogue i stället för en WebSocket.
Jämförelse
När TTS WebSocket passar bättre
- Du integrerar redan Flash eller Multilingual v2 för svarstid eller språkstöd.
- Du vill ha en berättarröst per anslutning och ett enkelt protokoll med text per frame.
- Du behöver multi-context-orkestrering för avbrott och parallella yttranden (guide för multi-context).
Se Generera ljud i realtid för en fullständig genomgång av TTS WebSocket.
När TTD WebSocket passar bättre
- Du använder Eleven v4-dialog (uttrycksfulla taggar, samtalstempo, repliker från flera talare).
- Du streamar skriptad eller LLM-genererad dialog där talarens röst kan ändras för varje rad utan att öppna en ny anslutning.
- Du vill ha stegvis indata i WebSocket-format med dialoggenerering som är endast för v4 på servern.
För en praktisk genomgång använder du Realtime Text to Dialogue. Protokolldetaljer finns i API-referensen.