WebSockety Text to Speech a Text to Dialogue
Ten przewodnik pomoże ci wybrać właściwy WebSocket do strumieniowania mowy i wyjaśnia różnice między protokołami.
ElevenLabs udostępnia dwa różne produkty WebSocket do strumieniowania syntezowanej mowy. Rozwiązują różne problemy, przyjmują wiadomości o różnych formatach i obsługują różne modele.
Którego WebSocket użyć?
Użyj WebSocket Text to Speech (TTS), gdy przesyłasz zwykły tekst dla jednego głosu na połączenie (głos jest określony w URL) i potrzebujesz modeli innych niż v3, takich jak Flash lub Multilingual v2, opcjonalnego SSML, harmonogramów fragmentów albo wariantu multi-context do obsługi przerwań w stylu agentów.
Użyj WebSocket Text to Dialogue (TTD), gdy potrzebujesz dialogów Eleven v3: ekspresyjnej wypowiedzi, **voice_id dla każdego fragmentu **, granic tur (new_turn) oraz tego samego buforowania dialogów, które serwer stosuje dla v3.
Do wsadowego lub strumieniowanego przez HTTP generowania dialogów (całe żądanie w jednym wywołaniu) użyj Create dialogue lub Stream dialogue zamiast WebSocket.
Porównanie
Kiedy lepiej użyć WebSocket TTS
- Masz już integrację z Flash lub Multilingual v2 ze względu na opóźnienia lub obsługę języków.
- Chcesz używać jednego głosu narratora na połączenie i prostego protokołu tekstu na ramkę.
- Potrzebujesz koordynacji multi-context dla wtrąceń i równoległych wypowiedzi (przewodnik multi-context).
Pełny opis WebSocket TTS znajdziesz w Generate audio in real-time.
Kiedy lepiej użyć WebSocket TTD
- Korzystasz z dialogów Eleven v4 (tagi ekspresji, konwersacyjne tempo, kwestie wielu mówców).
- Strumieniujesz dialog ze scenariusza lub wygenerowany przez LLM, w którym głos mówcy może zmieniać się w każdej kwestii bez otwierania nowego połączenia.
- Chcesz stopniowo przesyłać dane w formacie WebSocket z generowaniem dialogów tylko v4 na serwerze.
Praktyczny przewodnik znajdziesz w Realtime Text to Dialogue. Szczegóły protokołu są w dokumentacji API.