Czym jest API Text-to-Speech WebSockets?
Czym jest API Text-to-Speech WebSockets?
Endpoint streamingu WebSocket, czasem nazywany też streamingiem wejściowym, zapewnia konwersję zamiany tekstu na mowę w czasie rzeczywistym przez WebSockets. Pozwala wysłać wiadomość tekstową i otrzymać dane audio w czasie rzeczywistym.
Został zaprojektowany tak, aby generować fragmenty audio już na podstawie częściowych fragmentów tekstu. Pomaga zminimalizować opóźnienie, ponieważ zaczyna generować wynik przed dostarczeniem całego kontekstu. Jest przeznaczony do użycia z narzędziami takimi jak duże modele językowe (LLM). Wygenerowane audio nadal brzmi jak ciągła wypowiedź.
Choć API WebSockets jest bardzo elastyczne, nie sprawdzi się w każdym przypadku.
Dobrze nadaje się, gdy:
- Tekst wejściowy jest przesyłany strumieniowo lub generowany fragmentami.
- Potrzebujesz jak najniższego opóźnienia.
- Potrzebujesz informacji o dopasowaniu słów do audio.
Może nie być najlepszym wyborem, gdy:
- Cały tekst wejściowy jest dostarczany naraz. Ponieważ generowanie odbywa się częściowo, wymaga buforowania, co może nieznacznie zwiększyć opóźnienie w porównaniu ze standardowym żądaniem HTTP. W takim przypadku lepszym rozwiązaniem będzie prawdopodobnie sam endpoint streamingu wyjściowego.
- Chcesz szybko testować lub stworzyć prototyp. Praca z WebSockets może być trudniejsza i bardziej złożona niż ze standardowym HTTP API, co może spowolnić szybki rozwój i testowanie.
- Najważniejsza jest jak najwyższa spójność. Musisz wtedy uwzględnić rozumienie kontekstu przez AI. Ponieważ AI nie otrzymuje pełnego kontekstu na początku żądania, rozumie tekst tylko częściowo, co w niektórych przypadkach może powodować problemy. Możesz jednak testować ustawienia dostępne w streamingu WebSocket, takie jak “chunk_length_schedule”. Ten parametr określa, jak duże muszą być fragmenty, zanim AI zacznie generować tekst.
W takich przypadkach użyj Text to Speech API.
Więcej informacji znajdziesz w dokumentacji API WebSockets.