Streaming po stronie serwera
Ten poradnik pokazuje, jak transkrybować audio w czasie rzeczywistym po stronie serwera za pomocą ElevenLabs.
Poradnik · Zakłada, że masz już za sobą krótki przewodnik po Speech to Text .
Omówienie
ElevenLabs Realtime Speech to Text API pozwala transkrybować strumienie audio w czasie rzeczywistym z bardzo małym opóźnieniem, korzystając z modelu Scribe Realtime v2. Niezależnie od tego, czy tworzysz asystentów głosowych, usługi transkrypcji czy aplikację wymagającą rozpoznawania mowy na żywo, to API oparte na WebSocket dostarcza częściowe transkrypcje podczas mówienia i zatwierdzone transkrypcje po zakończeniu segmentów mowy.
Scribe v2 Realtime można wdrożyć po stronie serwera, aby transkrybować audio w czasie rzeczywistym z adresu URL, pliku lub własnego strumienia audio.
Implementacja po stronie serwera różni się od tej po stronie klienta w kilku kwestiach:
- Używa klucza API ElevenLabs zamiast tokenu jednorazowego.
- Obsługuje streaming bezpośrednio z adresu URL, bez ręcznego dzielenia audio na fragmenty.
Aby przesyłać audio bezpośrednio z mikrofonu, zobacz poradnik Streaming po stronie klienta.
Szybki start
Ten poradnik zakłada, że masz skonfigurowany klucz API i SDK. Jeśli jeszcze tego nie zrobisz, najpierw przejdź przez szybki start.
Skonfiguruj SDK
SDK oferuje dwa sposoby transkrypcji audio w czasie rzeczywistym: streaming z adresu URL lub ręczne dzielenie audio z pliku albo własnego strumienia audio na fragmenty.
Pełną listę obsługiwanych przez API parametrów i opcji znajdziesz w dokumentacji API.
Stream z URL
Ręczne dzielenie audio na fragmenty
Ten przykład pokazuje, jak przesyłać plik audio z adresu URL za pomocą oficjalnego SDK.
Narzędzie ffmpeg jest wymagane podczas streamingu z adresu URL. Instrukcje instalacji znajdziesz na jego stronie.
Utwórz nowy plik o nazwie example.py lub example.mts, zależnie od wybranego języka, i dodaj poniższy kod: