Speech Engine
Dodaj głos do własnego agenta czatu lub LLM dzięki ElevenLabs.
Omówienie
ElevenLabs Speech Engine dodaje funkcje głosowe do każdego agenta czatu. ElevenLabs obsługuje zamianę mowy na tekst i zamianę tekstu na mowę, a twój serwer zapewnia logikę LLM. SDK zarządza cyklem życia połączenia, zmianą tur i wykrywaniem przerwań, więc możesz skupić się na działaniu agenta.
Jak to działa
Speech Engine łączy twój serwer z ElevenLabs przez WebSocket. Każde połączenie reprezentuje jedną rozmowę.
- Użytkownik mówi w przeglądarce. ElevenLabs przechwytuje audio i je transkrybuje.
- Transkrypcja trafia na twój serwer razem z pełną historią rozmowy.
- Twój serwer przekazuje transkrypcję do LLM i przesyła odpowiedź strumieniowo z powrotem.
- ElevenLabs zamienia tekst na mowę i odtwarza ją w przeglądarce.
Kiedy używać Speech Engine
Speech Engine jest przeznaczony dla deweloperów, którzy chcą używać własnego LLM i kontrolować logikę rozmowy na własnym serwerze. Użyj go, gdy chcesz:
- Dodać głos do istniejącego tekstowego agenta czatu
- Użyć konkretnego LLM, dostrojonego modelu lub własnego pipeline’u inferencyjnego
- Zachować pełną kontrolę nad kierowaniem rozmów, zarządzaniem kontekstem i wywoływaniem narzędzi
- Zintegrować głos z istniejącą aplikacją serwerową (Express, FastAPI itp.)
Jeśli chcesz w pełni hostowane rozwiązanie, w którym ElevenLabs zapewnia LLM, bazę wiedzy i narzędzia, użyj zamiast tego ElevenAgents.
Najważniejsze funkcje
- Dowolny LLM — używaj OpenAI, Anthropic, Google Gemini lub dowolnego modelu generującego tekst. SDK automatycznie wyodrębnia tekst ze strumieni OpenAI, Anthropic i Gemini.
- Obsługa przerwań — gdy użytkownik zacznie mówić w trakcie odpowiedzi, SDK automatycznie anuluje trwające żądanie LLM przez
AbortSignal(TypeScript) lub anulowanie zadania (Python). - Streaming — odpowiedzi są przesyłane do przeglądarki strumieniowo podczas generowania. Przekaż ciąg znaków, asynchroniczny iterowalny obiekt lub natywny obiekt strumienia LLM.
- Zmiana tur — SDK zarządza turami rozmowy, więc twój serwer musi tylko odpowiadać na transkrypcje.
Lista dozwolonych adresów IP
Jeśli twój serwer jest za firewallem lub używa kontroli dostępu opartej na IP, możesz dodać do listy dozwolonych statyczne wychodzące adresy IP, z których pochodzą połączenia WebSocket ElevenLabs. Pełną listę adresów IP znajdziesz w sekcji Lista dozwolonych adresów IP.
Lista dozwolonych adresów IP zapewnia, że twój serwer akceptuje połączenia WebSocket tylko z systemów ElevenLabs.
FAQ
Jakie modele LLM są obsługiwane?
Dowolny LLM generujący tekst. SDK ma wbudowane wyodrębnianie strumieni dla OpenAI (Responses API i Chat Completions API), Anthropic Messages API oraz Google Gemini API. W przypadku innych dostawców przekaż zwykły ciąg znaków lub asynchroniczny iterowalny obiekt fragmentów tekstu.
Jaka jest różnica między Speech Engine a ElevenAgents?
ElevenAgents to w pełni hostowana platforma, w której ElevenLabs zapewnia LLM, bazę wiedzy i narzędzia. Speech Engine jest dla deweloperów, którzy chcą używać własnego LLM i kontrolować logikę rozmowy na własnym serwerze.
Jakie frameworki serwerowe są obsługiwane?
W TypeScript możesz podłączyć Speech Engine do dowolnego serwera HTTP Node.js (Express, Fastify lub
zwykłego http.createServer()) albo uruchomić niezależny serwer WebSocket. W Python SDK zapewnia
niezależny serwer przez engine.serve() lub możesz zintegrować go z FastAPI, Starlette albo dowolnym
frameworkiem ASGI za pomocą engine.create_session().