Speech Engine

Dodaj głos do własnego agenta czatu lub LLM dzięki ElevenLabs.

Omówienie

ElevenLabs Speech Engine dodaje funkcje głosowe do każdego agenta czatu. ElevenLabs obsługuje zamianę mowy na tekst i zamianę tekstu na mowę, a twój serwer zapewnia logikę LLM. SDK zarządza cyklem życia połączenia, zmianą tur i wykrywaniem przerwań, więc możesz skupić się na działaniu agenta.

Jak to działa

Speech Engine łączy twój serwer z ElevenLabs przez WebSocket. Każde połączenie reprezentuje jedną rozmowę.

  1. Użytkownik mówi w przeglądarce. ElevenLabs przechwytuje audio i je transkrybuje.
  2. Transkrypcja trafia na twój serwer razem z pełną historią rozmowy.
  3. Twój serwer przekazuje transkrypcję do LLM i przesyła odpowiedź strumieniowo z powrotem.
  4. ElevenLabs zamienia tekst na mowę i odtwarza ją w przeglądarce.

Kiedy używać Speech Engine

Speech Engine jest przeznaczony dla deweloperów, którzy chcą używać własnego LLM i kontrolować logikę rozmowy na własnym serwerze. Użyj go, gdy chcesz:

  • Dodać głos do istniejącego tekstowego agenta czatu
  • Użyć konkretnego LLM, dostrojonego modelu lub własnego pipeline’u inferencyjnego
  • Zachować pełną kontrolę nad kierowaniem rozmów, zarządzaniem kontekstem i wywoływaniem narzędzi
  • Zintegrować głos z istniejącą aplikacją serwerową (Express, FastAPI itp.)

Jeśli chcesz w pełni hostowane rozwiązanie, w którym ElevenLabs zapewnia LLM, bazę wiedzy i narzędzia, użyj zamiast tego ElevenAgents.

Najważniejsze funkcje

  • Dowolny LLM — używaj OpenAI, Anthropic, Google Gemini lub dowolnego modelu generującego tekst. SDK automatycznie wyodrębnia tekst ze strumieni OpenAI, Anthropic i Gemini.
  • Obsługa przerwań — gdy użytkownik zacznie mówić w trakcie odpowiedzi, SDK automatycznie anuluje trwające żądanie LLM przez AbortSignal (TypeScript) lub anulowanie zadania (Python).
  • Streaming — odpowiedzi są przesyłane do przeglądarki strumieniowo podczas generowania. Przekaż ciąg znaków, asynchroniczny iterowalny obiekt lub natywny obiekt strumienia LLM.
  • Zmiana tur — SDK zarządza turami rozmowy, więc twój serwer musi tylko odpowiadać na transkrypcje.

Lista dozwolonych adresów IP

Jeśli twój serwer jest za firewallem lub używa kontroli dostępu opartej na IP, możesz dodać do listy dozwolonych statyczne wychodzące adresy IP, z których pochodzą połączenia WebSocket ElevenLabs. Pełną listę adresów IP znajdziesz w sekcji Lista dozwolonych adresów IP.

Lista dozwolonych adresów IP zapewnia, że twój serwer akceptuje połączenia WebSocket tylko z systemów ElevenLabs.

FAQ

Dowolny LLM generujący tekst. SDK ma wbudowane wyodrębnianie strumieni dla OpenAI (Responses API i Chat Completions API), Anthropic Messages API oraz Google Gemini API. W przypadku innych dostawców przekaż zwykły ciąg znaków lub asynchroniczny iterowalny obiekt fragmentów tekstu.

ElevenAgents to w pełni hostowana platforma, w której ElevenLabs zapewnia LLM, bazę wiedzy i narzędzia. Speech Engine jest dla deweloperów, którzy chcą używać własnego LLM i kontrolować logikę rozmowy na własnym serwerze.

W TypeScript możesz podłączyć Speech Engine do dowolnego serwera HTTP Node.js (Express, Fastify lub zwykłego http.createServer()) albo uruchomić niezależny serwer WebSocket. W Python SDK zapewnia niezależny serwer przez engine.serve() lub możesz zintegrować go z FastAPI, Starlette albo dowolnym frameworkiem ASGI za pomocą engine.create_session().