Speech Engine

Adicione voz ao seu próprio agente de chat ou LLM com a ElevenLabs.

Visão geral

O Speech Engine da ElevenLabs adiciona recursos de voz a qualquer agente de chat. A ElevenLabs cuida de speech-to-text e text-to-speech, enquanto seu servidor fornece a lógica do LLM. O SDK gerencia o ciclo de vida da conexão, as trocas de turno e a detecção de interrupções para que você possa se concentrar no comportamento do seu agente.

Como funciona

O Speech Engine conecta seu servidor à ElevenLabs por WebSocket. Cada conexão representa uma conversa.

  1. Um usuário fala no navegador. A ElevenLabs captura o áudio e o transcreve.
  2. A transcrição é enviada ao seu servidor junto com o histórico completo da conversa.
  3. Seu servidor envia a transcrição ao seu LLM e transmite a resposta de volta.
  4. A ElevenLabs converte o texto em voz e o reproduz no navegador.

Quando usar o Speech Engine

O Speech Engine foi desenvolvido para desenvolvedores que querem usar o próprio LLM e controlar a lógica de conversa no próprio servidor. Use-o quando precisar:

  • Adicionar voz a um agente de chat baseado em texto já existente
  • Usar um LLM específico, modelo com fine-tuning ou pipeline de inferência personalizado
  • Manter controle total sobre roteamento de conversas, gerenciamento de contexto e chamadas de ferramentas
  • Integrar voz a um aplicativo de servidor existente (Express, FastAPI etc.)

Se quiser uma solução totalmente hospedada em que a ElevenLabs fornece o LLM, a base de conhecimento e as ferramentas, use o ElevenAgents.

Recursos principais

  • Qualquer LLM - use OpenAI, Anthropic, Google Gemini ou qualquer modelo que produza texto. O SDK extrai automaticamente texto dos formatos de streaming da OpenAI, Anthropic e Gemini.
  • Gerenciamento de interrupções - quando o usuário fala durante uma resposta, o SDK cancela automaticamente a solicitação de LLM em andamento por meio de um AbortSignal (TypeScript) ou do cancelamento de tarefa (Python).
  • Streaming - as respostas são transmitidas ao navegador conforme são geradas. Envie uma string, um iterável assíncrono ou um objeto de stream nativo do LLM.
  • Troca de turnos - o SDK gerencia os turnos da conversa, então seu servidor só precisa responder às transcrições.

Lista de IPs permitidos

Se o seu servidor estiver atrás de um firewall ou usar controles de acesso baseados em IP, você poderá adicionar à lista de permissões os IPs de saída estáticos de onde se originam as conexões WebSocket da ElevenLabs. Consulte lista de IPs permitidos para ver a lista completa de endereços IP.

Usar uma lista de IPs permitidos garante que seu servidor aceite apenas conexões WebSocket dos sistemas da ElevenLabs.

Perguntas frequentes

Qualquer LLM que produza texto. O SDK conta com extração de stream integrada para OpenAI (Responses API e Chat Completions API), Anthropic Messages API e Google Gemini API. Para outros provedores, envie uma string simples ou um iterável assíncrono de blocos de string.

O ElevenAgents é uma plataforma totalmente hospedada em que a ElevenLabs fornece o LLM, a base de conhecimento e as ferramentas. O Speech Engine é para desenvolvedores que querem usar o próprio LLM e controlar a lógica de conversa no próprio servidor.

Em TypeScript, você pode conectar o Speech Engine a qualquer servidor HTTP Node.js (Express, Fastify ou http.createServer() simples) ou executar um servidor WebSocket independente. Em Python, o SDK fornece um servidor independente por meio de engine.serve(), ou você pode integrá-lo ao FastAPI, Starlette ou qualquer framework ASGI usando engine.create_session().