Speech Engine
Adicione voz ao seu próprio agente de chat ou LLM com a ElevenLabs.
Visão geral
O Speech Engine da ElevenLabs adiciona recursos de voz a qualquer agente de chat. A ElevenLabs cuida de speech-to-text e text-to-speech, enquanto seu servidor fornece a lógica do LLM. O SDK gerencia o ciclo de vida da conexão, as trocas de turno e a detecção de interrupções para que você possa se concentrar no comportamento do seu agente.
Como funciona
O Speech Engine conecta seu servidor à ElevenLabs por WebSocket. Cada conexão representa uma conversa.
- Um usuário fala no navegador. A ElevenLabs captura o áudio e o transcreve.
- A transcrição é enviada ao seu servidor junto com o histórico completo da conversa.
- Seu servidor envia a transcrição ao seu LLM e transmite a resposta de volta.
- A ElevenLabs converte o texto em voz e o reproduz no navegador.
Quando usar o Speech Engine
O Speech Engine foi desenvolvido para desenvolvedores que querem usar o próprio LLM e controlar a lógica de conversa no próprio servidor. Use-o quando precisar:
- Adicionar voz a um agente de chat baseado em texto já existente
- Usar um LLM específico, modelo com fine-tuning ou pipeline de inferência personalizado
- Manter controle total sobre roteamento de conversas, gerenciamento de contexto e chamadas de ferramentas
- Integrar voz a um aplicativo de servidor existente (Express, FastAPI etc.)
Se quiser uma solução totalmente hospedada em que a ElevenLabs fornece o LLM, a base de conhecimento e as ferramentas, use o ElevenAgents.
Recursos principais
- Qualquer LLM - use OpenAI, Anthropic, Google Gemini ou qualquer modelo que produza texto. O SDK extrai automaticamente texto dos formatos de streaming da OpenAI, Anthropic e Gemini.
- Gerenciamento de interrupções - quando o usuário fala durante uma resposta, o SDK cancela automaticamente a solicitação de LLM em andamento por meio de um
AbortSignal(TypeScript) ou do cancelamento de tarefa (Python). - Streaming - as respostas são transmitidas ao navegador conforme são geradas. Envie uma string, um iterável assíncrono ou um objeto de stream nativo do LLM.
- Troca de turnos - o SDK gerencia os turnos da conversa, então seu servidor só precisa responder às transcrições.
Lista de IPs permitidos
Se o seu servidor estiver atrás de um firewall ou usar controles de acesso baseados em IP, você poderá adicionar à lista de permissões os IPs de saída estáticos de onde se originam as conexões WebSocket da ElevenLabs. Consulte lista de IPs permitidos para ver a lista completa de endereços IP.
Usar uma lista de IPs permitidos garante que seu servidor aceite apenas conexões WebSocket dos sistemas da ElevenLabs.
Perguntas frequentes
Quais LLMs são compatíveis?
Qualquer LLM que produza texto. O SDK conta com extração de stream integrada para OpenAI (Responses API e Chat Completions API), Anthropic Messages API e Google Gemini API. Para outros provedores, envie uma string simples ou um iterável assíncrono de blocos de string.
Qual é a diferença entre Speech Engine e ElevenAgents?
O ElevenAgents é uma plataforma totalmente hospedada em que a ElevenLabs fornece o LLM, a base de conhecimento e as ferramentas. O Speech Engine é para desenvolvedores que querem usar o próprio LLM e controlar a lógica de conversa no próprio servidor.
Quais frameworks de servidor são compatíveis?
Em TypeScript, você pode conectar o Speech Engine a qualquer servidor HTTP Node.js (Express, Fastify ou
http.createServer() simples) ou executar um servidor WebSocket independente. Em Python, o SDK fornece
um servidor independente por meio de engine.serve(), ou você pode integrá-lo ao FastAPI, Starlette ou qualquer
framework ASGI usando engine.create_session().