Streaming no servidor
Este guia mostra como transcrever áudio em tempo real no servidor usando a ElevenLabs.
Guia prático · Pressupõe que você concluiu o guia de início rápido de Speech to Text .
Visão geral
A API de Speech to Text em Tempo Real da ElevenLabs permite transcrever streams de áudio em tempo real com latência ultrabaixa usando o modelo Scribe Realtime v2. Seja para criar assistentes de voz, serviços de transcrição ou qualquer aplicação que exija reconhecimento de fala ao vivo, esta API baseada em WebSocket fornece transcrições parciais enquanto você fala e transcrições confirmadas quando os segmentos de fala são concluídos.
O Scribe v2 Realtime pode ser implementado no servidor para transcrever áudio em tempo real, seja por uma URL, arquivo ou seu próprio stream de áudio.
A implementação no servidor difere da implementação no cliente em alguns pontos:
- Usa uma chave de API da ElevenLabs em vez de um token de uso único.
- Compatível com streaming diretamente de uma URL, sem a necessidade de dividir manualmente o áudio em partes.
Para fazer streaming de áudio diretamente do microfone, consulte o guia de streaming no cliente.
Início rápido
Este guia pressupõe que você configurou sua chave de API e o SDK. Conclua primeiro o início rápido, caso ainda não tenha feito isso.
Configure o SDK
O SDK oferece duas formas de transcrever áudio em tempo real: streaming a partir de uma URL ou dividindo manualmente o áudio de um arquivo ou do seu próprio stream de áudio.
Para ver a lista completa de parâmetros e opções compatíveis com a API, consulte a referência da API.
Streaming a partir de uma URL
Divisão manual de áudio em blocos
Este exemplo mostra como fazer streaming de um arquivo de áudio a partir de uma URL usando o SDK oficial.
A ferramenta ffmpeg é necessária para fazer streaming a partir de uma URL. Acesse o site dela para ver instruções de instalação.
Crie um novo arquivo chamado example.py ou example.mts, dependendo da linguagem escolhida, e adicione o código a seguir: