O que é a API WebSockets de Text to Speech?

O endpoint de streaming WebSocket, também chamado às vezes de streaming de entrada, oferece conversão de texto em voz em tempo real usando WebSockets. Assim, você pode enviar uma mensagem de texto e receber dados de áudio em tempo real.

Ele foi projetado para começar a gerar trechos de áudio usando como entrada até mesmo partes do texto. Pode ajudar a minimizar a latência ao iniciar a geração do resultado antes que todo o contexto seja enviado e deve ser usado em conjunto com outras ferramentas, como Modelos de Linguagem de Grande Escala (LLMs). O áudio gerado ainda soará como uma fala contínua.

Embora seja muito flexível, a API WebSockets não é uma solução única para todos os casos.

Ela é ideal para cenários em que:

  • O texto de entrada é transmitido ou gerado em partes.
  • É necessária a menor latência possível.
  • São necessárias informações de alinhamento entre palavras e áudio.

 Talvez ela não seja a melhor opção quando:

  • Todo o texto de entrada é enviado de uma vez. Como as gerações são parciais, é necessário algum buffering, o que pode resultar em uma latência um pouco maior em comparação com uma solicitação HTTP padrão. Em casos assim, usar apenas o endpoint de streaming de saída provavelmente é a melhor opção.
  • Você quer experimentar ou criar um protótipo rapidamente. Trabalhar com WebSockets pode ser mais difícil e complexo do que usar uma API HTTP padrão, o que pode tornar o desenvolvimento e os testes rápidos mais lentos.
  • A maior consistência possível é extremamente importante. É preciso considerar a compreensão de contexto da IA. Como a IA não recebe o contexto completo no início da solicitação, ela terá apenas uma compreensão parcial do texto, o que, em alguns casos, pode causar problemas. No entanto, você pode testar algumas das configurações disponíveis ao usar streaming WebSocket, como “chunk_length_schedule”. Esse parâmetro determina o tamanho que os trechos precisam ter antes de a IA começar a gerar texto.

Nesses casos, use a API de Text to Speech em vez disso.

Para saber mais, consulte a Referência da API WebSockets.