O que é Speech to Text?

Speech to Text converte áudio falado em texto escrito. Na ElevenLabs, nosso modelo de Speech to Text é o Scribe. Ele permite transcrever fala com precisão em mais de 90 idiomas, facilitando a transformação de áudio em texto legível e pesquisável.

Principais recursos do Scribe

  • Precisão líder do setor, com 98% de precisão em idiomas principais como inglês, francês, italiano, português, espanhol e alemão.
  • Marcas de tempo precisas no nível da palavra, para você ver exatamente quando cada palavra é falada.
  • Diarização inteligente de falantes, que identifica e separa automaticamente diferentes falantes.
  • Marcação dinâmica de áudio para detectar sons que não são fala.
  • Suporte para até 32 falantes, mantendo alta precisão.

Novidades do Scribe v2

O Scribe v2 expande o modelo principal com recursos adicionais desenvolvidos para casos de uso mais exigentes.

  • Prompting de termos-chave. Você pode fornecer até 100 palavras ou frases para orientar o modelo a transcrever corretamente termos importantes. O uso de prompting de termos-chave aumenta o custo em 20%.
  • Detecção de entidades. Você pode escolher categorias específicas de informações para detectar na transcrição, como números de cartão de crédito, nomes ou condições médicas. A detecção de entidades está disponível somente via API e aumenta o custo em 30%.
  • Suporte inteligente a vários idiomas. Você pode enviar áudio contendo vários idiomas, e o Scribe v2 detectará e transcreverá cada um corretamente de forma automática.
  • Maior estabilidade. O Scribe v2 lida com pausas, mudanças de tom e longos silêncios sem interromper ou perder precisão.

Qual versão você deve usar?

Recomendamos o Scribe v2 quando for necessária uma transcrição de alta precisão. Ele está disponível em nosso site e pela API. Ao usar Speech to Text pelo nosso site, o Scribe v2 é o modelo padrão.

Para áudios médicos e clínicos, use o Scribe v2 Medical (scribe_v2_medical) pela mesma API. Ele é cobrado pela mesma tarifa do Scribe v2.

Para casos de uso em tempo real, recomendamos o Scribe v2 Realtime, disponível pelo ElevenAgents e pela API.

Para mais detalhes, consulte nossa documentação de Speech to Text.