O que é Speech to Text?
O que é Speech to Text?
Speech to Text converte áudio falado em texto escrito. Na ElevenLabs, nosso modelo de Speech to Text é o Scribe. Ele permite transcrever fala com precisão em mais de 90 idiomas, facilitando a transformação de áudio em texto legível e pesquisável.
Principais recursos do Scribe
- Precisão líder do setor, com 98% de precisão em idiomas principais como inglês, francês, italiano, português, espanhol e alemão.
- Marcas de tempo precisas no nível da palavra, para você ver exatamente quando cada palavra é falada.
- Diarização inteligente de falantes, que identifica e separa automaticamente diferentes falantes.
- Marcação dinâmica de áudio para detectar sons que não são fala.
- Suporte para até 32 falantes, mantendo alta precisão.
Novidades do Scribe v2
O Scribe v2 expande o modelo principal com recursos adicionais desenvolvidos para casos de uso mais exigentes.
- Prompting de termos-chave. Você pode fornecer até 100 palavras ou frases para orientar o modelo a transcrever corretamente termos importantes. O uso de prompting de termos-chave aumenta o custo em 20%.
- Detecção de entidades. Você pode escolher categorias específicas de informações para detectar na transcrição, como números de cartão de crédito, nomes ou condições médicas. A detecção de entidades está disponível somente via API e aumenta o custo em 30%.
- Suporte inteligente a vários idiomas. Você pode enviar áudio contendo vários idiomas, e o Scribe v2 detectará e transcreverá cada um corretamente de forma automática.
- Maior estabilidade. O Scribe v2 lida com pausas, mudanças de tom e longos silêncios
sem interromper ou perder precisão.
Qual versão você deve usar?
Recomendamos o Scribe v2 quando for necessária uma transcrição de alta precisão. Ele está disponível em nosso site e pela API. Ao usar Speech to Text pelo nosso site, o Scribe v2 é o modelo padrão.
Para áudios médicos e clínicos, use o Scribe v2 Medical (scribe_v2_medical) pela mesma API. Ele é cobrado pela mesma tarifa do Scribe v2.
Para casos de uso em tempo real, recomendamos o Scribe v2 Realtime, disponível pelo ElevenAgents e pela API.
Para mais detalhes, consulte nossa documentação de Speech to Text.