Conheça o Scribe
- Publicado
OuvirOuça este artigo
Scribe, nosso primeiro modelo de Speech to Text, é o modelo de transcrição mais preciso do mundo. Criado para lidar com a imprevisibilidade do áudio do mundo real, o Scribe transcreve falas em 99 idiomas e oferece timestamps por palavra, diarização de locutores e marcação de eventos de áudio, tudo em uma resposta estruturada para integração simples.

O Scribe foi desenvolvido para oferecer precisão. Nos testes de benchmark FLEURS e Common Voice, que abrangem 99 idiomas, ele supera consistentemente modelos líderes, como Gemini 2.0 Flash, Whisper Large V3 e Deepgram Nova-3. Seja para resumos de reuniões, legendas de filmes ou até letras de músicas, o Scribe oferece a menor taxa de erro em transcrições automatizadas em italiano (98,7%), inglês (96,7%) e outros 97 idiomas.
O Scribe torna o ASR acessível para todos, reduzindo drasticamente os erros em idiomas que tradicionalmente recebem menos suporte, como sérvio, cantonês e malaiala, nos quais modelos concorrentes frequentemente ultrapassam taxas de erro de 40% por palavra.

Os desenvolvedores já podem integrar o Scribe pela nossa API de Speech to Text para obter transcrições estruturadas em JSON com diarização de locutores e timestamps por palavra, além de marcadores de eventos não verbais, como risadas. Uma versão de baixa latência para aplicações em tempo real será lançada em breve.
Criadores e empresas podem usar o Scribe diretamente pelo dashboard da ElevenLabs para enviar arquivos de áudio ou vídeo e gerar transcrições formatadas.
Comece a criar com o Scribe:
Documentação da API | Experimente no Dashboard da ElevenLabs
Benchmarks
FLEURS - Taxa de erro por palavra % - 102 idiomas

Common Voice - Taxa de erro por palavra % - 102 idiomas

Contribuições
Liderança de pesquisa, treinamento, arquitetura
Flavio Schneider
Liderança do projeto, dados de pré-treinamento, dados de ajuste fino
Tim von Känel
Inferência, otimizações
Maximiliano Levi
Colaboradores de pesquisa
Johan Nordberg, Piotr Dabkowski
Frontend
Austin Malerba
Backend
Hristo Stoychev
Aquisição de dados
Alex George

.webp&w=3840&q=80)


