Pular para o conteúdo

Conheça o Scribe

Publicado

OuvirOuça este artigo

Scribe, nosso primeiro modelo de Speech to Text, é o modelo de transcrição mais preciso do mundo. Criado para lidar com a imprevisibilidade do áudio do mundo real, o Scribe transcreve falas em 99 idiomas e oferece timestamps por palavra, diarização de locutores e marcação de eventos de áudio, tudo em uma resposta estruturada para integração simples.

O Scribe foi desenvolvido para oferecer precisão. Nos testes de benchmark FLEURS e Common Voice, que abrangem 99 idiomas, ele supera consistentemente modelos líderes, como Gemini 2.0 Flash, Whisper Large V3 e Deepgram Nova-3. Seja para resumos de reuniões, legendas de filmes ou até letras de músicas, o Scribe oferece a menor taxa de erro em transcrições automatizadas em italiano (98,7%), inglês (96,7%) e outros 97 idiomas.

O Scribe torna o ASR acessível para todos, reduzindo drasticamente os erros em idiomas que tradicionalmente recebem menos suporte, como sérvio, cantonês e malaiala, nos quais modelos concorrentes frequentemente ultrapassam taxas de erro de 40% por palavra.

The world's most accurate ASR model by IIElevenLabs.

Os desenvolvedores já podem integrar o Scribe pela nossa API de Speech to Text para obter transcrições estruturadas em JSON com diarização de locutores e timestamps por palavra, além de marcadores de eventos não verbais, como risadas. Uma versão de baixa latência para aplicações em tempo real será lançada em breve.

Criadores e empresas podem usar o Scribe diretamente pelo dashboard da ElevenLabs para enviar arquivos de áudio ou vídeo e gerar transcrições formatadas.

Comece a criar com o Scribe:

Documentação da API | Experimente no Dashboard da ElevenLabs

Benchmarks

FLEURS - Taxa de erro por palavra % - 102 idiomas

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice - Taxa de erro por palavra % - 102 idiomas

Bar chart comparing word error rates for different voice recognition models across various countries.

Contribuições

Liderança de pesquisa, treinamento, arquitetura

Flavio Schneider

Liderança do projeto, dados de pré-treinamento, dados de ajuste fino

Tim von Känel

Inferência, otimizações

Maximiliano Levi

Colaboradores de pesquisa

Johan Nordberg, Piotr Dabkowski

Frontend

Austin Malerba

Backend

Hristo Stoychev

Aquisição de dados

Alex George

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade