Ir al contenido

Conoce a Scribe

Publicado

EscucharEscucha este artículo

Scribe, nuestro primer modelo de Voz a Texto, es el modelo de transcripción más preciso del mundo. Diseñado para afrontar la imprevisibilidad del audio del mundo real, Scribe transcribe voz en 99 idiomas e incluye marcas de tiempo por palabra, diarización de hablantes y etiquetado de eventos de audio, todo en una respuesta estructurada para integrarlo fácilmente.

Scribe está diseñado para ofrecer precisión. En las pruebas de referencia FLEURS y Common Voice, realizadas en 99 idiomas, supera sistemáticamente a modelos líderes como Gemini 2.0 Flash, Whisper Large V3 y Deepgram Nova-3. Ya sean resúmenes de reuniones, subtítulos de películas o incluso letras de canciones, Scribe ofrece la tasa de error de palabras más baja en transcripción automática en italiano (98,7 %), inglés (96,7 %) y otros 97 idiomas.

Scribe hace que el ASR sea accesible para todo el mundo y reduce drásticamente los errores en idiomas tradicionalmente desatendidos, como el serbio, el cantonés y el malayalam, donde los modelos de la competencia suelen superar tasas de error de palabras del 40 %.

The world's most accurate ASR model by IIElevenLabs.

Desarrolladores pueden integrar Scribe hoy mismo a través de nuestra API de Voz a Texto para obtener transcripciones JSON estructuradas con diarización de hablantes y marcas de tiempo por palabra, además de indicadores de eventos no verbales (p. ej., risas). Pronto lanzaremos una versión de baja latencia para aplicaciones en tiempo real.

Creadores y empresas pueden usar Scribe directamente desde el panel de control de ElevenLabs para subir archivos de audio o vídeo y generar transcripciones con formato.

Empieza a desarrollar con Scribe:

Documentación de la API | Pruébalo en el panel de control de ElevenLabs

Pruebas de referencia

FLEURS - Tasa de error de palabras % - 102 idiomas

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice - Tasa de error de palabras % - 102 idiomas

Bar chart comparing word error rates for different voice recognition models across various countries.

Colaboraciones

Responsable de investigación, entrenamiento y arquitectura

Flavio Schneider

Responsable del proyecto, datos de preentrenamiento y datos de ajuste fino

Tim von Känel

Inferencia y optimizaciones

Maximiliano Levi

Colaboradores de investigación

Johan Nordberg, Piotr Dabkowski

Frontend

Austin Malerba

Backend

Hristo Stoychev

Adquisición de datos

Alex George

Artículos relacionados

Crea con el audio IA de la más alta calidad