Conoce a Scribe
- Publicado
EscucharEscucha este artículo
Scribe, nuestro primer modelo de Voz a Texto, es el modelo de transcripción más preciso del mundo. Diseñado para afrontar la imprevisibilidad del audio del mundo real, Scribe transcribe voz en 99 idiomas e incluye marcas de tiempo por palabra, diarización de hablantes y etiquetado de eventos de audio, todo en una respuesta estructurada para integrarlo fácilmente.

Scribe está diseñado para ofrecer precisión. En las pruebas de referencia FLEURS y Common Voice, realizadas en 99 idiomas, supera sistemáticamente a modelos líderes como Gemini 2.0 Flash, Whisper Large V3 y Deepgram Nova-3. Ya sean resúmenes de reuniones, subtítulos de películas o incluso letras de canciones, Scribe ofrece la tasa de error de palabras más baja en transcripción automática en italiano (98,7 %), inglés (96,7 %) y otros 97 idiomas.
Scribe hace que el ASR sea accesible para todo el mundo y reduce drásticamente los errores en idiomas tradicionalmente desatendidos, como el serbio, el cantonés y el malayalam, donde los modelos de la competencia suelen superar tasas de error de palabras del 40 %.

Desarrolladores pueden integrar Scribe hoy mismo a través de nuestra API de Voz a Texto para obtener transcripciones JSON estructuradas con diarización de hablantes y marcas de tiempo por palabra, además de indicadores de eventos no verbales (p. ej., risas). Pronto lanzaremos una versión de baja latencia para aplicaciones en tiempo real.
Creadores y empresas pueden usar Scribe directamente desde el panel de control de ElevenLabs para subir archivos de audio o vídeo y generar transcripciones con formato.
Empieza a desarrollar con Scribe:
Documentación de la API | Pruébalo en el panel de control de ElevenLabs
Pruebas de referencia
FLEURS - Tasa de error de palabras % - 102 idiomas

Common Voice - Tasa de error de palabras % - 102 idiomas

Colaboraciones
Responsable de investigación, entrenamiento y arquitectura
Flavio Schneider
Responsable del proyecto, datos de preentrenamiento y datos de ajuste fino
Tim von Känel
Inferencia y optimizaciones
Maximiliano Levi
Colaboradores de investigación
Johan Nordberg, Piotr Dabkowski
Frontend
Austin Malerba
Backend
Hristo Stoychev
Adquisición de datos
Alex George

.webp&w=3840&q=80)


