Ir al contenido

Presentamos Scribe v2

Publicado

EscucharEscucha este artículo

Scribe v2 está diseñado para la transcripción por lotes, la creación de subtítulos y el subtitulado a gran escala. Mejora la estabilidad y precisión de Scribe v1, y gestiona mejor los audios largos, las pausas, los cambios de tono y los silencios prolongados.

Introducing Scribe v2

Mientras que Scribe v2 Realtime está optimizado para una latencia ultrabaja y casos de uso de agentes, Scribe v2 está optimizado para grabaciones largas y complejas, y mantiene la precisión con distintos hablantes, acentos y estilos de entonación. El resultado son transcripciones fiables de forma constante en una amplia variedad de condiciones de audio reales.


Scribe v2 logra la tasa de error por palabra más baja registrada en los benchmarks estándar del sector.

Scribe v2 FLEURS benchmark

Keyterm Prompting para transcripciones que tienen en cuenta el contexto

Keyterm Prompting va más allá del vocabulario personalizado estándar al utilizar el contexto de la transcripción. Selecciona hasta 100 palabras o frases y Scribe v2 decidirá con precisión cuándo transcribir esos términos. Es especialmente adecuado para ámbitos técnicos, nombres de marca y lenguaje específico de cada sector.

Scribe v2 keyterm prompting

Detección de entidades integrada con marcas de tiempo precisas

Scribe v2 incluye detección nativa de entidades para el análisis estructurado de audio.

Puedes seleccionar hasta 56 categorías, entre ellas información de identificación personal, datos de salud o detalles de pago. Scribe v2 detectará automáticamente estos casos y sus marcas de tiempo exactas en la transcripción, para que puedas revisar, censurar o procesar información sensible a gran escala más fácilmente.

Más información en la documentación de la API: https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection

Transcripción automática en varios idiomas

Scribe v2 admite workflows inteligentes en varios idiomas desde el primer momento.

Puedes enviar un archivo de audio que contenga varios idiomas. El modelo detecta automáticamente cada idioma y lo transcribe correctamente, sin necesidad de segmentación ni configuración manuales.

Funciones adicionales para workflows de producción

Scribe v2 incluye un conjunto de funciones diseñadas para casos de uso empresariales y de desarrollador:

  • Diarización inteligente de hablantes para identificarlos de forma clara e intuitiva
  • Marcas de tiempo precisas a nivel de palabra para sincronizar subtítulos con precisión y crear experiencias interactivas
  • Etiquetado dinámico de audio que detecta eventos no verbales, como risas o pasos
  • Preparado para empresas, con cumplimiento de SOC 2, ISO 27001, PCI DSS L1, HIPAA y RGPD, residencia de datos en la UE y la India, y compatibilidad con el modo de retención cero

Scribe v2, ya disponible en ElevenLabs Studio

Scribe v2 ya se utiliza en ElevenLabs Studio para crear subtítulos y transcripciones más precisos, y ayuda a equipos que gestionan grandes bibliotecas de audio y vídeo en casos de uso de marketing, medios, investigación, formación y cumplimiento normativo.

Scribe v2 in Studio

Pruébalo ahora: https://elevenlabs.io/app/studio

Crea con la API

Con Scribe v2, desarrolladores y empresas pueden automatizar procesos de audio complejos, mejorar la precisión en workflows de contenido globales y escalar de forma segura con controles completos de cumplimiento normativo y residencia de datos.

Scribe v2 Keyterm prompting code snippet

Scribe v2 ya está disponible a través de nuestra API y la plataforma Creative.

Pruébalo ahora: https://elevenlabs.io/app/speech-to-text

Consulta la documentación: https://elevenlabs.io/docs/capabilities/speech-to-text

Regístrate aquí: https://elevenlabs.io/speech-to-text

Artículos relacionados

Crea con el audio IA de la más alta calidad