Alineación forzada

Aprende a convertir audio hablado y texto en una transcripción alineada temporalmente con ElevenLabs.

Descripción general

La API de Alineación forzada de ElevenLabs convierte audio hablado y texto en una transcripción alineada temporalmente. Es útil cuando tienes una grabación de audio y una transcripción, pero necesitas marcas de tiempo exactas para cada palabra o frase de la transcripción. Puedes usarla para:

  • Sincronizar subtítulos con una grabación de vídeo
  • Generar tiempos para la grabación de un audiolibro a partir de un ebook

Uso

Puedes usar la API de Alineación forzada conectándote directamente a la API de ElevenLabs.

Idiomas compatibles

Nuestros modelos multilingües v2 son compatibles con 29 idiomas:

Inglés (EE. UU., Reino Unido, Australia, Canadá), japonés, chino, alemán, hindi, francés (Francia, Canadá), coreano, portugués (Brasil, Portugal), italiano, español (España, México), indonesio, neerlandés, turco, filipino, polaco, sueco, búlgaro, rumano, árabe (Arabia Saudí, EAU), checo, griego, finés, croata, malayo, eslovaco, danés, tamil, ucraniano y ruso.

Datos clave

  • Formato del texto de entrada: Solo texto sin formato; no incluyas el texto de entrada en JSON ni en ninguna otra estructura
  • Diarización: No compatible; proporcionar texto diarizado generará resultados inesperados
  • Precios: La misma tarifa que la API de Voz a Texto
  • Tamaño máximo de archivo: 3 GB
  • Duración máxima de audio: 10 horas
  • Longitud máxima del texto: 675.000 caracteres