Allineamento forzato
Panoramica
L’API ElevenLabs Forced Alignment trasforma audio parlato e testo in una trascrizione allineata nel tempo. È utile quando hai una registrazione audio e una trascrizione, ma ti servono timestamp precisi per ogni parola o frase della trascrizione. Puoi usarla per:
- Sincronizzare i sottotitoli con una registrazione video
- Generare i tempi per la registrazione di un audiolibro tratto da un ebook
Utilizzo
Puoi usare l’API Forced Alignment interfacciandoti direttamente con l’API ElevenLabs.
Lingue supportate
I nostri modelli multilingue v2 supportano 29 lingue:
inglese (Stati Uniti, Regno Unito, Australia, Canada), giapponese, cinese, tedesco, hindi, francese (Francia, Canada), coreano, portoghese (Brasile, Portogallo), italiano, spagnolo (Spagna, Messico), indonesiano, olandese, turco, filippino, polacco, svedese, bulgaro, rumeno, arabo (Arabia Saudita, Emirati Arabi Uniti), ceco, greco, finlandese, croato, malese, slovacco, danese, tamil, ucraino e russo.
Informazioni principali
- Formato del testo di input: solo stringa semplice — non racchiudere il testo di input in JSON o altre strutture
- Diarizzazione: non supportata; fornire testo diarizzato produrrà risultati imprevisti
- Prezzi: stessa tariffa dell’API Speech to Text
- Dimensione massima del file: 3 GB
- Durata massima dell’audio: 10 ore
- Lunghezza massima del testo: 675.000 caratteri