Alignement forcé
Alignement forcé
Découvrez comment transformer de l’audio parlé et du texte en transcription synchronisée avec ElevenLabs.
Présentation
L’API Forced Alignment d’ElevenLabs transforme de l’audio parlé et du texte en transcription synchronisée. Elle est utile lorsque vous disposez d’un enregistrement audio et d’une transcription, mais avez besoin d’horodatages précis pour chaque mot ou expression de la transcription. Elle permet notamment de :
- Synchroniser des sous-titres avec un enregistrement vidéo
- Générer les repères temporels d’un enregistrement de livre audio à partir d’un ebook
Utilisation
Vous pouvez utiliser l’API Forced Alignment en interagissant directement avec l’API ElevenLabs.
Langues prises en charge
Nos modèles multilingues v2 prennent en charge 29 langues :
Anglais (États-Unis, Royaume-Uni, Australie, Canada), japonais, chinois, allemand, hindi, français (France, Canada), coréen, portugais (Brésil, Portugal), italien, espagnol (Espagne, Mexique), indonésien, néerlandais, turc, filipino, polonais, suédois, bulgare, roumain, arabe (Arabie saoudite, Émirats arabes unis), tchèque, grec, finnois, croate, malais, slovaque, danois, tamoul, ukrainien et russe.
Informations clés
- Format du texte d’entrée : chaîne de caractères simple uniquement ; n’encapsulez pas le texte d’entrée dans du JSON ou une autre structure
- Diarisation : non prise en charge ; fournir du texte diarizé produira des résultats inattendus
- Tarification : même tarif que l’API Speech to Text
- Taille maximale de fichier : 3 Go
- Durée audio maximale : 10 heures
- Longueur maximale du texte : 675 000 caractères