Transcription
Découvrez comment convertir l’audio parlé en texte avec ElevenLabs.
Vue d’ensemble
L’API Speech to Text (STT) d’ElevenLabs convertit l’audio parlé en texte avec une précision de pointe. Notre modèle Scribe v2 s’adapte aux indices textuels dans plus de 90 langues et à plusieurs styles vocaux. Pour essayer une démonstration en direct, consultez notre page de présentation Speech to Text.
Les entreprises soumises aux exigences HIPAA doivent contacter l’équipe commerciale d’ElevenLabs afin de signer un accord de partenariat commercial (BAA). Veillez à effectuer cette étape avant toute intégration ou tout déploiement lié à HIPAA.
Modèles
Exemple de réponse API
L’exemple suivant présente la sortie de l’API Speech to Text utilisant le modèle Scribe v2 pour un fichier audio d’exemple.
Afficher la réponse JSON complète
La sortie est classée en trois types de catégories :
word: un mot dans la langue de l’audiospacing: l’espace entre les mots, non applicable aux langues qui n’utilisent pas d’espaces comme le japonais, le mandarin, le thaï, le lao, le birman et le cantonaisaudio_event: des sons non vocaux comme les rires ou les applaudissements
Requêtes simultanées et priorité
Les requêtes simultanées correspondent au nombre de requêtes pouvant être traitées au même moment.
Pour le Speech to Text, les fichiers de plus de 8 minutes sont transcrits en parallèle en interne afin d’accélérer le traitement. L’audio est divisé en quatre segments transcrits simultanément.
Vous pouvez calculer la limite de requêtes simultanées avec le calcul suivant :
Par exemple, un fichier audio de 15 minutes sera transcrit avec 2 requêtes simultanées, tandis qu’un fichier audio de 120 minutes sera transcrit avec 4 requêtes simultanées.
Le calcul ci-dessus s’applique uniquement à Scribe v2 et Scribe v2 Medical. Pour Scribe v2 Realtime, consultez le tableau des limites de requêtes simultanées.
Fonctionnalités avancées
Le guidage par termes clés et l’édition de transcription entraînent un coût supplémentaire. Consultez la page de tarification de l’API pour obtenir des informations tarifaires détaillées.
Guidage par termes clés
Le guidage par termes clés est disponible avec Scribe v2, Scribe v2 Medical (traitement par lot) et Scribe v2 Realtime.
Mettez en évidence des mots ou expressions pour orienter le modèle vers leur transcription. Cette fonctionnalité est utile pour transcrire des mots ou des phrases spécifiques peu courants dans l’audio, tels que des noms de produits, des noms propres ou d’autres termes spécifiques. Les termes clés sont plus puissants que les mots-clés biaisés ou les vocabulaires personnalisés proposés par d’autres modèles, car le contexte permet de déterminer s’il faut transcrire le terme ou non. Le traitement par lot prend en charge jusqu’à 1 000 termes clés (50 caractères chacun), tandis que le temps réel prend en charge jusqu’à 50 termes clés (20 caractères chacun).
Pour en savoir plus sur l’utilisation du guidage par termes clés, consultez la documentation sur le guidage par termes clés.
Mode non verbatim
Le mode non verbatim est disponible avec Scribe v2, Scribe v2 Medical (traitement par lot) et Scribe v2 Realtime.
Lorsque no_verbatim est activé, le modèle supprime les mots de remplissage, les faux départs et les disfluidés de la transcription. Le résultat est plus propre et adapté aux sous-titres, aux résumés ou à tout cas d’utilisation où la lisibilité prime sur la capture de chaque mot prononcé.
Détection d’entités
Les modèles par lot et Scribe v2 Realtime peuvent détecter plusieurs catégories d’entités dans la transcription et fournir leurs horodatages exacts. Cette fonctionnalité est utile pour mettre en évidence des numéros de carte bancaire, des noms, des pathologies ou des numéros de sécurité sociale.
Pour obtenir la liste complète des entités prises en charge, consultez la documentation sur la détection d’entités.
Édition de transcription
L’édition de transcription est une fonctionnalité expérimentale disponible avec tous les modèles par lot et Scribe v2 Realtime.
Transmettez une instruction en langage naturel avec le paramètre transcript_edit, et elle sera appliquée à la transcription terminée. Le texte modifié est renvoyé dans edited_transcript avec la transcription d’origine, afin de conserver les horodatages et les étiquettes de locuteurs. Cette fonctionnalité est utile pour normaliser l’écriture des dates, des heures ou des unités, appliquer un style différent ou réécrire la transcription en une seule requête.
Pour en savoir plus, consultez la documentation sur l’édition de transcription et le guide d’édition de transcription en temps réel.
Langues prises en charge
Scribe v2 prend en charge plus de 90 langues, dont :
Afrikaans (afr), amharique (amh), arabe (ara), arménien (hye), assamais (asm), asturien (ast), აზéri (aze), biélorusse (bel), bengali (ben), bosnien (bos), bulgare (bul), birman (mya), cantonais (yue), catalan (cat), cebuano (ceb), chichewa (nya), croate (hrv), tchèque (ces), danois (dan), néerlandais (nld), anglais (eng), estonien (est), filipino (fil), finnois (fin), français (fra), peul (ful), galicien (glg), ganda (lug), géorgien (kat), allemand (deu), grec (ell), gujarati (guj), haoussa (hau), hébreu (heb), hindi (hin), hongrois (hun), islandais (isl), igbo (ibo), indonésien (ind), irlandais (gle), italien (ita), japonais (jpn), javanais (jav), créole capverdien (kea), kannada (kan), kazakh (kaz), khmer (khm), coréen (kor), kurde (kur), kirghize (kir), lao (lao), letton (lav), lingala (lin), lituanien (lit), luo (luo), luxembourgeois (ltz), macédonien (mkd), malais (msa), malayalam (mal), maltais (mlt), chinois mandarin (zho), maori (mri), marathi (mar), mongol (mon), népalais (nep), sotho du Nord (nso), norvégien (nor), occitan (oci), odia (ori), pachto (pus), persan (fas), polonais (pol), portugais (por), pendjabi (pan), roumain (ron), russe (rus), serbe (srp), shona (sna), sindhi (snd), cinghalais (sin), slovaque (slk), slovène (slv), somali (som), espagnol (spa), swahili (swa), suédois (swe), tamoul (tam), tadjik (tgk), télougou (tel), thaï (tha), turc (tur), ukrainien (ukr), umbundu (umb), ourdou (urd), ouzbek (uzb), vietnamien (vie), gallois (cym), wolof (wol), xhosa (xho) et zoulou (zul).
Détail de la prise en charge des langues
Le taux d’erreur sur les mots (WER) est une métrique essentielle pour évaluer la précision des systèmes de transcription. Il mesure le nombre d’erreurs présentes dans une transcription par rapport à une transcription de référence. Vous trouverez ci-dessous le détail du WER pour chaque langue prise en charge par Scribe v2.
Excellent (WER ≤ 5 %)
Biélorusse (bel), bosnien (bos), bulgare (bul), catalan (cat), croate (hrv), tchèque (ces), danois (dan), néerlandais (nld), anglais (eng), estonien (est), finnois (fin), français (fra), galicien (glg), allemand (deu), grec (ell), hongrois (hun), islandais (isl), indonésien (ind), italien (ita), japonais (jpn), kannada (kan), letton (lav), macédonien (mkd), malais (msa), malayalam (mal), norvégien (nor), polonais (pol), portugais (por), roumain (ron), russe (rus), slovaque (slk), espagnol (spa), suédois (swe), turc (tur), ukrainien (ukr) et vietnamien (vie).
Haute précision (WER > 5 % à ≤ 10 %)
Arménien (hye), ադրբեջanais (aze), bengali (ben), cantonais (yue), filipino (fil), géorgien (kat), gujarati (guj), hindi (hin), kazakh (kaz), lituanien (lit), maltais (mlt), mandarin (cmn), marathi (mar), népalais (nep), odia (ori), persan (fas), serbe (srp), slovène (slv), swahili (swa), tamoul (tam) et télougou (tel)
Bon (WER > 10 % à ≤ 20 %)
Afrikaans (afr), arabe (ara), assamais (asm), asturien (ast), birman (mya), haoussa (hau), hébreu (heb), javanais (jav), coréen (kor), kirghize (kir), luxembourgeois (ltz), maori (mri), occitan (oci), pendjabi (pan), tadjik (tgk), thaï (tha), ouzbek (uzb) et gallois (cym).
Modéré (WER > 25 % à ≤ 50 %)
Amharique (amh), ganda (lug), igbo (ibo), irlandais (gle), khmer (khm), kurde (kur), lao (lao), mongol (mon), sotho du Nord (nso), pachto (pus), shona (sna), sindhi (snd), cinghalais (sin), somali (som), ourdou (urd), wolof (wol), xhosa (xho), yoruba (yor) et zoulou (zul).
FAQ
Puis-je utiliser l’API Speech to Text avec des fichiers vidéo ?
Oui, l’API prend en charge l’importation de fichiers audio et vidéo pour la transcription.
Quelles sont les limites de taille et de durée des fichiers pour l’API Speech to Text ?
Les fichiers jusqu’à 3 Go sont pris en charge. Les limites de durée dépendent du mode de transcription :
- Mode standard (
use_multi_channel=false) : jusqu’à 10 heures - Mode multicanal (
use_multi_channel=true) : la durée cumulée de tous les canaux doit être inférieure à 10 heures
Quels formats audio et vidéo sont pris en charge par l’API ?
L’API prend en charge les formats audio et vidéo suivants :
- audio/aac
- audio/x-aac
- audio/x-aiff
- audio/ogg
- audio/mpeg
- audio/mp3
- audio/mpeg3
- audio/x-mpeg-3
- audio/opus
- audio/wav
- audio/x-wav
- audio/webm
- audio/flac
- audio/x-flac
- audio/mp4
- audio/aiff
- audio/x-m4a
Les formats vidéo pris en charge incluent :
- video/mp4
- video/x-msvideo
- video/x-matroska
- video/quicktime
- video/x-ms-wmv
- video/x-flv
- video/webm
- video/mpeg
- video/3gpp
Quand prendrez-vous en charge davantage de langues ?
ElevenLabs étend constamment le nombre de langues prises en charge par nos modèles. Consultez régulièrement cette page pour connaître les mises à jour.
L’API Speech to Text prend-elle en charge les webhooks ?
Oui, les résultats de transcription asynchrones peuvent être envoyés aux webhooks configurés dans les paramètres de webhook de l’interface. Pour en savoir plus, consultez le cookbook des webhooks.
Un mode de transcription multicanal est-il pris en charge par l’API ?
Oui, la fonctionnalité STT multicanal vous permet de transcrire un audio dont chaque canal est traité indépendamment et reçoit un identifiant de locuteur selon son numéro de canal. Cette fonctionnalité prend en charge jusqu’à 5 canaux. Pour en savoir plus, consultez le cookbook de transcription multicanal.
Comment fonctionne la facturation de l’API Speech to Text ?
ElevenLabs facture le Speech to Text en fonction de la durée de l’audio envoyé pour transcription. La facturation est calculée par heure d’audio, avec des tarifs qui varient selon le niveau et le modèle. Consultez la page de tarification de l’API pour obtenir des informations tarifaires détaillées.
Points clés
- Entrée prise en charge : les fichiers audio et vidéo sont acceptés
- Taille maximale de fichier : 3 Go
- Durée maximale : 10 heures (mode standard), 1 heure (mode multicanal)
- Mode multicanal : jusqu’à 5 canaux, chacun traité indépendamment avec un identifiant de locuteur attribué selon le numéro de canal
- Webhooks : les résultats de transcription asynchrones peuvent être envoyés à un webhook, à configurer dans les paramètres du Workspace
- Formats audio pris en charge : AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
- Formats vidéo pris en charge : MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP