Comment fonctionne la transcription audio avec horodatage et marquage des événements ?
- Rédigé par
- Jack Limebear
- Publié
ÉcouterÉcouter cet article
Un modèle natif de transcription au niveau du mot reçoit en entrée un enregistrement audio ou un flux en temps réel et renvoie un tableau structuré d'objets token balisés et horodatés, représentant la parole et les sons non verbaux. Chaque token appartient à l'un des trois types suivants : word, spacing ou audio_event. Les événements audio peuvent être des rires, des applaudissements ou d'autres sons de fond.
Dans cet article, nous verrons comment fonctionne la transcription audio avec horodatage et pourquoi elle est plus flexible et plus performante que la transcription classique reposant sur l'alignement forcé.
Résumé
- La transcription au niveau du mot génère directement des tableaux structurés et horodatés de données vocales et d'événements audio non verbaux.
- Cela contraste avec les modèles classiques de reconnaissance automatique de la parole, qui génèrent des blocs de texte complets. Pour les horodater par rapport à l'audio brut, vous devez effectuer un second processus d'alignement forcé, plus long et plus coûteux en ressources de calcul.
- Les balises d'événements vous aident à capturer du contenu non verbal, comme les rires ou les applaudissements. Ces données étant consultables par recherche, vous pouvez les utiliser pour identifier les temps forts ou les moments susceptibles de devenir viraux selon les réactions du public.
- Vous pouvez transmettre les données structurées générées à des applications pour de nombreux cas d'usage, notamment le sous-titrage de haute précision, les archives audio consultables et la création automatisée d'extraits pour les réseaux sociaux.
- La transcription de Scribe au niveau du mot peut prendre en charge jusqu'à 5 canaux, chacun transcrit indépendamment.
Qu'est-ce que la transcription audio avec horodatage et balises d'événements ?
La transcription horodatée est une forme de reconnaissance automatique de la parole (ASR) qui repère, au fil de la transcription, les points précis de début et de fin des mots et d'autres événements audio, comme les applaudissements. Elle produit des données entièrement structurées et navigables.
La transcription ASR classique analyse l'audio en grands blocs de texte lisible par l'humain. Elle fournit des sous-titres et une transcription pour les lecteurs, mais elle est peu exploitable en tant que donnée.
Pour la structurer avec des horodatages, vous devez la transmettre à un service secondaire de machine learning afin d'associer le texte à l'audio. Vous pourriez ainsi produire un résultat similaire, mais cela nécessite plusieurs étapes de traitement au lieu d'être généré nativement par l'API, ce qui ajoute de la latence et une charge de calcul supplémentaire.
Rendre l'audio navigable
Le principal avantage de la transcription horodatée et balisée par événements est qu'elle est lisible à la fois par les humains et les machines. Elle offre d'importantes applications métier :
- Audit de conformité : vous pouvez rechercher des mots-clés dans une transcription et obtenir les horodatages exacts de toute mention de données sensibles.
- Production et montage vidéo : les logiciels de production vidéo peuvent synchroniser les sous-titres à la milliseconde près avec ce qui est dit à l'écran. Ils peuvent aussi étiqueter correctement les réactions du public.
- Archives consultables : les équipes de relations publiques, commerciales et de formation, entre autres, peuvent transcrire de grands volumes d'entretiens clients, de discours lors de salons, de webinaires ou de réunions publiques dans de vastes archives consultables.
- Analyse marketing et ressenti client : le marquage des événements peut étiqueter les réactions du public qui risqueraient de disparaître d'une transcription textuelle basique.
Quels sont les avantages des horodatages natifs au niveau du mot ?
Les modèles standard de Speech to Text traitent la parole par segments, généralement des phrases ou des paragraphes entiers. Pour obtenir un horodatage mot à mot, vous devez concevoir une couche de traitement supplémentaire afin d'effectuer un alignement forcé lors d'une seconde passe. Cela ajoute de l'infrastructure et de la latence, ainsi que davantage de points de défaillance potentiels. Par exemple, ces systèmes peuvent dériver ou échouer complètement lorsqu'ils traitent une parole rapide ou masquée par un bruit de fond élevé.
La transcription horodatée, comme celle effectuée par Scribe, évite ce problème en transcrivant à un niveau plus précis, mot par mot. Elle le fait en un seul appel API. Aucune infrastructure ni aucun script supplémentaire n'est nécessaire. Le modèle calcule les horodatages pendant la transcription, de sorte que les données vocales reflètent toujours fidèlement l'audio.

Comment fonctionne la transcription horodatée et balisée par événements ?
Prenons Scribe comme exemple.
Un modèle natif de transcription au niveau du mot associe les sons de parole d'un flux audio à un tableau structuré d'objets token. Il étiquette chaque token selon l'un des trois types suivants : word, spacing ou audio_event.
- word : un mot prononcé individuel reconnu, avec ses heures de début et de fin ainsi qu'une balise speaker_id.
- spacing : silence ou pauses au milieu de la parole explicitement balisés. Utile pour aider les services de sous-titrage à respecter le bon rythme. Non utilisé pour les langues identifiées qui n'emploient pas d'espaces entre les mots, comme le japonais, le mandarin, le thaï, le lao, le birman et le cantonais.
- audio_event : audio non verbal significatif, comme les rires ou les applaudissements. Le modèle sait les structurer comme un type d'événement distinct et ne force pas l'audio à devenir de la parole inventée.

Paramètres de streaming en temps réel
Les modèles de transcription au niveau du mot peuvent également inclure des fonctionnalités spécifiques pour prendre en charge la transcription audio en direct via WebSocket. Par exemple :
- include_timestamps=true : ce paramètre inclut les horodatages au niveau du mot dans les messages JSON committed_transcript_with_timestamps envoyés à la fin de chaque segment audio finalisé. Vous obtenez ainsi les horodatages pendant que le flux est toujours en cours. Les balises d'événements audio sont incluses uniquement si tag_audio_events est également activé.
- include_language_detection=true : ce paramètre indique à la connexion d'étiqueter les différentes langues parlées détectées, avec le score de confiance du modèle pour chaque détection. Il vous aide à produire des sous-titres multilingues en direct.
Comment un modèle Speech to Text étiquette-t-il les événements non vocaux ?
Scribe étiquette les événements audio lorsque le paramètre tag_audio_events est activé. Dans ce cas, il étiquette et horodate les heures de début et de fin précises, comme il le fait pour les mots. Il peut étiqueter diverses réactions, notamment les rires et les applaudissements, mais aussi d'autres sons ambiants pouvant être pertinents dans leur contexte, comme des pas ou de la musique de fond.
Concrètement, cela enrichit les transcriptions et le sous-titrage en ajoutant un contexte important. Il peut être plus difficile pour un lecteur de percevoir le sarcasme dans un texte simple et plat. Une balise [laughter] enrichit la transcription et lui donne davantage de résonance émotionnelle.
Des analyses plus pertinentes
Le marquage des événements rend également les analyses en aval plus fiables, car ces outils n'ont pas à traiter un unique bloc de texte non structuré. La transcription native au niveau du mot sépare les événements audio en données structurées : vos outils peuvent donc simplement les filtrer lorsque nécessaire et analyser uniquement le contenu verbal.
Les tokens spacing rendant les pauses visibles, vous pouvez les analyser. Cela peut être utile pour l'analyse des sentiments et les cas d'usage d'assurance qualité, par exemple pour mesurer combien de temps un agent du service client est resté silencieux lors d'un appel.
Recherche facilitée par horodatage
Vous pouvez aussi les rechercher spécifiquement. Si vous analysez le ressenti dans un entretien de test produit, vous pouvez extraire les réactions émotionnelles pertinentes. Si vous gérez un compte sur les réseaux sociaux, vous pouvez rechercher rapidement les rires dans un discours d'une heure afin de trouver les extraits les plus susceptibles de devenir viraux.
Quelles sont les applications pratiques des transcriptions structurées et horodatées ?
L'obtention native de données structurées dans les transcriptions répond à plusieurs cas d'usage importants.
Génération de légendes et de sous-titres
Vous pouvez exporter des transcriptions horodatées directement vers des formats de sous-titrage de production, notamment SRT et VTT, sans traitement intermédiaire. Votre outil de montage vidéo peut utiliser le minutage des mots pour les mettre en évidence dans les sous-titres au moment où ils sont prononcés.
Le modèle de transcription peut facilement analyser la parole rapide, car il la traite mot par mot. Là où un modèle classique peut avoir des difficultés avec une parole très rapide ou des voix qui se chevauchent, un modèle au niveau du mot comme Scribe peut générer une transcription claire et structurée.
Recherche audio et vidéo
La transcription classique permet de faire correspondre des mots-clés dans un bloc de texte, mais sans alignement forcé, vous ne pouvez pas accéder au moment où une phrase a été prononcée. Une recherche par mot-clé dans une transcription au niveau du mot est entièrement indexée et vous mène précisément à la seconde où une phrase a été prononcée dans l'audio. Votre archive audio devient ainsi un catalogue de référence entièrement consultable. Cette capacité est particulièrement utile pour gérer de vastes bibliothèques multimédias, des réseaux de podcasts et des archives d'entreprise.
Audit de conformité et des risques
Vous souhaiterez souvent enregistrer de l'audio contenant des informations sensibles, par exemple des appels au service client à des fins d'assurance qualité. Ce sont les appels les plus susceptibles de contenir des informations personnelles sensibles ou réglementées.
Pour rester conforme tout en conservant des données audio à des fins d'analyse, vous avez besoin d'un moyen de masquer les données sensibles dans les transcriptions en temps réel. L'horodatage natif au niveau du mot vous permet de tirer parti de fonctionnalités telles que Entity Detection d'ElevenLabs, qui signale les entités sensibles, comme les numéros de carte bancaire ou les noms, et renvoie leurs décalages et horodatages afin que vous puissiez les masquer dans vos transcriptions à mesure qu'elles arrivent.
Par exemple, vous pouvez détecter et masquer un numéro de carte bancaire, le nom de jeune fille de la mère, la date de naissance et le nom du client au moment où ils sont énoncés lors d'un appel de vérification d'identité.
Création automatisée d'extraits pour les réseaux sociaux
Vous pouvez également automatiser par programmation les recherches par mots-clés afin de trouver les temps forts parmi des contenus plus longs. Vous pourriez par exemple mettre en avant les moments importants d'un discours de campagne ou d'un séminaire d'entreprise. Cela vous aide à transformer des contenus récents en extraits montés de façon professionnelle pour YouTube, LinkedIn ou TikTok.
Minutage multicanal et multi-intervenants
Scribe peut transcrire jusqu'à cinq canaux indépendamment et en parallèle. Chacun reçoit un ID de locuteur et des horodatages. Cette approche est plus fiable que la diarisation des locuteurs acoustique classique, qui rencontre souvent des difficultés avec les dialogues alternés. Pour les enregistrements multicanaux, l'attribution des locuteurs par Scribe est entièrement déterministe. Autrement dit, le canal 0 correspond à speaker_0, le canal 1 à speaker_1, et ainsi de suite.
Il peut reconnaître les locuteurs qui tentent de parler simultanément et générer malgré tout des horodatages indépendants pour leur parole. Ils peuvent également parler dans différentes langues.

Exportez les données horodatées dans le format dont vous avez besoin
Si vous souhaitez distribuer des transcriptions classiques dans plusieurs formats, vous devrez probablement écrire vous-même les scripts d'analyse. Scribe peut exporter les transcriptions dans plusieurs formats selon l'usage prévu. Vous trouverez les définitions complètes des schémas dans le Guide de l'API ElevenLabs Create Transcript.
Données structurées pour les développeurs : JSON
Scribe prend en charge l'exportation au format JSON pour les développeurs qui souhaitent disposer de données dans un schéma transmissible aux applications en aval. Par exemple, les développeurs peuvent utiliser ces données JSON pour créer des médias interactifs ou une base de données de recherche sémantique pour votre organisation. Le tableau complet des tokens word, spacing et audio_event est généré avec les décalages de début et de fin, ainsi que les ID de locuteur.
Sous-titrage multimédia : SRT et VTT
Scribe peut générer des transcriptions SRT et VTT que vous pouvez transmettre directement à Adobe Premiere ou à d'autres applications de production, sans synchronisation manuelle.
Lisible par l'humain : TXT, DOCX et PDF
Il peut également générer des transcriptions dans des formats faciles à lire. Dans ces formats, Scribe supprime les marqueurs de minutage de bas niveau pour rendre le texte plus lisible et adapté à la documentation juridique ou d'audit. Cela est par exemple utile lorsque vous devez diffuser efficacement les procès-verbaux d'une réunion du conseil immédiatement après une séance, publier des transcriptions de podcasts pour le SEO ou archiver des documents juridiques.

Commencez à utiliser les transcriptions ElevenLabs horodatées et balisées par événements
La transcription native au niveau du mot vous fournit rapidement et efficacement les données structurées nécessaires à vos workflows.
Commencez dès aujourd'hui à transcrire votre audio avec Scribe dans ElevenAPI ou découvrez-en plus sur la transcription au niveau du mot.


