Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Qu’est-ce que la reconnaissance automatique de la parole (ASR) ?

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

En 1952, le système de reconnaissance vocale le plus avancé au monde pouvait comprendre exactement 9 mots. 

Environ 75 ans plus tard, la reconnaissance automatique de la parole (ASR) transcrit des dizaines de langues en temps réel, des assistants vocaux de votre téléphone aux sous-titres qui s’affichent sur les vidéos en direct.

Ce guide explore la technologie qui a comblé l’écart entre les versions de 1952 et celles d’aujourd’hui : ce qu’est l’ASR, comment elle convertit la parole en texte et comment elle continue d’évoluer.

En résumé :

  • ASR signifie reconnaissance automatique de la parole, la technologie qui convertit l’audio parlé en texte écrit.
  • La première forme d’ASR est apparue en 1952, et les systèmes d’apprentissage profond ont atteint les références humaines à la fin des années 2010.
  • L’ASR moderne utilise des réseaux neuronaux de bout en bout entraînés sur des millions d’heures d’audio.
  • Le taux d’erreur par mot (WER) est la mesure standard de précision, mais la latence, la qualité de la diarisation et la compréhension contextuelle jouent aussi un rôle dans l’ASR de production.
  • ElevenAPI offre aux développeurs une ASR prête pour la production, évaluée indépendamment par Artificial Analysis avec un taux d’erreur par mot de 2,2 %, le plus bas de son index (juillet 2026).

Qu’est-ce que la reconnaissance automatique de la parole (ASR) ?

La reconnaissance automatique de la parole, souvent désignée par l’acronyme ASR, décrit un logiciel qui écoute la parole humaine et la transforme en texte précis, lisible par machine. Elle est aussi couramment appelée conversion de la parole en texte ou reconnaissance vocale, voire parfois reconnaissance vocale informatique.

L’ASR est devenue si omniprésente que vous l’utilisez peut-être chaque jour sans vous en rendre compte. Chaque fois que vous dictez un message, posez une question à un assistant vocal, lisez des sous-titres sur une vidéo en direct ou naviguez dans un système téléphonique de réponse vocale interactive, vous utilisez l’ASR.

Bien que la conversion de la parole en texte et l’ASR soient souvent employées comme synonymes, et soient étroitement liées, elles ne désignent pas exactement la même chose. L’ASR est la technologie qui identifie ce qui est dit, tandis que le STT en est l’application pratique. Les logiciels de reconnaissance vocale s’appuient sur l’ASR et identifient qui a prononcé un mot donné, ce qui constitue la base des fonctions de diarisation des locuteurs.

Ces distinctions sont mineures, mais importantes si vous souhaitez intégrer des systèmes d’ASR, de STT ou de reconnaissance vocale à vos applications ou à votre site web.

Brève histoire de la reconnaissance automatique de la parole

La technologie de reconnaissance automatique de la parole est bien plus ancienne que la plupart des gens ne l’imaginent : ses premières versions remontent aux années 1950. Depuis sa création il y a plus de 70 ans, l’ASR a franchi plusieurs étapes majeures qui ont largement fondé ses progrès historiques.

Voici les principales périodes traversées par la technologie ASR :

  • 1952 et la première ASR : En 1952, l’Automatic Digit Recognizer, connu sous le nom de AUDREY, a été conçu par Bell Laboratories pour comprendre les chiffres de un à neuf. L’outil n’était précis qu’à environ 90 % et ne fonctionnait que s’il était utilisé par son inventeur, ce qui limitait fortement son usage. Même si ses capacités étaient très éloignées de celles d’aujourd’hui, reconnaître les chiffres de 1 à 9 restait une prouesse impressionnante.
  • Des années 1960 aux années 1970 et l’élargissement du vocabulaire ASR : Au cours des décennies suivantes, des laboratoires du monde entier, notamment chez IBM, à l’University College London et chez NEC au Japon, ont produit des modèles semblables à AUDREY dans différents contextes. Raj Reddy, étudiant indien en troisième cycle à Stanford, a conçu un reconnaisseur de voyelles pour son doctorat, posant les bases de la reconnaissance continue de la parole, sans pause entre chaque mot. La DARPA (Defense Advanced Research Projects Agency) a financé des recherches durant cette période, qui ont mené à Beam Search, une méthode de construction et de décodage des phrases essentielle pour reconnaître plus de 1 000 mots au total dès 1976.
  • Des années 1980 au début des années 2010 et les avancées statistiques : En 1987, un ancien étudiant de Raj Reddy, alors professeur, a combiné les modèles de Markov cachés avec Beam Search, permettant de créer des systèmes ASR ne nécessitant pas d’entraînement sur un locuteur précis. Cette avancée a considérablement réduit le temps d’entraînement des systèmes de reconnaissance vocale. Dragon Systems a lancé en 1997 la première ASR commercialisée, appelée NaturallySpeaking Preferred. Elle pouvait reconnaître 100 mots par minute et s’est bien vendue. 
  • L’ère moderne et l’apprentissage profond : Dans les années 2010, des chercheurs ont démontré qu’un seul réseau neuronal entraîné de bout en bout sur des données audio et des transcriptions surpassait une chaîne de traitement purement statistique. Avec l’arrivée des réseaux neuronaux profonds, les systèmes ASR ont atteint des performances proches du niveau humain, avec un taux d’erreur de 5 % à 10 %. C’est à cette époque que des assistants vocaux comme Alexa et Siri sont arrivés sur le marché. 

Depuis, l’ASR n’a cessé de gagner en précision et en adoption. En juillet 2026, les recherches indépendantes d’Artificial Analysis ont identifié ElevenLabs Scribe v2 comme présentant un taux d’erreur par mot (WER) de seulement 2,2 %, parmi les plus faibles du secteur. 

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

Comment fonctionne l’ASR ? Les bases de la conversion de la parole en texte

L’ASR capture un échantillon audio, le convertit en représentation numérique, puis utilise un modèle entraîné pour prédire la suite de mots la plus probable représentée par ces données. L’ASR moderne réalise ce processus de bout en bout en temps réel, en moins d’une seconde.

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

Une chaîne ASR comporte cinq étapes principales :

  1. Capture et prétraitement audio : Le système enregistre le signal audio, élimine le bruit de fond, réduit l’écho et normalise le volume pour améliorer la cohérence. Selon le modèle, il peut utiliser la détection d’activité vocale (VAD) afin de distinguer la parole du silence ou des sons de fond avant le début de la transcription.
  2. Extraction des caractéristiques : L’audio est converti en représentation numérique, généralement un spectrogramme ou des caractéristiques de fréquence Mel, qui mettent précisément en évidence les fréquences et motifs de la parole humaine. Cette étape transforme essentiellement une onde brute en données qu’un modèle de machine learning peut traiter efficacement.
  3. Modélisation acoustique : Un réseau neuronal analyse les caractéristiques de l’étape précédente et prédit des phonèmes ou d’autres unités de parole, en apprenant la relation entre les motifs acoustiques et la langue parlée. Les modèles modernes de bout en bout réalisent souvent cette étape conjointement avec la compréhension du langage, plutôt que comme une phase entièrement distincte.
  4. Modélisation et décodage du langage : Le système évalue ensuite les suites de mots les plus probables selon des règles telles que la grammaire, le contexte et la probabilité mathématique. Les deux derniers éléments sont essentiels, car la transcription API (Alphabet phonétique international) de deux phrases peut être similaire alors que leur contexte est totalement différent. Par exemple, « Recognize Speech » et « Wreck a nice peach » peuvent se prononcer de la même façon tout en ayant des sens très différents. Le contexte aide le système à choisir la bonne option lorsque sa précision ne suffit pas à trancher. 
  5. Mise en forme de la sortie : Après avoir déterminé le contenu de la parole, le texte final est transcrit avec sa ponctuation et ses majuscules. Des métadonnées supplémentaires, telles que des horodatages au niveau des mots et des étiquettes de locuteurs, permettent de créer des transcriptions plus détaillées.

À travers ces étapes, le modèle transforme les données audio entrantes en transcription écrite.

Systèmes hybrides traditionnels ou ASR par apprentissage profond de bout en bout

Bien que la chaîne ci-dessus décrive le fonctionnement de l’ASR, deux approches technologiques sont possibles pour sa partie centrale. 

Les systèmes historiques enchaînent plusieurs composants : un modèle lexical qui encode la prononciation des mots, un modèle acoustique qui associe l’audio aux phonèmes et un modèle de langage qui prédit les suites de mots probables. Chacun exige une expertise humaine, des linguistes qui élaborent manuellement des dictionnaires de prononciation aux annotateurs qui alignent chaque mot sur sa position exacte dans l’audio.

L’apprentissage profond de bout en bout réunit tous ces composants dans un seul réseau neuronal. Le réseau associe directement l’audio au texte et comprend implicitement la prononciation, l’acoustique et les statistiques de probabilité linguistique à partir de millions d’heures d’audio et de transcriptions appariés.

Examinons les différences entre les approches traditionnelles et modernes de la technologie ASR. 

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

Comment mesurer la précision de l’ASR : références du taux d’erreur par mot (WER)

Pour tous les flux de conversion de la parole en texte et d’ASR, le taux d’erreur par mot (WER) est le principal indicateur de précision utilisé par les entreprises. Il compare une transcription automatique générée par ASR à une version vérifiée par un humain. Trois types d’erreurs sont pris en compte : les substitutions, les suppressions et les insertions.

La formule du WER divise le nombre total d’erreurs par le nombre de mots de la transcription de référence. Un WER de 5 % signifie que le système a transcrit 95 % du texte avec précision, les meilleurs modèles passant désormais bien sous les 5 %.

Bien que le WER soit une référence utile, d’autres facteurs doivent être pris en compte pour évaluer l’efficacité d’un outil ASR :

  • Précision de la mise en forme : Le système peut-il formater correctement des chaînes non standard ? Par exemple, un montant tel que 1 225 $ est-il affiché ainsi ou écrit en toutes lettres, « mille deux cent vingt-cinq dollars » ?
  • Latence : La précision est importante, mais un outil qui met plusieurs minutes à générer une simple transcription devient inutilisable. Même très précis, il doit aussi maintenir une faible latence pour rester utile.
  • Robustesse : Même des cas d’usage tels que des accents prononcés ou des environnements bruyants ne devraient pas réduire significativement la précision du modèle. 
  • Qualité de la diarisation : Les cas d’usage impliquant plusieurs locuteurs nécessitent d’attribuer correctement chaque mot à la bonne personne. L’identification et l’étiquetage exacts des différents locuteurs contribuent à l’ASR, en particulier dans les secteurs fortement multilocuteurs comme les tribunaux.

Pour en savoir plus, consultez notre guide complet du taux d’erreur par mot.

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

Principaux avantages de l’ASR pour les entreprises modernes

Le marché mondial de la reconnaissance de la parole et de la voix devrait dépasser 23,11 milliards de dollars d’ici 2030. Son taux de croissance annuel composé de 19,1 % reflète à quel point cette technologie s’est généralisée dans les appareils commerciaux. Chaque smartphone moderne intègre un clavier de dictée et un assistant vocal, la plupart des voitures neuves répondent aux commandes vocales, et des enceintes ou assistants intelligents équipent désormais les foyers du monde entier.

Interagir avec la technologie par la voix est désormais une voie d’accès standard pour les clients. Pour les entreprises, l’ASR couvre la transcription des appels clients comme l’assistance aux agents vocaux, en s’intégrant aux processus et en améliorant la productivité.

Voici quelques-uns des principaux avantages de l’ASR pour les entreprises modernes :

  • Saisie et documentation plus rapides : Il y a plus de 10 ans déjà, Stanford a publié une étude montrant que la reconnaissance vocale était presque trois fois plus rapide que la saisie au clavier, tout en maintenant un taux d’erreur inférieur. Pour la grande majorité des personnes, l’ASR accélère la documentation des flux de transcription et la prise de notes à la voix.
  • Réduction des coûts opérationnels : Dans de nombreux cas d’usage qui nécessitaient autrefois des heures de prise de notes manuelle, l’ASR réduit fortement le coût d’une transcription de haute qualité. Affaires judiciaires, centres de contact, cliniques et réunions professionnelles peuvent désormais s’appuyer sur des systèmes ASR précis pour créer des notes détaillées et des transcriptions complètes avec diarisation. 
  • Meilleure accessibilité : L’Organisation mondiale de la Santé prévoit que 2,5 milliards de personnes vivront avec une forme de perte auditive d’ici 2050. Les sous-titres en temps réel fournis par des outils ASR avancés peuvent rendre les réunions numériques et les médias accessibles aux utilisateurs.
  • Données vocales consultables : Lorsque vous transcrivez automatiquement la parole avec l’ASR, chaque interaction entre un client et une entreprise est entièrement enregistrée. Chaque appel commercial, ticket d’assistance, échange avec un prospect ou réunion devient un texte consultable et vérifiable. À l’ère de l’IA, pouvoir restituer du contexte dans un format lisible par machine aide à créer de vastes bases de connaissances. Que ce soit pour les fonctionnalités ou la conformité, l’information reste ainsi visible. 
  • Expériences client disponibles en continu : L’ASR fournit l’une des technologies fondamentales des agents vocaux, et permet des cas d’usage d’assistance automatisée qui traitent les appels clients 24 h/24, 7 j/7, 365 jours par an.

La reconnaissance automatique de la parole est très présente dans la technologie en raison de ses nombreux avantages et de l’étendue des cas d’usage qu’elle prend en charge. Que vous travailliez dans le domaine médical ou souhaitiez transcrire des appels clients pour analyser les sentiments, l’ASR est une technologie fondamentale que vous intégrerez à vos processus. 

Applications populaires de l’ASR dans tous les secteurs

La reconnaissance automatique de la parole est une technologie centrale dans d’innombrables flux de travail et produits. Elle est devenue si omniprésente que les utilisateurs ne pensent souvent même pas à la manière dont elle est intégrée aux technologies qu’ils utilisent.

Voici un aperçu de quelques cas d’usage populaires de l’ASR dans le monde.

Service client et centres de contact

Les centres de contact ont été parmi les premiers à adopter l’ASR pour transcrire les appels à des fins d’assurance qualité et de conformité. Aujourd’hui, l’ASR peut fonctionner en temps réel, proposer des suggestions aux agents au cours d’une conversation et transformer des milliers d’interactions clients en données analysables par les équipes. 

Médias et divertissement

Les diffuseurs et plateformes de streaming peuvent utiliser l’ASR pour générer des sous-titres de conversations humaines à une échelle qu’aucun transcripteur ne pourrait égaler. Elle permet la transcription en temps réel tout en rendant les bibliothèques vidéo et audio entièrement consultables.

Santé

Le personnel clinique consacre une part étonnante de sa journée à la documentation et à la mise à jour des dossiers. L’ASR permet de récupérer ce temps en donnant aux médecins une plateforme de STT médical sur laquelle ils peuvent dicter leurs notes en temps réel.

Réunions virtuelles

Les plateformes de réunion proposent souvent une forme de prise de notes numérique pour transcrire les conversations au fil de l’eau, afin que personne n’ait à choisir entre participer et prendre des notes. Des services comme Google Meet envoient même ces transcriptions après chaque réunion, avec les actions à effectuer mises en évidence, pour créer un index consultable des informations. 

Juridique et conformité

Dans le domaine juridique, consigner avec précision ce qui a été dit et par qui constitue une exigence centrale devant les tribunaux. Les cabinets d’avocats utilisent des plateformes ASR pour transcrire leurs réunions, audiences, appels clients et sessions judiciaires avec des horodatages précis à des fins de référence ultérieure. 

Éducation

Les enseignants universitaires peuvent fournir une transcription enregistrée de leurs cours afin d’aider les étudiants à conserver une trace des enseignements suivis. Pour comprendre et mémoriser les informations, les étudiants disposent ainsi d’une ressource complète sur laquelle s’appuyer.

La place de l’ASR dans une chaîne d’agents vocaux

L’ASR est un élément standard de nombreux déploiements technologiques. Dans la technologie des agents vocaux, elle constitue la première de trois grandes étapes qui s’exécutent en boucle continue.

  • Écouter (ASR) : L’agent capture les flux audio entrants et convertit la parole en texte en temps réel. L’ASR moderne traite continuellement l’audio à mesure qu’il arrive, filtre le bruit de fond, gère les interruptions, produit des transcriptions partielles et identifie le moment où chaque personne parle. 
  • Réfléchir (modèle de langage) : Un grand modèle de langage interprète la transcription, comprend l’intention de l’utilisateur, récupère des informations auprès d’outils et de bases de connaissances connectés, maintient le contexte conversationnel et détermine la réponse ou l’action la plus appropriée. 
  • Parler (conversion de texte en parole) : Un modèle de conversion de texte en parole convertit la réponse générée par le LLM en audio naturel et expressif. Les systèmes TTS modernes peuvent ensuite ajuster le rythme, l’intonation, l’émotion et l’accentuation lorsqu’ils diffusent l’audio généré au correspondant, sans attendre la réponse complète. 

La latence conversationnelle s’accumule à chacune de ces étapes. L’ASR en streaming commence à émettre des mots dès qu’ils sont prononcés, plutôt que d’attendre la fin d’un énoncé, afin de réduire la latence. ElevenAgents en fait un standard pour les agents vocaux en temps réel, afin d’offrir une expérience d’agent très efficace.

Défis de l’ASR et évolution de la technologie

Bien que la technologie ASR ait beaucoup progressé depuis ses débuts en 1952, plusieurs défis susceptibles de réduire sa précision subsistent.

Voici certains des problèmes que les outils ASR rencontrent encore aujourd’hui :

  • Accents et dialectes : Les données d’entraînement disponibles se concentrent généralement sur quelques langues et accents, ce qui complique le traitement des accents moins courants ou des langues parlées par moins de personnes. Des jeux de données d’entraînement riches et diversifiés sont la solution.
  • Bruit de fond et locuteurs qui se chevauchent : Les environnements aux volumes variables ou au bruit de fond élevé compliquent l’identification de chaque mot d’un enregistrement. Des locuteurs qui parlent simultanément peuvent avoir un effet similaire et réduire la précision d’une transcription ASR.
  • Vocabulaire propre à un domaine : Les domaines comportant un jargon ou des acronymes spécifiques nécessitent des dictionnaires et références adaptés pour améliorer la précision. La médecine et le droit sont deux domaines où les outils ASR ont besoin d’une assistance supplémentaire ou d’un entraînement spécialisé.
  • Confidentialité et sécurité : Dans de nombreuses juridictions, les données vocales sont considérées comme des données personnelles. Les entreprises ont besoin de politiques de conservation claires et de garde-fous pour protéger le traitement des données vocales et garantir la conformité aux réglementations applicables.

Un aspect plus général à considérer avec la technologie ASR est le compromis entre latence et précision. Certains cas d’usage exigent un équilibre entre les deux, tandis que des domaines comme la médecine privilégieront probablement la précision avant tout. 

Commencez l’intégration d’une ASR prête pour la production avec ElevenAPI

ElevenAPI apporte la reconnaissance automatique de la parole prête pour la production à votre produit grâce à Scribe v2, le modèle Speech to Text d’ElevenLabs. Scribe v2 fournit des horodatages au niveau des mots, la diarisation des locuteurs, l’étiquetage des événements audio, ainsi que la précision et la fiabilité nécessaires aux applications en temps réel.

Découvrez la page ElevenLabs Speech to Text pour en savoir plus ou créez un compte gratuit pour mettre une API en service en quelques minutes. 

FAQ sur l’ASR

Rédigé par

Jack Limebear fait partie de l’équipe Growth, où il rédige et conçoit des contenus pour le blog et les pages d’analyses. Avant de rejoindre ElevenLabs, il a passé plus de dix ans à piloter la stratégie de contenu pour des organisations allant de start-ups SaaS en forte croissance à des entreprises du Fortune 500. Il est titulaire d’un master en littérature anglaise de l’Université de Cambridge.

Articles similaires

Créez avec l'audio IA de la plus haute qualité