Aller au contenu

Taux d’erreur sur les mots (WER) : concepts clés, formule et usages

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

En théorie, le taux d’erreur par mot (WER) est une métrique permettant de déterminer la précision d’un outil de reconnaissance automatique de la parole (ASR). Un faible WER indique que votre transcription finale est plus précise, tandis qu’un taux d’erreur élevé révèle des informations mal transcrites. 

En pratique, le WER peut faire la différence entre un logiciel de transcription médicale qui indique qu’un patient a besoin de « quinze milligrammes » plutôt que de « cinquante milligrammes » d’un médicament. C’est aussi ce qui distingue un outil d’assistance qui transcrit précisément les besoins d’un client d’un autre qui laisse vos utilisateurs frustrés.

Dans cet article, nous expliquons ce qu’est le WER, comment le calculer et comment l’utiliser pour évaluer votre propre fournisseur ASR.

En résumé

  • Le taux d’erreur par mot comptabilise trois types d’erreurs — les substitutions, suppressions et insertions — puis les divise par le nombre de mots de la transcription de référence.
  • La formule du WER est : WER = (S + D + I) / N. 
  • Plus le WER est faible, plus le résultat final est précis.
  • Un WER inférieur à 5 % constitue une bonne référence, même si les transcriptions juridiques ou médicales peuvent exiger un taux encore plus faible.
  • Le WER accorde la même importance à toutes les erreurs ; ce n’est donc pas une métrique parfaite pour évaluer le contexte. Des métriques émergentes, telles que le taux d’erreur sémantique par mot (SWER), tentent d’y répondre en mesurant si le sens d’un énoncé a été préservé.

Qu’est-ce que le taux d’erreur par mot ?

Le taux d’erreur par mot (WER) est la métrique standard pour mesurer la précision de la reconnaissance vocale dans les modèles de Speech to Text. Exprimé entre 0 et 1 (0,8 représente un taux d’erreur de 80 %), il indique les erreurs commises par un système STT lors d’une transcription, selon ses substitutions, suppressions et insertions.

Une substitution se produit lorsqu’un mot est remplacé par un mot incorrect. Une suppression correspond à un mot entièrement omis. Enfin, une insertion survient lorsqu’un mot qui n’a jamais été prononcé est ajouté à la transcription. Le WER utilise ces trois composantes, puis les divise par le nombre de mots de la transcription correcte afin de produire un chiffre comparable à celui d’autres fournisseurs.

Voici la formule du WER :

WER = (S + D + I) / N

Où :

  • S : substitutions (mot incorrect)
  • D : suppressions (mot manquant)
  • I : insertions (mot supplémentaire présent)
  • N : nombre total de mots dans la transcription de référence

Le WER peut être exprimé sous forme décimale ou en pourcentage. Plus il est faible, meilleur est le résultat, car le modèle a commis moins d’erreurs lors de la transcription. 

En pratique, un WER de 10 % signifie qu’environ 1 mot sur 10 dans la transcription de votre réunion doit être vérifié. 

Pourquoi le taux d’erreur par mot est-il important dans les systèmes de reconnaissance vocale ?

Le taux d’erreur par mot fournit une métrique objective que les équipes peuvent utiliser pour comparer différents fournisseurs. Il va au-delà des arguments marketing et permet de voir clairement la précision d’un modèle de reconnaissance vocale. En s’appuyant sur des données, les entreprises qui évaluent leurs options identifient clairement les modèles qui mènent actuellement ce domaine.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Source : Artificial Analysis consulté le 10 juillet 2026.

En juillet 2026, une étude indépendante de Artificial Analysis classe Scribe v2 d’ElevenLabs au premier rang du secteur pour le WER sur le jeu de données AA-AgentTalk, parmi les modèles de transcription non temps réel, avec un WER de 1,5 %.

Au-delà de l’évaluation des fournisseurs, le WER a un impact concret sur les produits. Un logiciel de transcription médicale affichant un WER de 12 % peut introduire des erreurs critiques dans les dossiers patients. Des erreurs de transcription lors d’un appel au service client peuvent entraîner des problèmes en aval, comme une analyse des sentiments imprécise ou une mauvaise catégorisation.

Au-delà de ces enjeux propres à chaque cas d’usage, lorsque les systèmes ASR échouent, les personnes les plus touchées sont souvent celles pour qui la transcription est le seul moyen d’accéder à un contenu oral. Le World Wide Web Consortium propose une documentation complète sur les normes minimales attendues par les initiatives d’accessibilité.

Comment calculer le taux d’erreur par mot : formule et exemple

Calculer le taux d’erreur par mot est simple une fois les étapes connues. Comme indiqué plus haut, la formule est WER = (S + D + I) / N. Les termes sont détaillés ci-dessus : substitutions, suppressions, insertions, et N pour le nombre total de mots de la transcription.

Voici comment calculer le WER :

  1. Créez une transcription de référence : utilisez une transcription humaine et une vérification pour produire une transcription précise d’un extrait audio. 
  2. Utilisez votre outil STT : utilisez une plateforme ASR pour transcrire l’extrait audio et produire une transcription IA qui servira de test.
  3. Alignez les deux versions : utilisez la programmation dynamique, et plus précisément l’algorithme de Levenshtein, pour trouver le nombre minimal de modifications. Nous détaillerons cet algorithme dans une section ultérieure.
  4. Appliquez la formule : comptez le nombre total d’erreurs dans la version générée par l’IA par rapport à la version vérifiée par un humain, puis utilisez WER = (S + D + I) / N pour calculer le WER exact.

Cela peut sembler technique sur le papier, mais c’est bien plus simple en pratique. Voici un exemple pour illustrer le principe.

Transcription de référence : Mrs. Dalloway said she would buy the flowers herself.

Résultat ASR : Miss Dalloway said she would buy flowers herself.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

En calculant le nombre total d’erreurs, nous obtenons 1 S et 1 D sur 9 mots au total. 

Avec la formule, on obtient : WER = 2 / 9 = 0,222 = 22,2 %. 

Calculer le taux d’erreur par mot avec Python

Si la méthode manuelle est très efficace, vous pouvez gagner du temps en calculant le WER avec Python. La bibliothèque jiwer gère tout cela automatiquement.

À l’aide de la documentation de jiwer, vous pouvez installer ce package conçu spécifiquement pour évaluer un système ASR et produire des métriques clés telles que le WER. Une fois téléchargé, utilisez le code suivant pour calculer rapidement le WER avec Python :

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Dans cet exemple, le résultat ASR diffère de la référence originale à deux endroits. Le mot « jumps » a été transcrit à tort par « leaps » (une substitution), et « last » a été inséré avant « lazy » (une insertion). Avec deux erreurs sur les neuf mots de la transcription de référence, le taux d’erreur par mot (WER) est de 0,222, soit 22,2 %.

Comparer le taux d’erreur par mot à d’autres métriques de reconnaissance

Bien que le WER soit la métrique standard pour calculer la précision d’un système ASR, d’autres outils sont disponibles. Par exemple :

  • Taux d’erreur par caractère (CER) : à l’instar du WER, il mesure la précision de la transcription au niveau des caractères plutôt que des mots. Il convient aux langues sans frontières de mots claires (scriptio continua) ou aux tâches sensibles à l’orthographe.
  • Taux d’erreur de correspondance (MER) : mesure la proportion d’erreurs de transcription en traitant les substitutions, insertions et suppressions légèrement différemment du WER. Il se concentre sur la proportion de mots incorrects dans une phrase.
  • Perte d’information par mot (WIL) : estimation de la quantité d’informations originales perdue durant la transcription. Elle mesure l’intelligibilité plutôt que de compter directement les erreurs, comme le WER.
  • Taux d’erreur d’embedding (EmbER) : propose une analyse sémantique entre les transcriptions. Il va au-delà du WER en éclairant la distance sémantique entre le mot correct et sa transcription incorrecte.

Chacune de ces métriques convient à un scénario différent. Voici un tableau de référence :

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Exemples de distance de Levenshtein : les mathématiques derrière le WER

Le taux d’erreur par mot mesure en réalité la distance entre l’original et le résultat de l’hypothèse. Pour comprendre cette différence mathématiquement, on utilise la distance de Levenshtein.

La distance de Levenshtein compte le nombre minimal de modifications unitaires nécessaires pour transformer une séquence en une autre. Pour le WER, il s’agit précisément des substitutions, insertions et suppressions. Par exemple, pour transformer Cat en Mat, il faut remplacer la lettre « C » par « M », ce qui donne une distance de Levenshtein de 1.

Ce calcul est plus courant pour le CER, mais le WER applique la distance de Levenshtein au niveau des mots. Chaque unité est un mot entier plutôt qu’un caractère ; la distance réelle mesure le nombre de modifications de mots nécessaires pour transformer notre résultat ASR en original exact. 

On construit une matrice dans laquelle chaque cellule représente la distance totale entre la transcription originale et la transcription ASR. La distance de Levenshtein remplit ensuite la matrice du coin supérieur gauche vers le coin inférieur droit, la dernière cellule indiquant le nombre total de modifications au niveau des mots. Divisez ce nombre par N pour obtenir votre WER. 

Cette matrice est généralement calculée avec des caractères individuels, mais voici une version adaptée à l’échelle des mots de notre exemple précédent, pour plus de simplicité. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Erreurs fréquentes et idées reçues sur le taux d’erreur par mot

À mesure que les API STT deviennent plus accessibles et que les logiciels ASR s’intègrent couramment à des stacks d’agents plus vastes, les comparaisons entre outils vont se multiplier. 

Avant de calculer vos propres taux d’erreur par mot, il est utile de comprendre quelques problèmes fréquents et idées reçues.

  • Toutes les erreurs se valent : le WER attribue la même importance à chaque erreur. Cela peut convenir dans de nombreux contextes, mais certains cas d’usage ne le permettent pas. Dans un hôpital, par exemple, un taux d’erreur de 5 %, considéré comme un bon WER, peut rester inacceptable : une ou deux erreurs suffisent à mettre un patient en danger. Cette limite a conduit au développement de métriques plus récentes, comme le taux d’erreur sémantique par mot (SWER), qui cherche à déterminer si le sens d’une phrase a été préservé plutôt que si chaque mot correspond exactement. 
  • Le WER peut dépasser 100 % : bien que nous ayons indiqué que le WER se situe entre 0 et 1, il peut dépasser 100 %. Une insertion peut en effet créer davantage de mots que n’en compte la transcription originale. Un exemple courant consiste à transcrire « I’m » par « I am », faisant passer un mot à deux. 
  • Un WER plus faible n’est pas toujours préférable, techniquement : sur le papier, un WER de 5 % est meilleur qu’un WER de 10 %. Mais si les erreurs qui composent ces 5 % modifient fortement le contexte d’une phrase, tandis que celles des 10 % ne le font pas, le résultat ne reflète pas toute la réalité. Le contexte reste essentiel ; des métriques comme le SWER sont précisément développées pour capturer cet impact sémantique.

En 2024, Apple a publié une étude intéressante sur ce dernier point. Lorsque des humains ont évalué un calcul de WER de 9,4 % en déterminant si le résultat ASR était lisible, ils ont attribué au même passage un WER de seulement 2,2 %. Dans l’exemple testé, les humains considéraient souvent les « erreurs » comme négligeables, produisant un WER humain plus de quatre fois plus indulgent que celui des machines.

Références sectorielles pour le WER

Le WER idéal dépend fortement du secteur ou du cas d’usage dans lequel vous utilisez la technologie ASR. Si un taux inférieur à 5 % constitue une référence dans le secteur, des domaines spécifiques comme la transcription médicale ou juridique exigent un taux bien plus faible. 

Dans l’étude de juillet 2026 d’Artificial Analysis, Scribe v2 d’ElevenLabs a obtenu un WER de 1,5 %. Il est toutefois important de noter que ces statistiques sont généralement établies pour l’anglais comme langue principale. La technologie STT peut être moins efficace dans d’autres langues. 

La documentation d’ElevenLabs détaille les plages générales de WER pour toutes les langues prises en charge par Scribe v1 et Scribe v2.

Commencez avec ElevenAPI pour améliorer la précision de la reconnaissance

Lorsque vous développez une application ou un produit pour lequel la qualité de transcription est essentielle, l’écart entre une API ASR bien choisie et une solution médiocre se reflète d’abord dans votre WER, puis dans l’expérience de vos utilisateurs. 

Scribe d’ElevenLabs est la couche de Speech to Text accessible via ElevenAPI. Outre la prise en charge de plus de 90 langues et un WER parmi les plus bas du secteur, il propose notamment la diarisation des locuteurs, des horodatages au niveau des mots, le guidage par termes clés et la détection d’entités.

Consultez la documentation d’ElevenLabs pour en savoir plus sur ElevenAPI, ou commencez dès aujourd’hui en vous inscrivant

FAQ sur le taux d’erreur par mot

Articles similaires

Créez avec l'audio IA de la plus haute qualité