Vai al contenuto

Word Error Rate (WER): concetti chiave, formula e utilizzi

Scritto da
Jack Limebear
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

In teoria, il word error rate (WER) è una metrica per determinare l'accuratezza di uno strumento di Riconoscimento Vocale Automatico (ASR). Un WER basso indica che la trascrizione finale è più accurata, mentre un tasso di errore più alto segnala informazioni trascritte in modo errato. 

In pratica, il WER può fare la differenza tra un software di trascrizione medica che scrive che un paziente necessita di ‘quindici milligrammi’ anziché ‘cinquanta milligrammi’ di un farmaco. È la differenza tra uno strumento di assistenza che trascrive accuratamente le esigenze di un cliente e uno che lascia l'utente frustrato.

In questo articolo spiegheremo cos'è il WER, come calcolarlo e come usarlo per confrontare il tuo fornitore ASR.

In sintesi

  • Il word error rate conta tre tipi di errori — sostituzioni, eliminazioni e inserimenti — e li divide per il numero di parole nella trascrizione di riferimento.
  • La formula del WER è WER = (S + D + I) / N. 
  • Punteggi WER più bassi indicano un output finale più accurato.
  • Un WER inferiore al 5% è un buon parametro di riferimento, anche se le trascrizioni legali o mediche possono richiedere un Word Error Rate ancora più basso.
  • Il WER considera tutti gli errori uguali, quindi non è una metrica perfetta per la lettura contestuale. Metriche emergenti, come il Semantic Word Error Rate (SWER), cercano di risolvere questo problema misurando se il significato di un enunciato è stato preservato.

Cos'è il word error rate?

Il word error rate (WER) è la metrica standard per misurare l'accuratezza del riconoscimento vocale nei modelli Speech to Text. Rappresenta, su una scala da 0 a 1 (0,8 rappresenterebbe un tasso di errore dell'80%), ciò che un sistema STT sbaglia durante la trascrizione, in base a sostituzioni, eliminazioni e inserimenti.

Una sostituzione avviene quando una parola viene sostituita da quella sbagliata. Un'eliminazione si verifica quando una parola viene omessa del tutto. Infine, un inserimento si verifica quando alla trascrizione viene aggiunta una parola che non è mai stata pronunciata. Il WER usa tutti e tre questi componenti e li divide per il numero di parole nella trascrizione corretta, ottenendo un valore che puoi confrontare con altri fornitori.

Ecco la formula del WER:

WER = (S + D + I) / N

Dove:

  • S: Sostituzioni (la parola è sbagliata)
  • D: Eliminazioni (manca una parola)
  • I: Inserimenti (è presente una parola aggiuntiva)
  • N: Numero totale di parole nella trascrizione di riferimento

Puoi esprimere il WER come numero decimale o percentuale. Più basso è il WER, migliore è il punteggio, perché il modello ha commesso meno errori durante la trascrizione. 

In pratica, un WER del 10% significa che circa 1 parola su 10 nella trascrizione di una riunione richiede una seconda verifica. 

Perché il word error rate è importante nei sistemi di riconoscimento vocale?

Il word error rate offre una metrica oggettiva che i team possono usare per confrontare diversi fornitori. Va oltre le dichiarazioni di marketing e mostra chiaramente quanto è accurato un modello di riconoscimento vocale. Basandosi sulle evidenze, qualsiasi azienda che sta valutando le proprie opzioni può capire con chiarezza quali modelli sono attualmente leader in questo settore.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Fonte: Artificial Analysis consultato il 10 luglio 2026.

A luglio 2026, una ricerca indipendente di Artificial Analysis classifica Scribe v2 di ElevenLabs come il modello con il WER più basso del settore nel dataset AA-AgentTalk per i modelli di trascrizione non in streaming, con un WER dell'1,5%.

Oltre alla valutazione dei fornitori, il WER ha un impatto concreto a livello di prodotto. Un software di trascrizione medica con un WER del 12% potrebbe introdurre errori critici nelle cartelle cliniche. Trascrizioni errate in una chiamata di assistenza clienti potrebbero causare problemi a valle, come un'analisi del sentiment imprecisa o una categorizzazione inadeguata.

Al di là di questi problemi specifici per caso d'uso, quando i sistemi ASR falliscono, le persone più colpite sono spesso quelle per cui la trascrizione è l'unico modo per accedere ai contenuti parlati. Il World Wide Web Consortium offre ampia documentazione sugli standard minimi richiesti dalle iniziative di accessibilità.

Come calcolare il word error rate: formula ed esempio

Calcolare il word error rate è semplice una volta che conosci i passaggi. Come visto sopra, la formula da usare è WER = (S + D + I) / N. Tutti i termini sono descritti sopra; in breve, sono sostituzioni, eliminazioni, inserimenti e N, ovvero il numero totale di parole nella trascrizione.

Ecco come calcolare il WER:

  1. Crea una trascrizione di riferimento: usa la trascrizione e la verifica umane per produrre una trascrizione accurata di una clip audio. 
  2. Usa il tuo strumento STT: usa una piattaforma ASR per trascrivere la clip audio e generare una trascrizione IA da usare come test.
  3. Allinea le due versioni: usa la programmazione dinamica, in particolare l'algoritmo di Levenshtein, per trovare il numero minimo di modifiche. Approfondiremo questo algoritmo in una sezione successiva.
  4. Applica la formula: conta il numero totale di errori nella versione generata dall'IA rispetto alla copia verificata da una persona, quindi usa WER = (S + D + I) / N per calcolare il WER esatto.

Sulla carta può sembrare piuttosto tecnico, ma in pratica è molto più semplice. Ecco un esempio per mostrarti cosa intendiamo.

Trascrizione di riferimento: La signora Dalloway disse che avrebbe comprato lei stessa i fiori.

Output ASR: La signorina Dalloway disse che avrebbe comprato i fiori.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

Se calcoliamo gli errori totali, abbiamo 1 S e 1 D su 9 parole totali. 

Usando la formula, otteniamo: WER = 2 / 9 = 0.222 = 22,2%. 

Calcolare il word error rate con Python

Sebbene il metodo manuale funzioni molto bene, puoi risparmiare tempo calcolando il WER con Python. La libreria jiwer gestisce tutto questo in modo completamente automatico.

Seguendo la documentazione di jiwer, puoi installare il pacchetto, creato appositamente per valutare un sistema ASR e generare metriche principali come il WER. Dopo averlo scaricato, puoi usare il codice seguente per calcolare rapidamente il WER con Python:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Nota che, in questo esempio, l'output ASR differisce dal riferimento originale in due punti. La parola ‘jumps’ è stata trascritta erroneamente come ‘leaps’ (una sostituzione) e ‘last’ è stata inserita prima di ‘lazy’ (un inserimento). Con due errori nelle nove parole della trascrizione di riferimento, il Word Error Rate (WER) risulta pari a 0.222, ovvero 22,2%.

Confrontare il word error rate con altre metriche di riconoscimento

Sebbene il WER sia la metrica standard per calcolare l'accuratezza di un ASR, puoi usare anche altri strumenti. Ad esempio:

  • Character Error Rate (CER): analogamente al WER, misura l'accuratezza della trascrizione a livello di carattere anziché di parola. È ideale per le lingue che non hanno confini chiari tra le parole (scriptio continua) o per attività sensibili all'ortografia.
  • Match Error Rate (MER): misura la proporzione degli errori di trascrizione, trattando sostituzioni, inserimenti ed eliminazioni in modo leggermente diverso dal WER. Si concentra sulla proporzione di errori presenti in una frase.
  • Word Information Lost (WIL): una stima di quante informazioni originali sono andate perse durante la trascrizione, che fornisce una misura dell'intelligibilità anziché il conteggio diretto degli errori del WER.
  • Embedding Error Rate (EmbER): offre un'analisi semantica tra le trascrizioni. Va oltre il WER per fornire informazioni sulla distanza semantica tra la parola corretta e la trascrizione errata.

Ognuna di queste metriche è più adatta a uno scenario diverso. Ecco una tabella di riferimento:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Esempi di distanza di Levenshtein: la matematica alla base del WER

Il word error rate è in realtà una misura della distanza tra l'originale e l'output dell'ipotesi. Per comprendere matematicamente questa differenza, usiamo la distanza di Levenshtein.

La distanza di Levenshtein conta il numero minimo di modifiche a singola unità necessarie per trasformare una sequenza in un'altra. Per il WER, si tratta nello specifico di sostituzioni, inserimenti ed eliminazioni. Ad esempio, per trasformare Cat in Mat, dovresti sostituire una lettera, da ‘C’ a ‘M’, ottenendo una distanza di Levenshtein pari a 1.

Questo concetto è più comune nei calcoli del CER, ma il WER applica la distanza di Levenshtein al livello delle parole. Ogni unità è una parola intera anziché un carattere e la distanza effettiva misura quante modifiche alle parole servirebbero per trasformare il nostro output ASR nell'originale accurato. 

Costruiamo una matrice in cui ogni cella rappresenta la distanza totale tra la trascrizione originale e quella ASR. La distanza di Levenshtein riempie quindi la matrice dall'alto a sinistra fino in basso a destra, con la cella finale che indica il numero totale di modifiche a livello di parola. Dividere quel numero per N dà il WER. 

Sebbene questa matrice venga solitamente calcolata con singoli caratteri, ecco una versione semplificata e adattata del nostro esempio precedente. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Errori e fraintendimenti comuni sul word error rate

Soprattutto ora che le API STT diventano più accessibili e il software ASR entra comunemente in stack di agenti più ampi, vedremo molti confronti tra strumenti diversi. 

Prima di calcolare i tuoi word error rate, è utile comprendere alcuni problemi e fraintendimenti comuni.

  • Tutti gli errori sono uguali: il WER considera ogni errore ugualmente significativo. Sebbene in molti contesti questo possa andare bene, alcuni casi d'uso lo rendono inaccettabile. Ad esempio, in un ospedale un tasso di errore del 5%, considerato un buon WER, può comunque essere incomprensibile, poiché anche uno o due errori potrebbero mettere a rischio un paziente. Questa limitazione ha portato allo sviluppo di metriche più recenti, come il Semantic Word Error Rate (SWER), che cerca di misurare se il significato di una frase è stato preservato anziché verificare se ogni parola corrisponde esattamente. 
  • Il WER può superare il 100%: sebbene abbiamo detto che il WER varia da 0 a 1, può comunque superare il 100%. Questo accade perché l'errore di inserimento può creare più parole di quelle totali nella trascrizione originale. Un esempio comune è trascrivere ‘I’m’ come ‘I am’, dove una parola diventa due. 
  • Tecnicamente, un WER più basso non è sempre migliore: sulla carta, un WER del 5% è migliore di uno del 10%. Tuttavia, se gli errori che hanno contribuito a quel 5% hanno modificato in modo significativo il contesto di una frase, mentre quelli del 10% no, il quadro complessivo non viene rappresentato. Il contesto resta molto importante e metriche come lo SWER vengono sviluppate proprio per cogliere questo impatto semantico.

Nel 2024, Apple ha pubblicato un interessante studio che ha esplorato l'ultimo punto citato. Quando delle persone hanno valutato un calcolo WER del 9,4% considerando la leggibilità dell'ASR, hanno attribuito allo stesso brano un WER di appena il 2,2%. Nell'esempio testato, le persone hanno considerato gli ‘errori’ irrilevanti in molti casi, ottenendo un Human WER oltre 4 volte più indulgente rispetto alle macchine.

Parametri di riferimento del WER per settore

Il WER ideale dipende fortemente dal settore o dal caso d'uso in cui utilizzi la tecnologia ASR. Sebbene un valore inferiore al 5% sia un parametro di riferimento del settore, ambiti specifici come la trascrizione medica o legale richiedono un tasso molto più basso. 

Nello studio di Artificial Analysis del luglio 2026, Scribe v2 di ElevenLabs ha ottenuto un WER dell'1,5%. Tuttavia, è importante ricordare che queste statistiche vengono in genere rilevate principalmente in inglese. La tecnologia STT potrebbe non essere altrettanto efficace in altre lingue. 

La documentazione di ElevenLabs illustra le fasce WER generali per tutte le lingue supportate da Scribe v1 e Scribe v2.

Inizia con ElevenAPI per migliorare l'accuratezza del riconoscimento

Quando crei un'applicazione o un prodotto in cui la qualità della trascrizione conta, la differenza tra un'API ASR scelta con cura e una mediocre si riflette prima nel tuo WER e poi nell'esperienza dei tuoi utenti. 

Scribe di ElevenLabs è il livello di Speech to Text accessibile tramite ElevenAPI. Oltre a più di 90 lingue e a un WER leader nel settore, offre funzionalità come la diarizzazione dei parlanti, timestamp a livello di parola, keyterm prompting e rilevamento delle entità.

Esplora la documentazione di ElevenLabs per saperne di più su ElevenAPI oppure inizia registrandoti oggi. 

FAQ sul word error rate

Articoli simili

Crea con l'audio IA della massima qualità