Word Error Rate (WER): concetti chiave, formula e utilizzi
- Scritto da
- Jack Limebear
- Pubblicato
AscoltaAscolta questo articolo
In teoria, il word error rate (WER) è una metrica per determinare l’accuratezza di uno strumento di riconoscimento vocale automatico (ASR). Un WER basso indica che la trascrizione finale è più precisa, mentre un tasso di errore più alto segnala informazioni trascritte in modo errato.
Nella pratica, il WER può fare la differenza tra un software di trascrizione medica che scrive che un paziente ha bisogno di 'quindici milligrammi' invece di 'cinquanta milligrammi' di una prescrizione. È la differenza tra uno strumento di supporto che trascrive correttamente le esigenze di un cliente e uno che lascia l’utente frustrato.
In questo articolo vediamo cos’è il WER, come si calcola e come puoi usarlo per confrontare il tuo fornitore ASR.
Riepilogo
- Il word error rate conta tre tipi di errori: sostituzioni, cancellazioni e inserimenti, divisi per il numero di parole nella trascrizione di riferimento.
- La formula del WER è WER = (S + D + I) / N.
- Un WER più basso significa che il risultato finale è più preciso.
- Un WER inferiore al 5% è un buon riferimento, anche se trascrizioni legali o mediche possono richiedere un tasso ancora più basso.
- Il WER considera tutti gli errori uguali, quindi non è una metrica perfetta per la lettura contestuale. Nuove metriche, come il Semantic Word Error Rate (SWER), cercano di rispondere a questo limite valutando se il significato di un enunciato è stato mantenuto.
Cos’è il word error rate?
Il word error rate (WER) è la metrica standard per misurare l’accuratezza del riconoscimento vocale nei modelli Speech to Text. Rappresenta un valore tra 0 e 1 (0,8 corrisponde a un tasso di errore dell’80%) che indica cosa un sistema STT sbaglia nella trascrizione, considerando sostituzioni, cancellazioni e inserimenti.
Una sostituzione avviene quando una parola viene sostituita con quella sbagliata. Una cancellazione è quando una parola viene completamente saltata. Infine, un inserimento è quando nella trascrizione compare una parola che non è mai stata pronunciata. Il WER usa tutti e tre questi elementi e poi divide per il numero di parole nella trascrizione corretta, restituendo un valore che puoi confrontare tra diversi fornitori.
Ecco la formula del WER scritta per esteso:
WER = (S + D + I) / N
Dove:
- S: Sostituzioni (la parola è sbagliata)
- D: Cancellazioni (la parola manca)
- I: Inserimenti (è presente una parola in più)
- N: Numero totale di parole nella trascrizione di riferimento
Puoi esprimere il WER sia come decimale che come percentuale. Più il WER è basso, migliore è il risultato perché il modello ha commesso meno errori nella trascrizione.
In pratica, un WER del 10% significa che circa 1 parola su 10 nella trascrizione di una riunione va ricontrollata.
Perché il word error rate è importante nei sistemi di riconoscimento vocale?
Il word error rate offre una metrica oggettiva che i team possono usare per confrontare diversi fornitori. Va oltre le promesse di marketing e mostra chiaramente quanto è preciso un modello di riconoscimento vocale. Basandosi sui dati, qualsiasi azienda che valuta le opzioni ha una visione chiara di quali modelli sono i migliori in questo settore.

Fonte: Artificial Analysis consultato il 10 luglio 2026.
A luglio 2026, una ricerca indipendente di Artificial Analysis classifica Scribe v2 di ElevenLabs come il modello con il WER più basso del settore sul dataset AA-AgentTalk per modelli di trascrizione non in streaming, con un WER dell’1,5%.
Oltre alla valutazione dei fornitori, il WER ha un impatto reale anche a livello di prodotto. Un software di trascrizione medica con un WER del 12% potrebbe introdurre errori critici nelle cartelle dei pazienti. Errori di trascrizione in una chiamata di assistenza clienti possono portare a problemi successivi, come analisi del sentiment imprecise o categorizzazioni sbagliate.
Oltre a questi problemi specifici, quando i sistemi ASR falliscono, le persone più colpite sono spesso quelle per cui la trascrizione è l’unico modo per accedere ai contenuti audio. Il World Wide Web Consortium offre una documentazione approfondita sugli standard minimi richiesti dalle iniziative di accessibilità per maggiori dettagli.
Come si calcola il word error rate: formula ed esempio
Calcolare il word error rate è semplice una volta che conosci i passaggi. Come visto sopra, la formula da usare è WER = (S + D + I) / N. Tutti i termini sono già stati descritti, ma per comodità sono sostituzioni, cancellazioni, inserimenti e N per il totale delle parole nella trascrizione.
Ecco come si calcola il WER:
- Crea una trascrizione di riferimento: Usa una trascrizione e verifica umana per ottenere una trascrizione accurata di una clip audio.
- Usa il tuo strumento STT: Usa una piattaforma ASR per trascrivere la clip audio, ottenendo una trascrizione IA che userai come test.
- Allinea le due versioni: Usa la programmazione dinamica (in particolare l’algoritmo di Levenshtein) per trovare il numero minimo di modifiche. Approfondiremo questo algoritmo più avanti.
- Applica la formula: Conta il numero totale di errori nella versione generata dall’IA rispetto a quella verificata dall’uomo e poi usa WER = (S + D + I) / N per calcolare il WER esatto.
Sulla carta può sembrare tecnico, ma in realtà è molto più semplice nella pratica. Ecco un esempio pratico per mostrarti come funziona.
Trascrizione di riferimento: Mrs. Dalloway said she would buy the flowers herself.
Output ASR: Miss Dalloway said she would buy flowers herself.
Se calcoliamo gli errori totali, abbiamo 1 S e 1 D su 9 parole totali.
Usando la formula otteniamo: WER = 2 / 9 = 0,222 = 22,2%.
Calcolare il word error rate con Python
Anche se il metodo manuale funziona bene, puoi risparmiare tempo calcolando il WER con python. La libreria jiwer gestisce tutto questo in modo completamente automatico.
Seguendo la documentazione di jiwer, puoi installare il pacchetto, pensato appositamente per valutare un sistema ASR e produrre metriche come il WER. Una volta installato, puoi usare il seguente codice per calcolare rapidamente il WER con python:
In questo esempio, l’output ASR differisce dalla trascrizione di riferimento in due punti. La parola ‘jumps’ è stata trascritta erroneamente come ‘leaps’ (una sostituzione) e ‘last’ è stata inserita prima di ‘lazy’ (un inserimento). Con due errori su nove parole nella trascrizione di riferimento, il Word Error Rate (WER) è 0,222 ovvero 22,2%.
Confronto tra word error rate e altre metriche di riconoscimento
Anche se il WER è la metrica standard per calcolare l’accuratezza di un ASR, ci sono altri strumenti che puoi usare. Ad esempio:
- Character Error Rate (CER): Simile al WER, misura l’accuratezza della trascrizione a livello di carattere invece che di parola. È ideale per lingue senza spazi tra le parole (scriptio continua) o per compiti sensibili all’ortografia.
- Match Error Rate (MER): Misura la percentuale di errori nella trascrizione trattando sostituzioni, inserimenti e cancellazioni in modo leggermente diverso dal WER. Si concentra sulla proporzione di errori in una frase.
- Word Information Lost (WIL): Una stima di quante informazioni originali sono andate perse durante la trascrizione, offrendo una misura dell’intelligibilità invece del semplice conteggio degli errori del WER.
- Embedding Error Rate (EmbER): Offre un’analisi semantica tra le trascrizioni. Va oltre il WER per dare un’idea della distanza semantica tra la parola corretta e la trascrizione errata.
Ognuna di queste metriche è più adatta a scenari diversi. Ecco una tabella di riferimento:
Esempi di distanza di Levenshtein: la matematica dietro il WER
Il word error rate misura in realtà la distanza tra l’originale e l’output ipotetico. Per capire questa differenza dal punto di vista matematico, si usa la distanza di Levenshtein.
La distanza di Levenshtein conta il numero minimo di modifiche di singole unità necessarie per trasformare una sequenza in un’altra. Nel caso del WER, si tratta nello specifico di sostituzioni, inserimenti e cancellazioni. Ad esempio, per trasformare Cat in Mat, basta cambiare la lettera ‘C’ in ‘M’, ottenendo una distanza di Levenshtein pari a 1.
Anche se questa distanza si usa spesso nei calcoli CER, il WER applica la distanza di Levenshtein a livello di parola. Ogni unità è una parola intera invece che un carattere, e la distanza reale misura quante modifiche alle parole servono per trasformare l’output ASR nell’originale corretto.
Si costruisce una matrice in cui ogni cella rappresenta la distanza totale tra la trascrizione originale e quella ASR. La distanza di Levenshtein riempie la matrice dall’alto a sinistra fino in basso a destra, e l’ultima cella ti dà il numero totale di modifiche a livello di parola. Dividendo questo numero per N ottieni il tuo WER.
Anche se di solito questa matrice si calcola sui singoli caratteri, qui trovi una versione semplificata dell’esempio precedente.

Errori comuni e idee sbagliate sul word error rate
Soprattutto ora che le API STT sono sempre più accessibili e il software ASR è parte integrante di molti stack di agenti, vedremo sempre più confronti tra strumenti diversi.
Prima di calcolare il tuo word error rate, ci sono alcuni errori comuni e fraintendimenti da conoscere.
- Tutti gli errori sono uguali: Il WER considera ogni errore ugualmente importante. In molti contesti può andare bene, ma in alcuni casi non è accettabile. Ad esempio, in ospedale, un errore del 5% che sarebbe considerato un buon WER può comunque essere incomprensibile, perché anche uno o due errori possono mettere a rischio un paziente. Questo limite ha portato allo sviluppo di nuove metriche, come il Semantic Word Error Rate (SWER), che cerca di valutare se il significato di una frase è stato mantenuto invece di verificare solo la corrispondenza parola per parola.
- Il WER può superare il 100%: Anche se prima abbiamo detto che il WER va da 0 a 1, puoi comunque trovare un WER superiore al 100%. Questo perché l’errore di inserimento può generare più parole rispetto al totale dell’originale. Un esempio comune è trascrivere ‘I’m’ come ‘I am’, dove una parola diventa due.
- Un WER più basso non è sempre meglio, tecnicamente: Un WER del 5% è, sulla carta, migliore di uno del 10%. Ma se gli errori che hanno portato al 5% hanno cambiato molto il senso di una frase, mentre quelli del 10% no, allora il dato non racconta tutta la storia. Il contesto conta ancora molto, e metriche come SWER sono nate proprio per cogliere questo impatto semantico.
Nel 2024, Apple ha pubblicato uno studio interessante che esplora proprio questo punto. Quando le persone hanno valutato una trascrizione con un WER del 9,4% chiedendosi se fosse leggibile, hanno dato allo stesso passaggio un WER di solo 2,2%. Nell’esempio testato, spesso gli ‘errori’ sono stati considerati insignificanti dalle persone, producendo un WER umano oltre 4 volte più tollerante rispetto alle macchine.
Riferimenti di settore per il WER
Il WER ideale dipende molto dal settore o dall’uso che fai della tecnologia ASR. Anche se <5% è un riferimento di settore, settori specifici come la trascrizione medica o legale richiedono tassi molto più bassi.
Nello studio di Artificial Analysis di luglio 2026, Scribe v2 di ElevenLabs ha ottenuto un WER dell’1,5%. Tuttavia, è importante ricordare che queste statistiche sono di solito riferite all’inglese come lingua principale. La tecnologia STT in altre lingue potrebbe non essere altrettanto efficace.
La documentazione di ElevenLabs spiega le fasce di WER generali per tutte le lingue supportate da Scribe v1 e Scribe v2.
Inizia con ElevenAPI per migliorare l’accuratezza del riconoscimento
Quando sviluppi un’applicazione o un prodotto in cui la qualità della trascrizione è importante, la differenza tra una buona API ASR e una mediocre si vede subito nel WER e poi nell’esperienza degli utenti.
ElevenLabs Scribe è il livello Speech to Text accessibile tramite ElevenAPI. Oltre a più di 90 lingue e a un WER leader di settore, offre funzioni come diarizzazione dei parlanti, timestamp a livello di parola, keyterm prompting ed entity detection.
Esplora la documentazione di ElevenLabs per saperne di più su ElevenAPI oppure inizia registrandoti oggi stesso.
.webp&w=3840&q=80)

.webp&w=3840&q=80)
.webp&w=3840&q=80)
