Hoppa till innehållet

Word error rate (WER): Viktiga begrepp, formel och användningsområden

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

I teorin är word error rate (WER) ett mått för att avgöra precisionen hos ett Automatic Speech Recognition-verktyg (ASR). Ett lågt WER innebär att den slutliga transkriptionen är mer korrekt, medan en högre felfrekvens visar på feltranskriberad information. 

I praktiken kan WER vara skillnaden mellan ett medicinskt transkriberingsverktyg som skriver att en patient behöver ”femton milligram” eller ”femtio milligram” av ett receptbelagt läkemedel. Det är skillnaden mellan ett supportverktyg som korrekt transkriberar en kunds behov och ett som gör användaren frustrerad.

I den här artikeln går vi igenom vad WER är, hur du beräknar det och hur du använder det för att jämföra din egen ASR-leverantör.

Sammanfattning

  • Word error rate räknar tre typer av fel: ersättningar, borttagningar och tillägg, dividerat med antalet ord i referenstranskriptionen.
  • Formeln för WER är WER = (S + D + I) / N. 
  • Lägre WER-värden innebär att slutresultatet är mer korrekt.
  • Ett WER under 5 % är ett bra riktmärke, även om juridiska eller medicinska transkriptioner kan kräva en ännu lägre Word Error Rate.
  • WER behandlar alla fel som likvärdiga, vilket innebär att det inte är ett perfekt mått för att läsa i sitt sammanhang. Nya mått, som Semantic Word Error Rate (SWER), försöker hantera detta genom att mäta om innebörden i ett yttrande har bevarats.

Vad är word error rate?

Word error rate (WER) är standardmåttet för att mäta taligenkänningens precision i speech to text-modeller. Det uttrycks som ett tal mellan 0 och 1 (0,8 motsvarar en felfrekvens på 80 %) och visar vad ett STT-system får fel vid transkribering, baserat på ersättningar, borttagningar och tillägg.

En ersättning är när ett ord byts ut mot fel ord. En borttagning är när ett ord helt har utelämnats. Ett tillägg är när transkriptionen innehåller ett ord som aldrig sades. WER använder alla dessa tre komponenter och dividerar sedan med antalet ord i den korrekta transkriptionen, vilket ger ett tal som du kan jämföra med andra leverantörer.

Här är formeln för WER utskriven:

WER = (S + D + I) / N

Där:

  • S: Ersättningar (ordet är fel)
  • D: Borttagningar (ordet saknas)
  • I: Tillägg (ett extra ord finns)
  • N: Totalt antal ord i referenstranskriptionen

Du kan uttrycka WER som antingen ett decimaltal eller en procentsats. Ju lägre WER, desto bättre resultat, eftersom modellen gjorde färre fel vid transkriberingen. 

I praktiken innebär ett WER på 10 % att ungefär 1 av 10 ord i transkriptionen från ditt möte behöver kontrolleras en extra gång. 

Varför är word error rate viktigt i taligenkänningssystem?

Word error rate ger team ett objektivt mått för att jämföra olika leverantörer. Det går bortom marknadsföringspåståenden och visar tydligt hur korrekt en taligenkänningsmodell är. Med fakta som grund får företag som utvärderar sina alternativ en tydlig bild av vilka modeller som för närvarande leder utvecklingen på området.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Källa: Artificial Analysis öppnad den 10 juli 2026.

I juli 2026 rankar oberoende forskning från Artificial Analysis ElevenLabs Scribe v2 som branschens lägsta WER på AA-AgentTalk-datasetet för transkriberingsmodeller utan direktuppspelning, med ett WER på 1,5 %.

Utöver utvärdering av leverantörer påverkar WER produkten i verkligheten. Medicinsk transkriberingsprogramvara med ett WER på 12 % kan orsaka kritiska fel i patientjournaler. Feltranskriberingar i ett samtal inom kundsupport kan leda till följdfel, som felaktig sentimentanalys eller bristfällig kategorisering.

Utöver dessa användningsspecifika problem är de personer som påverkas mest när ASR-system misslyckas ofta de för vilka transkriptionen är det enda sättet att överhuvudtaget få tillgång till talat innehåll. World Wide Web Consortium erbjuder omfattande dokumentation om de miniminivåer som tillgänglighetsinitiativ förväntar sig.

Så beräknar du word error rate: formel och exempel

Att beräkna word error rate är enkelt när du känner till stegen. Som vi nämnde ovan använder du formeln WER = (S + D + I) / N. Alla termer förklaras ovan, men kortfattat är de ersättningar, borttagningar, tillägg och N för det totala antalet ord i transkriptionen.

Så här beräknar du WER:

  1. Skapa en referenstranskription: Använd mänsklig transkribering och verifiering för att skapa en korrekt transkription av ett ljudklipp. 
  2. Använd ditt STT-verktyg: Använd en ASR-plattform för att transkribera ljudklippet och skapa en AI-transkription som du använder som test.
  3. Justera de två versionerna: Använd dynamisk programmering (närmare bestämt Levenshtein-algoritmen) för att hitta det minsta antalet ändringar. Vi fördjupar oss i den algoritmen i ett senare avsnitt.
  4. Använd formeln: Räkna det totala antalet fel i den AI-genererade versionen jämfört med den mänskligt verifierade kopian och använd sedan WER = (S + D + I) / N för att beräkna det exakta WER-värdet.

Det här kan verka ganska tekniskt på papperet, men är mycket enklare i praktiken. Här är ett övningsexempel som visar vad vi menar.

Referenstranskription: Mrs. Dalloway said she would buy the flowers herself.

ASR-resultat: Miss Dalloway said she would buy flowers herself.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

Om vi beräknar det totala antalet fel har vi 1 S och 1 D av totalt 9 ord. 

Med formeln får vi: WER = 2 / 9 = 0.222 = 22.2 %. 

Beräkna word error rate med Python

Den manuella metoden fungerar bra, men du kan spara tid genom att beräkna WER med Python. jiwer-biblioteket hanterar allt detta helt automatiskt.

Med jiwer-dokumentationen kan du installera paketet, som är särskilt byggt för att utvärdera ett ASR-system och ta fram centrala mått som WER. När det har laddats ned kan du använda följande kod för att snabbt beräkna WER med Python:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Observera att ASR-resultatet i det här exemplet skiljer sig från den ursprungliga referensen på två ställen. Ordet ”jumps” transkriberades felaktigt som ”leaps” (en ersättning), och ”last” lades till före ”lazy” (ett tillägg). Med två fel bland de nio orden i referenstranskriptionen blir Word Error Rate (WER) 0.222, eller 22.2 %.

Jämförelse mellan word error rate och andra mått för igenkänning

WER är standardmåttet för att beräkna precision i ett ASR-system, men det finns även andra verktyg du kan använda. Till exempel:

  • Character Error Rate (CER): Precis som WER mäter det transkriberingsprecision på teckennivå i stället för ordnivå. Passar bäst för språk som saknar tydliga ordgränser (scriptio continua) eller uppgifter där stavning är viktig.
  • Match Error Rate (MER): Mäter andelen transkriberingsfel, men behandlar ersättningar, tillägg och borttagningar något annorlunda än WER. Det fokuserar på andelen felaktiga ord i en mening.
  • Word Information Lost (WIL): En uppskattning av hur mycket av den ursprungliga informationen som gick förlorad under transkriberingen. Det mäter begriplighet snarare än WER:s direkta felräkning.
  • Embedding Error Rate (EmbER): Erbjuder en semantisk analys mellan transkriptionerna. Det går längre än WER och ger insikt i det semantiska avståndet mellan det korrekta ordet och den felaktiga transkriberingen.

Var och en av dessa mått passar bäst i olika situationer. Här är en tabell du kan använda som referens:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Exempel på Levenshtein-avstånd: matematiken bakom WER

Word error rate är egentligen ett mått på avståndet mellan originalet och hypoteshypotesens resultat. För att förstå skillnaden matematiskt använder vi Levenshtein-avståndet.

Levenshtein-avståndet räknar det minsta antal ändringar på en enhet som krävs för att omvandla en sekvens till en annan. För WER innebär det specifikt ändringar i form av ersättningar, tillägg och borttagningar. Om vi till exempel vill omvandla Cat till Mat måste vi byta bokstaven ”C” mot ”M”, vilket ger ett Levenshtein-avstånd på 1.

Du ser betydligt mer av detta i CER-beräkningar, men WER använder Levenshtein-avståndet på ordnivå. Varje enhet är ett helt ord i stället för ett tecken, och det faktiska avståndet mäter hur många ordändringar som krävs för att omvandla vårt ASR-resultat till det korrekta originalet. 

Vi bygger en matris där varje cell representerar det totala avståndet mellan originaltranskriptionen och ASR-transkriptionen. Levenshtein-avståndet fyller sedan matrisen från övre vänstra till nedre högra hörnet, där den sista cellen ger det totala antalet ändringar på ordnivå. Dividera det talet med N för att få ditt WER. 

Den här matrisen beräknas vanligtvis med enskilda tecken, men här är en uppskalad version av vårt tidigare exempel för enkelhetens skull. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Vanliga fallgropar och missuppfattningar kring word error rate

I synnerhet när STT-API:er blir mer tillgängliga och ASR-programvara blir en vanlig del av bredare agentstackar, kommer vi att se många jämförelser mellan olika verktyg. 

Innan du beräknar dina egna WER-värden finns det några vanliga problem och missuppfattningar som du bör känna till.

  • Alla fel är lika viktiga: WER behandlar varje fel som lika betydelsefullt. Det kan vara helt okej i många sammanhang, men i vissa användningsfall är det oacceptabelt. På ett sjukhus kan till exempel en felfrekvens på 5 %, som skulle betraktas som ett bra WER, fortfarande vara oacceptabel eftersom redan ett eller två fel kan utsätta en patient för risk. Den här begränsningen har lett till utvecklingen av nyare mått, som Semantic Word Error Rate (SWER), som försöker mäta om en menings innebörd bevarades snarare än om varje ord stämde exakt. 
  • WER kan överstiga 100 %: Vi har tidigare sagt att WER ligger mellan 0 och 1, men du kan ändå se ett WER på över 100 %. Det beror på att tilläggsfel kan skapa fler ord än det totala antalet i originaltranskriptionen. Ett vanligt exempel är att transkribera ”I’m” som ”I am”, där ett ord blir två. 
  • Lägre WER är tekniskt sett inte alltid bättre: Ett WER på 5 % är på papperet bättre än ett WER på 10 %. Men om felen som bidrog till de 5 % ändrade en menings sammanhang avsevärt, medan felen i de 10 % inte gjorde det, berättar siffran inte hela historien. Sammanhanget spelar fortfarande stor roll, och mått som SWER utvecklas särskilt för att fånga denna semantiska påverkan.

2024 publicerade Apple en intressant studie som undersökte den sista punkten ovan. När människor bedömde en WER-beräkning på 9.4 % utifrån om ASR-resultatet var läsbart eller inte, gav de samma stycke ett WER på bara 2.2 %. I exemplet de testade ansåg människor i många fall att ”felen” var obetydliga, vilket gav ett mänskligt WER som var över 4 gånger mer förlåtande än maskinernas.

Branschriktmärken för WER

Det ideala WER-värdet beror i hög grad på branschen eller användningsfallet där du använder ASR-teknik. Även om <5 % är ett branschriktmärke för WER behöver specifika branscher, som medicinsk eller juridisk transkribering, en mycket lägre felfrekvens. 

I Artificial Analysis studie från juli 2026 fick ElevenLabs Scribe v2 ett WER på 1,5 %. Det är dock viktigt att komma ihåg att denna statistik vanligtvis tas fram med engelska som huvudspråk. STT-teknik på andra språk kanske inte är lika effektiv. 

ElevenLabs Docs delar upp allmänna WER-intervall för alla språk som Scribe v1 och Scribe v2 har stöd för.

Kom igång med ElevenAPI för bättre igenkänningsprecision

När du bygger en app eller produkt där transkriberingskvalitet är viktig syns skillnaden mellan ett väl valt ASR-API och ett mediokert API först i ditt WER och sedan i användarnas upplevelser. 

ElevenLabs Scribe är Speech to Text-lagret som är tillgängligt via ElevenAPI. Utöver stöd för över 90 språk och branschledande WER erbjuder det funktioner som talardiarisering, tidsstämplar på ordnivå, keyterm prompting och entitetsidentifiering.

Utforska ElevenLabs Docs för att lära dig mer om ElevenAPI eller kom igång genom att registrera dig i dag. 

Vanliga frågor om word error rate

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet