Gå till innehåll

Word error rate (WER): Viktiga begrepp, formel och användningsområden

Skriven av
Jack Limebear
Publicerad

LyssnaLyssna på den här artikeln

I teorin är word error rate (WER) ett mått på hur noggrann ett Automatic Speech Recognition (ASR)-verktyg är. Ett lågt WER betyder att din slutliga transkription är mer korrekt, medan ett högre WER visar på fler fel i transkriberingen.

I praktiken kan WER vara skillnaden mellan att ett medicinskt transkriptionsprogram skriver att en patient behöver 'femton milligram' eller 'femtio milligram' av ett läkemedel. Det är skillnaden mellan ett supportverktyg som korrekt transkriberar en kunds behov och ett som gör användaren frustrerad.

I den här artikeln går vi igenom vad WER är, hur du räknar ut det och hur du kan använda det för att jämföra olika ASR-leverantörer.

Sammanfattning

  • Word error rate räknar tre feltyper: substitutioner, borttagningar och tillägg, och delar det med antalet ord i referenstranskriptionen.
  • Formeln för WER är WER = (S + D + I) / N.
  • Lägre WER innebär att slutresultatet är mer korrekt.
  • Under 5% WER är en bra riktlinje, men juridiska eller medicinska transkriptioner kan kräva ännu lägre Word Error Rate.
  • WER behandlar alla fel som lika allvarliga, vilket gör att det inte är ett perfekt mått för att tolka sammanhang. Nya mått, som Semantic Word Error Rate (SWER), försöker lösa detta genom att mäta om betydelsen i ett yttrande bevarats.

Vad är word error rate?

Word error rate (WER) är standardmåttet för att mäta taligenkänningens noggrannhet i speech to text-modeller. Det visar mellan 0 och 1 (0,8 motsvarar 80% fel) hur mycket ett STT-system missar vid transkribering, utifrån antalet substitutioner, borttagningar och tillägg.

En substitution är när ett ord ersätts med fel ord. Borttagning är när ett ord helt saknas. Tillägg är när transkriptionen innehåller ett ord som aldrig sades. WER använder alla tre komponenterna och delar sedan med antalet ord i den korrekta transkriptionen, vilket ger ett tal du kan jämföra mellan olika leverantörer.

Här är formeln för WER:

WER = (S + D + I) / N

Där:

  • S: Substitutioner (ordet är fel)
  • D: Borttagningar (ordet saknas)
  • I: Tillägg (extra ord finns med)
  • N: Totalt antal ord i referenstranskriptionen

Du kan ange WER som ett decimaltal eller i procent. Ju lägre WER, desto bättre resultat eftersom modellen gjort färre fel vid transkriberingen.

I praktiken betyder 10% WER att ungefär 1 av 10 ord i din mötestranskription behöver dubbelkollas.

Varför är word error rate viktigt i taligenkänningssystem?

Word error rate ger ett objektivt mått som team kan använda för att jämföra olika leverantörer. Det skär igenom marknadsföringspåståenden och visar tydligt hur noggrann en taligenkänningsmodell är. Med fakta i fokus får företag som utvärderar sina alternativ en tydlig bild av vilka modeller som är bäst just nu.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Källa: Artificial Analysis hämtad 10 juli 2026.

Från och med juli 2026 visar oberoende forskning från Artificial Analysis att ElevenLabs Scribe v2 har lägst WER i branschen på AA-AgentTalk-datasetet för icke-strömmande transkriptionsmodeller, med 1,5% WER.

Utöver att jämföra leverantörer har WER stor betydelse på produktnivå. Medicinska transkriptionsprogram med 12% WER kan orsaka allvarliga fel i patientjournaler. Feltranskriberingar i kundsupport kan leda till följdfel, som felaktig sentimentanalys eller dålig kategorisering.

Utöver dessa specifika användningsområden drabbas ofta de som är mest beroende av transkriptionen när ASR-system misslyckas – de som bara kan ta del av innehållet via text. World Wide Web Consortium har omfattande dokumentation om minimikraven som gäller för tillgänglighetsinitiativ om du vill veta mer.

Så räknar du ut word error rate: Formel och exempel

Att räkna ut word error rate är enkelt när du vet stegen. Som vi gått igenom ovan är formeln WER = (S + D + I) / N. Alla termer beskrivs ovan, men för snabb referens är det substitutioner, borttagningar, tillägg och N för totalt antal ord i transkriptionen.

Så här räknar du ut WER:

  1. Skapa en referenstranskription: Använd manuell transkribering och kontroll för att få en korrekt transkription av ett ljudklipp.
  2. Använd ditt STT-verktyg: Använd en ASR-plattform för att transkribera ljudklippet och skapa en AI-transkription som du använder som test.
  3. Jämför de två versionerna: Använd dynamisk programmering (specifikt Levenshtein-algoritmen) för att hitta minsta antal ändringar. Vi går igenom algoritmen mer i en senare del.
  4. Använd formeln:Räkna totala antalet fel i AI-versionen jämfört med den manuellt granskade och använd sedan WER = (S + D + I) / N för att räkna ut exakt WER.

Det kan låta tekniskt, men är faktiskt mycket enklare i praktiken. Här är ett exempel:

Referenstranskription: Mrs. Dalloway said she would buy the flowers herself.

ASR-resultat: Miss Dalloway said she would buy flowers herself.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

Om vi räknar totala antalet fel har vi 1 S och 1 D av 9 ord.

Med formeln får vi: WER = 2 / 9 = 0,222 = 22,2%.

Räkna ut word error rate med Python

Den manuella metoden fungerar bra, men du kan spara tid genom att räkna ut WER med python. Biblioteket jiwer sköter allt detta automatiskt.

Med hjälp av jiwer-dokumentationen kan du installera paketet, som är byggt för att utvärdera ett ASR-system och ta fram nyckelmått som WER. När det är installerat kan du använda följande kod för att snabbt räkna ut WER med python:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Lägg märke till hur ASR-resultatet i det här exemplet skiljer sig från originalet på två ställen. Ordet 'jumps' transkriberades felaktigt som 'leaps' (en substitution) och 'last' lades till före 'lazy' (ett tillägg). Med två fel på de nio orden i referenstranskriptionen blir Word Error Rate (WER) 0,222 eller 22,2%.

Jämförelse mellan word error rate och andra mått för igenkänning

WER är standardmåttet för att mäta noggrannhet i en ASR, men det finns andra verktyg du kan använda. Till exempel:

  • Character Error Rate (CER): Precis som WER mäter det transkriptionens noggrannhet, men på teckennivå istället för ordnivå. Passar bäst för språk utan tydliga ordgränser (scriptio continua) eller uppgifter där stavning är extra viktig.
  • Match Error Rate (MER): Mäter andelen transkriptionsfel men behandlar substitutioner, tillägg och borttagningar lite annorlunda än WER. Fokuserar på andelen fel i en mening.
  • Word Information Lost (WIL): En uppskattning av hur mycket av originalinformationen som gått förlorad vid transkriberingen, och ger ett mått på begriplighet snarare än WER:s direkta felräkning.
  • Embedding Error Rate (EmbER): Ger en semantisk analys mellan transkriptionerna. Går längre än WER och visar det semantiska avståndet mellan rätt ord och fel transkribering.

Varje mått passar bäst i olika situationer. Här är en tabell du kan använda som referens:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Levenshtein-avstånd: Matematiken bakom WER

Word error rate mäter egentligen avståndet mellan originalet och hypotesen. För att förstå skillnaden matematiskt använder vi Levenshtein-avståndet.

Levenshtein-avståndet räknar minsta antal enhetsändringar som krävs för att omvandla en sekvens till en annan. För WER handlar det om substitutioner, tillägg och borttagningar. Om vi till exempel vill omvandla Cat till Mat måste vi byta ut 'C' mot 'M', vilket ger ett Levenshtein-avstånd på 1.

Du ser oftare detta i CER-beräkningar, men WER använder Levenshtein-avståndet på ordnivå. Varje enhet är ett helt ord istället för ett tecken, och det verkliga avståndet visar hur många ordändringar som krävs för att omvandla ASR-resultatet till originalet.

Vi bygger en matris där varje ruta visar det totala avståndet mellan originaltranskriptionen och ASR-transkriptionen. Levenshtein-avståndet fyller sedan i matrisen från övre vänstra till nedre högra hörnet, och den sista rutan ger totala antalet ordändringar. Dividera det talet med N för att få WER.

Den här matrisen brukar räknas ut på teckennivå, men här är en förenklad version av vårt tidigare exempel.

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Vanliga fallgropar och missuppfattningar kring word error rate

Särskilt när STT-API:er blir mer tillgängliga och ASR-programvara blir vanligare i agentstackar, kommer vi se många jämförelser mellan olika verktyg.

Innan du räknar ut din egen word error rate finns det några vanliga problem och missuppfattningar du bör känna till.

  • Alla fel är lika: WER behandlar varje fel som lika allvarligt. Det kan fungera i många sammanhang, men i vissa fall är det inte acceptabelt. På ett sjukhus kan till exempel 5% fel, som annars anses bra, ändå vara obegripligt – ett eller två fel kan innebära risk för patienten. Denna begränsning har lett till nya mått, som Semantic Word Error Rate (SWER), som försöker mäta om meningen bevarats snarare än om varje ord är exakt rätt.
  • WER kan bli över 100%: Även om vi tidigare sa att WER går mellan 0 och 1 kan du ändå få ett WER över 100%. Det beror på att tilläggsfel kan skapa fler ord än originaltranskriptionen hade. Ett vanligt exempel är att transkribera 'I'm' som 'I am', där ett ord blir två.
  • Lägre WER är inte alltid bättre: Ett WER på 5% är på pappret bättre än 10%. Men om felen som gav 5% ändrade meningen mycket, medan felen i 10% inte gjorde det, så säger siffran inte hela sanningen. Sammanhanget är viktigt, och därför utvecklas mått som SWER för att fånga den semantiska effekten.

Redan 2024 publicerade Apple en intressant studie om just detta. När människor bedömde en WER på 9,4% utifrån om ASR:n var läsbar, gav de samma text ett WER på bara 2,2%. I deras exempel såg människor ofta 'felen' som oviktiga, vilket gav ett Human WER som var över fyra gånger mer förlåtande än maskinens.

Branschstandarder för WER

Den ideala WER-nivån beror mycket på bransch och användningsområde för ASR-tekniken. Även om <5% är en branschstandard för WER kräver vissa områden, som medicinsk eller juridisk transkribering, betydligt lägre nivåer.

I Artificial Analysis juli 2026-studien fick ElevenLabs Scribe v2 ett WER på 1,5%. Men det är viktigt att komma ihåg att dessa siffror oftast gäller engelska som huvudspråk. STT-teknik på andra språk kan vara mindre effektiv.

I ElevenLabs Docs hittar du en genomgång av generella WER-nivåer för alla språk som Scribe v1 och Scribe v2 stödjer.

Kom igång med ElevenAPI för bättre igenkänningsnoggrannhet

När du bygger en app eller produkt där transkriptionskvalitet är viktig syns skillnaden mellan ett bra ASR-API och ett mediokert först i din WER och sedan i användarupplevelsen.

ElevenLabs Scribe är Speech to Text-lagret som du når via ElevenAPI. Med stöd för över 90 språk och branschledande WER får du även funktioner som talaridentifiering, tidsstämplar på ordnivå, nyckelordsstyrning och entity-detektering.

Utforska ElevenLabs Docs för att lära dig mer om ElevenAPI eller kom igång genom att registrera dig idag.

Word error rate – vanliga frågor

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet