Word error rate (WER): Kluczowe pojęcia, wzór i zastosowania
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
WER to wskaźnik, który pokazuje, jak dokładne jest narzędzie do automatycznego rozpoznawania mowy (ASR). Niski WER oznacza, że transkrypcja jest dokładniejsza, a wyższy wskaźnik pokazuje więcej błędów.
W praktyce WER może decydować o tym, czy oprogramowanie medyczne zapisze ‘piętnaście miligramów’ czy ‘pięćdziesiąt miligramów’ leku. To różnica między narzędziem, które dobrze rozumie potrzeby klienta, a takim, które tylko frustruje użytkownika.
W tym artykule wyjaśniamy, czym jest WER, jak go obliczyć i jak wykorzystać go do porównania różnych dostawców ASR.
Podsumowanie
- WER liczy trzy typy błędów: podstawienia, usunięcia i wstawienia, a następnie dzieli je przez liczbę słów w poprawnej transkrypcji.
- Wzór na WER to WER = (S + D + I) / N.
- Im niższy WER, tym dokładniejszy wynik.
- WER poniżej 5% to dobry wynik, ale transkrypcje medyczne czy prawnicze mogą wymagać jeszcze niższego wskaźnika.
- WER traktuje wszystkie błędy tak samo, więc nie zawsze oddaje sens wypowiedzi. Nowe wskaźniki, jak Semantic Word Error Rate (SWER), próbują to poprawić, mierząc, czy sens wypowiedzi został zachowany.
Czym jest word error rate?
Word error rate (WER) to standardowy wskaźnik dokładności rozpoznawania mowy w modelach speech to text. Pokazuje, ile błędów popełnia system STT podczas transkrypcji, biorąc pod uwagę podstawienia, usunięcia i wstawienia.
Podstawienie to zamiana słowa na inne. Usunięcie to pominięcie słowa. Wstawienie to dodanie słowa, którego nie było w nagraniu. WER sumuje te trzy typy błędów i dzieli przez liczbę słów w poprawnej transkrypcji, co pozwala porównać różnych dostawców.
Oto wzór na WER:
WER = (S + D + I) / N
Gdzie:
- S: Podstawienia (błędne słowo)
- D: Usunięcia (brak słowa)
- I: Wstawienia (dodatkowe słowo)
- N: Liczba słów w poprawnej transkrypcji
WER można zapisać jako liczbę dziesiętną lub procent. Im niższy WER, tym mniej błędów popełnił model podczas transkrypcji.
WER na poziomie 10% oznacza, że mniej więcej co dziesiąte słowo w transkrypcji wymaga poprawki.
Dlaczego word error rate jest ważny w systemach rozpoznawania mowy?
WER to obiektywny wskaźnik, który pozwala zespołom porównywać różnych dostawców. Pozwala pominąć marketingowe obietnice i jasno pokazuje, jak dokładny jest model rozpoznawania mowy. Dzięki temu każda firma może łatwo sprawdzić, które modele są obecnie najlepsze.

Źródło:Artificial Analysis dostęp: 10 lipca 2026.
Na lipiec 2026 niezależne badania firmy Artificial Analysis pokazują, że Scribe v2 od ElevenLabs ma najniższy WER w branży na zbiorze AA-AgentTalk dla modeli transkrypcji niestrumieniowej, osiągając 1,5% WER.
Poza porównywaniem dostawców, WER ma realny wpływ na produkt. Oprogramowanie medyczne z WER na poziomie 12% może wprowadzać poważne błędy do dokumentacji pacjenta. Błędy w transkrypcji rozmowy z klientem mogą prowadzić do kolejnych problemów, np. błędnej analizy nastroju czy złej kategoryzacji.
Poza tymi konkretnymi przypadkami, gdy systemy ASR zawodzą, najbardziej cierpią osoby, dla których transkrypcja to jedyny sposób na dostęp do treści mówionych. World Wide Web Consortium udostępnia szczegółowe wytyczne dotyczące minimalnych standardów wymaganych przez inicjatywy dostępności.
Jak obliczyć word error rate: wzór i przykład
Obliczanie WER jest proste, gdy znasz kroki. Jak pokazaliśmy wyżej, wzór to WER = (S + D + I) / N. Wszystkie pojęcia opisaliśmy wcześniej, ale w skrócie to podstawienia, usunięcia, wstawienia i N jako liczba słów w transkrypcji.
Jak obliczyć WER:
- Stwórz poprawną transkrypcję: Użyj transkrypcji i weryfikacji przez człowieka, by uzyskać dokładny zapis nagrania.
- Użyj narzędzia STT: Użyj platformy ASR, by przekształcić nagranie w transkrypcję AI, której użyjesz do testu.
- Porównaj obie wersje: Użyj programowania dynamicznego (konkretnie algorytmu Levenshteina), by znaleźć minimalną liczbę edycji. O tym algorytmie napiszemy więcej w dalszej części.
- Zastosuj wzór:Policz liczbę błędów w wersji AI względem wersji zweryfikowanej przez człowieka i użyj wzoru WER = (S + D + I) / N, by uzyskać dokładny wynik.
Na papierze wygląda to technicznie, ale w praktyce jest prostsze. Oto przykład:
Poprawna transkrypcja:Mrs. Dalloway said she would buy the flowers herself.
Wynik ASR:Miss Dalloway said she would buy flowers herself.
Licząc błędy, mamy 1 S i 1 D na 9 słów.
Stosując wzór: WER = 2 / 9 = 0,222 = 22,2%.
Obliczanie word error rate w Pythonie
Ręczna metoda działa, ale możesz zaoszczędzić czas, licząc WER w pythonie. Biblioteka jiwer robi to automatycznie.
Korzystając z dokumentacji jiwer, możesz zainstalować pakiet stworzony do oceny systemów ASR i liczenia wskaźników takich jak WER. Po instalacji możesz użyć poniższego kodu, by szybko policzyć WER w pythonie:
W tym przykładzie wynik ASR różni się od oryginału w dwóch miejscach. Słowo ‘jumps’ zostało błędnie przepisane jako ‘leaps’ (podstawienie), a ‘last’ zostało dodane przed ‘lazy’ (wstawienie). Dwa błędy na dziewięć słów w poprawnej transkrypcji dają WER 0,222, czyli 22,2%.
Porównanie WER i innych wskaźników rozpoznawania mowy
WER to standardowy wskaźnik dokładności ASR, ale są też inne narzędzia. Na przykład:
- Character Error Rate (CER): Podobnie jak WER, mierzy dokładność transkrypcji, ale na poziomie znaków, nie słów. Najlepszy do języków bez wyraźnych odstępów między słowami lub z trudną pisownią.
- Match Error Rate (MER): Mierzy udział błędów w transkrypcji, traktując podstawienia, wstawienia i usunięcia trochę inaczej niż WER. Skupia się na tym, ile błędów jest w zdaniu.
- Word Information Lost (WIL): Szacuje, ile informacji z oryginału zostało utraconych podczas transkrypcji, pokazując zrozumiałość, a nie tylko liczbę błędów.
- Embedding Error Rate (EmbER): Daje analizę semantyczną między transkrypcjami. Pokazuje, jak bardzo sens słowa odbiega od poprawnej wersji.
Każdy z tych wskaźników sprawdza się w innych sytuacjach. Oto tabela do porównania:
Przykłady odległości Levenshteina: matematyka stojąca za WER
WER to w praktyce miara odległości między oryginałem a wynikiem ASR. Do matematycznego porównania używamy odległości Levenshteina.
Odległość Levenshteina to minimalna liczba pojedynczych zmian potrzebnych, by zamienić jeden ciąg w drugi. W przypadku WER chodzi o podstawienia, wstawienia i usunięcia. Na przykład, by zamienić Cat na Mat, trzeba zmienić ‘C’ na ‘M’, więc odległość to 1.
W CER liczy się znaki, a w WER całe słowa. Każda jednostka to słowo, a odległość pokazuje, ile zmian trzeba, by wynik ASR był taki jak oryginał.
Tworzymy macierz, gdzie każda komórka to odległość między oryginałem a transkrypcją ASR. Odległość Levenshteina wypełnia macierz od lewego górnego do prawego dolnego rogu, a ostatnia komórka to liczba zmian na poziomie słów. Dzieląc tę liczbę przez N, otrzymujesz WER.
Zwykle macierz liczy się na znakach, ale tu pokazujemy uproszczoną wersję na słowach.

Częste pułapki i nieporozumienia wokół WER
Szczególnie gdy STT API są coraz łatwiej dostępne, a oprogramowanie ASR staje się standardem w narzędziach agentów, coraz częściej porównujemy różne rozwiązania.
Zanim zaczniesz liczyć własny WER, poznaj kilka typowych problemów i nieporozumień.
- Wszystkie błędy są równe: WER traktuje każdy błąd tak samo. W wielu przypadkach to wystarczy, ale są sytuacje, gdzie to nieakceptowalne. Na przykład w szpitalu nawet 5% błędów może być groźne, bo jeden czy dwa błędy mogą zaszkodzić pacjentowi. Dlatego powstały nowe wskaźniki, jak Semantic Word Error Rate (SWER), które mierzą, czy sens zdania został zachowany, a nie tylko zgodność słów.
- WER może przekroczyć 100%: Choć wcześniej pisaliśmy, że WER mieści się między 0 a 1, czasem może być wyższy niż 100%. Dzieje się tak, gdy przez wstawienia pojawia się więcej słów niż w oryginale. Przykład: ‘I’m’ przepisane jako ‘I am’ – jedno słowo zamienia się w dwa.
- Niższy WER nie zawsze jest lepszy: WER 5% jest na papierze lepszy niż 10%. Ale jeśli te 5% błędów zmienia sens zdania, a te z 10% nie, to sam wskaźnik nie mówi wszystkiego. Kontekst ma znaczenie, dlatego powstały wskaźniki jak SWER, które mierzą wpływ błędów na sens.
W 2024 Apple opublikowało ciekawe badanie dotyczące tego problemu. Gdy ludzie oceniali transkrypcję z WER 9,4% pod kątem czytelności, dali temu samemu fragmentowi WER tylko 2,2%. W tym przykładzie ludzie uznali wiele ‘błędów’ za nieistotne, więc Human WER był ponad 4 razy łagodniejszy niż maszynowy.
Branżowe benchmarki WER
Idealny WER zależy od branży i zastosowania ASR. WER poniżej 5% to standard, ale w medycynie czy prawie wymagany jest jeszcze niższy wskaźnik.
W badaniu Artificial Analysis z lipca 2026 Scribe v2 od ElevenLabs osiągnął WER 1,5%. Warto jednak pamiętać, że takie statystyki zwykle dotyczą języka angielskiego. STT w innych językach może nie być tak skuteczne.
W ElevenLabs Docs znajdziesz podział na ogólne zakresy WER dla wszystkich języków obsługiwanych przez Scribe v1 i Scribe v2.
Wypróbuj ElevenAPI, by poprawić dokładność rozpoznawania mowy
Jeśli tworzysz aplikację lub produkt, gdzie liczy się jakość transkrypcji, różnica między dobrym a przeciętnym API ASR najpierw pojawi się w twoim WER, a potem w doświadczeniu użytkowników.
ElevenLabs Scribe to warstwa Speech to Text dostępna przez ElevenAPI. Oprócz obsługi 90+ języków i branżowo niskiego WER, oferuje takie funkcje jak diarizacja mówców, znaczniki czasowe na poziomie słów, podpowiedzi słów kluczowych i wykrywanie encji.
Zajrzyj do ElevenLabs Docs, by dowiedzieć się więcej o ElevenAPI lub zacznij od rejestracji już dziś.



.webp&w=3840&q=80)
