Przejdź do treści

Word error rate (WER): Kluczowe pojęcia, wzór i zastosowania

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Teoretycznie współczynnik błędów słów (WER) to miara określająca dokładność narzędzia Automatic Speech Recognition (ASR). Niski WER oznacza dokładniejszą końcową transkrypcję, a wyższy — więcej błędnie zapisanych informacji. 

W praktyce WER może decydować o tym, czy oprogramowanie do transkrypcji medycznej zapisze, że pacjent potrzebuje „piętnastu miligramów”, czy „pięćdziesięciu miligramów” leku. To różnica między narzędziem wsparcia, które poprawnie zapisuje potrzeby klienta, a takim, które frustruje użytkownika.

W tym artykule wyjaśnimy, czym jest WER, jak go obliczyć i jak użyć go do porównania dostawców ASR.

Podsumowanie

  • Współczynnik błędów słów uwzględnia trzy rodzaje błędów: podstawienia, usunięcia i wstawienia, a następnie dzieli ich liczbę przez liczbę słów w transkrypcji referencyjnej.
  • Wzór na WER to WER = (S + D + I) / N. 
  • Niższy WER oznacza dokładniejszy wynik końcowy.
  • WER poniżej 5% to dobry punkt odniesienia, choć transkrypcje prawne i medyczne mogą wymagać jeszcze niższego współczynnika błędów słów.
  • WER traktuje wszystkie błędy jednakowo, więc nie jest idealną miarą do oceny kontekstu. Nowsze wskaźniki, takie jak Semantic Word Error Rate (SWER), próbują to rozwiązać, mierząc, czy zachowano znaczenie wypowiedzi.

Czym jest współczynnik błędów słów?

Współczynnik błędów słów (WER) to standardowa miara dokładności rozpoznawania mowy w modelach zamiany mowy na tekst. Przedstawia w skali 0–1 (0,8 oznacza 80% błędów), co system STT zapisuje nieprawidłowo, uwzględniając podstawienia, usunięcia i wstawienia.

Podstawienie występuje, gdy słowo zostaje zastąpione niewłaściwym. Usunięcie ma miejsce, gdy słowo zostanie całkowicie pominięte. Wstawienie oznacza dodanie do transkrypcji słowa, które nigdy nie padło. WER uwzględnia wszystkie trzy elementy, a następnie dzieli ich liczbę przez liczbę słów w poprawnej transkrypcji. Dzięki temu możesz porównać wynik z innymi dostawcami.

Oto wzór na WER:

WER = (S + D + I) / N

Gdzie:

  • S: Podstawienia (słowo jest błędne)
  • D: Usunięcia (brakuje słowa)
  • I: Wstawienia (występuje dodatkowe słowo)
  • N: Łączna liczba słów w transkrypcji referencyjnej

WER możesz wyrazić jako liczbę dziesiętną lub procent. Im niższy WER, tym lepszy wynik, ponieważ model popełnił mniej błędów podczas transkrypcji. 

W praktyce WER na poziomie 10% oznacza, że mniej więcej 1 na 10 słów w transkrypcji spotkania wymaga ponownego sprawdzenia. 

Dlaczego współczynnik błędów słów jest ważny w systemach rozpoznawania mowy?

Współczynnik błędów słów to obiektywna miara, której zespoły mogą używać do porównywania różnych dostawców. Pozwala przebić się przez marketingowe deklaracje i jasno pokazuje dokładność modelu rozpoznawania mowy. Firmy oceniające dostępne opcje mogą na podstawie danych łatwo sprawdzić, które modele są obecnie najlepsze.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Źródło: Artificial Analysis; dostęp: 10 lipca 2026 r.

Według niezależnego badania Artificial Analysis z lipca 2026 r. Scribe v2 od ElevenLabs ma najniższy w branży WER dla modeli transkrypcji niestreamingowej w zbiorze AA-AgentTalk — 1,5%.

Poza oceną dostawców WER wpływa też na produkt w praktyce. Oprogramowanie do transkrypcji medycznej z WER na poziomie 12% może wprowadzić krytyczne błędy do dokumentacji pacjenta. Błędna transkrypcja rozmowy z obsługą klienta może prowadzić do dalszych problemów, takich jak niedokładna analiza sentymentu lub błędna kategoryzacja.

Poza tymi problemami specyficznymi dla danego zastosowania, gdy systemy ASR zawodzą, najbardziej cierpią często osoby, dla których transkrypcja jest jedynym sposobem dostępu do treści mówionych. World Wide Web Consortium udostępnia obszerną dokumentację o minimalnych standardach oczekiwanych przez inicjatywy dostępności.

Jak obliczyć współczynnik błędów słów: wzór i przykład

Obliczanie współczynnika błędów słów jest proste, gdy znasz kolejne kroki. Jak opisano wcześniej, stosujesz wzór WER = (S + D + I) / N. Wszystkie pojęcia wyjaśniliśmy wyżej, ale dla przypomnienia: podstawienia, usunięcia, wstawienia oraz N — łączna liczba słów w transkrypcji.

Tak obliczysz WER:

  1. Utwórz transkrypcję referencyjną: Skorzystaj z transkrypcji wykonanej i zweryfikowanej przez człowieka, aby uzyskać dokładny zapis klipu audio. 
  2. Użyj narzędzia STT: Użyj platformy ASR do transkrypcji klipu audio i utwórz transkrypcję AI, która posłuży jako test.
  3. Dopasuj obie wersje: Użyj programowania dynamicznego, a konkretnie algorytmu Levenshteina, aby znaleźć minimalną liczbę zmian. Omówimy ten algorytm szerzej w dalszej części artykułu.
  4. Zastosuj wzór: Policz wszystkie błędy w wersji wygenerowanej przez AI względem wersji zweryfikowanej przez człowieka, a następnie użyj WER = (S + D + I) / N, aby obliczyć dokładny WER.

Na papierze brzmi to dość technicznie, ale w praktyce jest znacznie prostsze. Oto przykład, który pokazuje, o co chodzi.

Transkrypcja referencyjna: Pani Dalloway powiedziała, że sama kupi kwiaty.

Wynik ASR: Panna Dalloway powiedziała, że sama kupi kwiaty.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

Łącznie mamy 1 S i 1 D na 9 słów. 

Po zastosowaniu wzoru otrzymujemy: WER = 2 / 9 = 0.222 = 22.2%. 

Obliczanie współczynnika błędów słów w Pythonie

Metoda ręczna sprawdza się świetnie, ale możesz zaoszczędzić czas, obliczając WER w Pythonie. biblioteka jiwer robi to wszystko całkowicie automatycznie.

Korzystając z dokumentacji jiwer, możesz zainstalować pakiet stworzony specjalnie do oceny systemów ASR i generowania kluczowych wskaźników, takich jak WER. Po pobraniu użyj poniższego kodu, aby szybko obliczyć WER w Pythonie:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Zauważ, że w tym przykładzie wynik ASR różni się od oryginalnej transkrypcji referencyjnej w dwóch miejscach. Słowo „jumps” błędnie zapisano jako „leaps” (podstawienie), a przed „lazy” wstawiono „last” (wstawienie). Dwa błędy na dziewięć słów w transkrypcji referencyjnej dają współczynnik błędów słów (WER) 0.222, czyli 22.2%.

Porównanie współczynnika błędów słów z innymi miarami rozpoznawania

WER to standardowa miara dokładności ASR, ale możesz używać też innych narzędzi. Na przykład:

  • Character Error Rate (CER): Podobnie jak WER, mierzy dokładność transkrypcji na poziomie znaków, a nie słów. Najlepiej sprawdza się w językach bez wyraźnych granic między słowami (scriptio continua) lub w zadaniach wrażliwych na pisownię.
  • Match Error Rate (MER): Mierzy odsetek błędów transkrypcji, traktując podstawienia, wstawienia i usunięcia nieco inaczej niż WER. Koncentruje się na proporcji błędów w zdaniu.
  • Word Information Lost (WIL): Szacuje, ile oryginalnej informacji utracono podczas transkrypcji, mierząc zrozumiałość zamiast bezpośredniej liczby błędów, jak WER.
  • Embedding Error Rate (EmbER): Oferuje analizę semantyczną między transkrypcjami. Wykracza poza WER, pokazując semantyczną różnicę między poprawnym słowem a błędną transkrypcją.

Każda z tych miar najlepiej sprawdza się w innym scenariuszu. Poniżej znajdziesz tabelę referencyjną:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Przykłady odległości Levenshteina: matematyka stojąca za WER

Współczynnik błędów słów jest miarą odległości między oryginałem a wynikiem hipotezy. Aby zrozumieć tę różnicę matematycznie, używamy odległości Levenshteina.

Odległość Levenshteina liczy minimalną liczbę pojedynczych zmian potrzebnych do przekształcenia jednej sekwencji w drugą. W przypadku WER chodzi konkretnie o podstawienia, wstawienia i usunięcia. Na przykład, aby przekształcić Cat w Mat, trzeba zamienić literę „C” na „M”, co daje odległość Levenshteina równą 1.

W obliczeniach CER spotkasz to znacznie częściej, ale WER skaluje odległość Levenshteina do poziomu słów. Każdą jednostką jest całe słowo, a rzeczywista odległość mierzy, ilu zmian słów potrzeba, by przekształcić wynik ASR w poprawny oryginał. 

Tworzymy macierz, w której każda komórka przedstawia łączną odległość między oryginalną transkrypcją a transkrypcją ASR. Odległość Levenshteina wypełnia następnie macierz od lewego górnego do prawego dolnego rogu, a ostatnia komórka podaje łączną liczbę zmian na poziomie słów. Podzielenie tej liczby przez N daje WER. 

Tę macierz zwykle oblicza się dla pojedynczych znaków, ale dla uproszczenia pokazujemy powiększoną wersję poprzedniego przykładu. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Typowe pułapki i błędne przekonania dotyczące współczynnika błędów słów

Zwłaszcza że API STT stają się coraz bardziej dostępne, a oprogramowanie ASR jest częstym elementem szerszych stosów agentowych, będziemy widzieć wiele porównań różnych narzędzi. 

Zanim obliczysz własne współczynniki błędów słów, warto poznać kilka typowych problemów i błędnych przekonań.

  • Wszystkie błędy są równe: WER uznaje każdy błąd za równie istotny. W wielu kontekstach to wystarcza, ale w niektórych zastosowaniach jest nie do przyjęcia. Na przykład w szpitalu 5% błędów, uznawane za dobry WER, może nadal być nieakceptowalne, ponieważ nawet jeden lub dwa błędy mogą narazić pacjenta na ryzyko. To ograniczenie doprowadziło do powstania nowszych miar, takich jak Semantic Word Error Rate (SWER), która próbuje mierzyć, czy zachowano znaczenie zdania, zamiast sprawdzać, czy każde słowo dokładnie się zgadza. 
  • WER może przekroczyć 100%: Choć wcześniej wskazaliśmy, że WER mieści się między 0 a 1, może przekraczać 100%. Dzieje się tak, ponieważ błędy wstawienia mogą zwiększyć liczbę słów ponad liczbę słów w oryginalnej transkrypcji. Częsty przykład to transkrypcja „I’m” jako „I am”, gdzie jedno słowo staje się dwoma. 
  • Niższy WER nie zawsze jest technicznie lepszy: WER na poziomie 5% jest na papierze lepszy niż 10%. Jeśli jednak błędy składające się na te 5% znacząco zmieniły kontekst zdania, a błędy w tych 10% nie, pełny obraz nie jest przedstawiony. Kontekst nadal ma duże znaczenie, dlatego powstają miary takie jak SWER, które mają wychwytywać ten wpływ semantyczny.

W 2024 roku Apple opublikował interesujące badanie analizujące ostatnią z powyższych kwestii. Gdy ludzie oceniali wynik WER wynoszący 9.4% pod kątem tego, czy transkrypcja ASR jest czytelna, temu samemu fragmentowi przypisali WER wynoszący zaledwie 2.2%. W badanym przykładzie ludzie w wielu przypadkach uznali „błędy” za nieistotne, co dało Human WER ponad 4 razy bardziej wyrozumiały niż wynik maszynowy.

Branżowe punkty odniesienia dla WER

Idealny WER silnie zależy od branży lub zastosowania technologii ASR. Chociaż <5% to branżowy punkt odniesienia dla WER, branże takie jak transkrypcja medyczna lub prawna potrzebują znacznie niższego wyniku. 

W badaniu Artificial Analysis z lipca 2026 r. Scribe v2 od ElevenLabs uzyskał WER 1,5%. Warto jednak pamiętać, że statystyki te zwykle dotyczą przede wszystkim języka angielskiego. Technologia STT może być mniej skuteczna w innych językach. 

Dokumentacja ElevenLabs opisuje ogólne przedziały WER dla wszystkich języków obsługiwanych przez Scribe v1 i Scribe v2.

Zacznij korzystać z ElevenAPI, aby zwiększyć dokładność rozpoznawania

Gdy tworzysz aplikację lub produkt, w którym liczy się jakość transkrypcji, różnica między dobrze dobranym API ASR a przeciętnym najpierw pojawi się w WER, a później w doświadczeniach użytkowników. 

ElevenLabs Scribe to warstwa Speech to Text dostępna przez ElevenAPI. Oprócz obsługi ponad 90 języków i wiodącego w branży WER oferuje funkcje takie jak diarizacja mówców, znaczniki czasu na poziomie słów, podpowiedzi dla kluczowych terminów i wykrywanie encji.

Zapoznaj się z dokumentacją ElevenLabs, aby dowiedzieć się więcej o ElevenAPI, lub zacznij, rejestrując się już dziś. 

FAQ: współczynnik błędów słów

Podobne artykuły

Twórz z najwyższej jakości audio AI