कंटेंट पर जाएं

वर्ड एरर रेट (WER): मुख्य बातें, फॉर्मूला और उपयोग

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

सैद्धांतिक रूप से, वर्ड एरर रेट (WER), किसी ऑटोमैटिक स्पीच रिकग्निशन (ASR) टूल की सटीकता तय करने का एक मेट्रिक है। कम WER का मतलब है कि आपका अंतिम ट्रांसक्रिप्ट ज़्यादा सटीक है, जबकि अधिक एरर रेट गलत ट्रांसक्राइब की गई जानकारी दिखाता है। 

व्यवहार में, WER उस मेडिकल ट्रांसक्रिप्शन सॉफ़्टवेयर के बीच अंतर हो सकता है जो लिखता है कि मरीज को प्रिस्क्रिप्शन के ‘पंद्रह मिलीग्राम’ चाहिए, न कि ‘पचास मिलीग्राम’। यह उस सपोर्ट टूल के बीच का अंतर है जो ग्राहक की ज़रूरतों को सटीकता से ट्रांसक्राइब करता है और उस टूल के बीच जो आपके यूज़र को निराश छोड़ देता है।

इस लेख में, हम समझेंगे कि WER क्या है, इसकी गणना कैसे करें और अपने ASR प्रदाता को बेंचमार्क करने के लिए इसका इस्तेमाल कैसे करें।

सारांश

  • वर्ड एरर रेट सब्स्टिट्यूशन, डिलीशन और इंसर्शन—इन तीन तरह की गलतियों को गिनता है और उन्हें रेफरेंस ट्रांसक्रिप्ट में शब्दों की संख्या से विभाजित करता है।
  • WER का फ़ॉर्मूला है: WER = (S + D + I) / N। 
  • कम WER स्कोर का मतलब है कि अंतिम आउटपुट ज़्यादा सटीक है।
  • 5% से कम WER एक अच्छा बेंचमार्क है, हालांकि कानूनी या मेडिकल ट्रांसक्रिप्शन के लिए इससे भी कम वर्ड एरर रेट की ज़रूरत हो सकती है।
  • WER सभी गलतियों को बराबर मानता है, इसलिए संदर्भ के साथ पढ़ने के लिए यह एक परफ़ेक्ट मेट्रिक नहीं है। सेमेंटिक वर्ड एरर रेट (SWER) जैसे उभरते मेट्रिक यह मापकर इस समस्या को हल करने की कोशिश करते हैं कि कथन का अर्थ बना रहा या नहीं।

वर्ड एरर रेट क्या है?

वर्ड एरर रेट (WER), स्पीच टू टेक्स्ट मॉडल में स्पीच रिकग्निशन की सटीकता मापने का मानक मेट्रिक है। यह 0-1 के रूप में दिखाता है कि ट्रांसक्राइब करते समय STT सिस्टम क्या गलत करता है (0.8 का मतलब 80% एरर रेट होगा), जिसे सब्स्टिट्यूशन, डिलीशन और इंसर्शन के आधार पर मापा जाता है।

सब्स्टिट्यूशन तब होता है, जब किसी शब्द की जगह गलत शब्द आ जाए। डिलीशन तब होता है, जब कोई शब्द पूरी तरह छूट जाए। इंसर्शन तब होता है, जब ट्रांसक्रिप्ट में ऐसा शब्द जुड़ जाए जो बोला ही नहीं गया था। WER इन तीनों घटकों का इस्तेमाल करता है और फिर सही ट्रांसक्रिप्ट में शब्दों की संख्या से विभाजित करता है। इससे एक ऐसी संख्या मिलती है, जिसकी तुलना आप दूसरे वेंडर से कर सकते हैं।

WER का फ़ॉर्मूला इस तरह है:

WER = (S + D + I) / N

जहाँ:

  • S: सब्स्टिट्यूशन (शब्द गलत है)
  • D: डिलीशन (शब्द गायब है)
  • I: इंसर्शन (अतिरिक्त शब्द मौजूद है)
  • N: रेफरेंस ट्रांसक्रिप्ट में कुल शब्द

WER को दशमलव या प्रतिशत, दोनों रूपों में दिखाया जा सकता है। WER जितना कम होगा, आपका स्कोर उतना बेहतर होगा, क्योंकि मॉडल ने ट्रांसक्राइब करते समय कम गलतियाँ कीं। 

व्यवहार में, 10% WER का मतलब है कि आपकी मीटिंग के ट्रांसक्रिप्ट में हर 10 में से लगभग 1 शब्द को दोबारा देखना होगा। 

स्पीच रिकग्निशन सिस्टम में वर्ड एरर रेट क्यों अहम है?

वर्ड एरर रेट एक वस्तुनिष्ठ मेट्रिक देता है, जिसका इस्तेमाल टीमें अलग-अलग प्रदाताओं की तुलना के लिए कर सकती हैं। यह मार्केटिंग दावों से आगे जाकर साफ़ दिखाता है कि स्पीच रिकग्निशन मॉडल कितना सटीक है। प्रमाण के आधार पर, अपने विकल्पों का आकलन करने वाली हर कंपनी साफ़ तौर पर देख सकती है कि इस क्षेत्र में कौन-से मॉडल आगे हैं।

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

स्रोत: Artificial Analysis को 10 जुलाई, 2026 को एक्सेस किया गया।

जुलाई 2026 तक, Artificial Analysis के स्वतंत्र शोध में नॉन-स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल के लिए AA-AgentTalk डेटासेट पर ElevenLabs के Scribe v2 को उद्योग में सबसे कम WER वाला मॉडल बताया गया है, जिसका WER 1.5% है।

वेंडर के मूल्यांकन से आगे, WER का प्रोडक्ट स्तर पर वास्तविक प्रभाव पड़ता है। 12% WER वाला मेडिकल ट्रांसक्रिप्शन सॉफ़्टवेयर मरीज के रिकॉर्ड में गंभीर गलतियाँ ला सकता है। कस्टमर सपोर्ट कॉल में गलत ट्रांसक्रिप्शन से आगे चलकर गलत सेंटिमेंट एनालिसिस या खराब कैटेगराइज़ेशन जैसी समस्याएँ हो सकती हैं।

इन उपयोग-केस से जुड़ी समस्याओं के अलावा, जब ASR सिस्टम विफल होते हैं, तो सबसे ज़्यादा असर अक्सर उन लोगों पर पड़ता है जिनके लिए बोली गई सामग्री तक पहुँचने का ट्रांसक्रिप्ट ही एकमात्र तरीका होता है। World Wide Web Consortium अधिक संदर्भ के लिए, एक्सेसिबिलिटी पहलों से अपेक्षित न्यूनतम मानकों पर विस्तृत दस्तावेज़ उपलब्ध कराता है।

वर्ड एरर रेट की गणना कैसे करें: फ़ॉर्मूला और उदाहरण

स्टेप्स जानने के बाद वर्ड एरर रेट की गणना आसान है। जैसा ऊपर बताया गया है, आप WER = (S + D + I) / N फ़ॉर्मूला इस्तेमाल करेंगे। सभी शब्दों का विवरण ऊपर है, लेकिन त्वरित संदर्भ के लिए ये सब्स्टिट्यूशन, डिलीशन, इंसर्शन और ट्रांसक्रिप्शन में कुल शब्दों के लिए N हैं।

WER की गणना ऐसे करें:

  1. रेफरेंस ट्रांसक्रिप्ट बनाएं: किसी ऑडियो क्लिप का सटीक ट्रांसक्रिप्शन बनाने के लिए मानव ट्रांसक्रिप्शन और वेरिफ़िकेशन का उपयोग करें। 
  2. अपने STT टूल का इस्तेमाल करें: ऑडियो क्लिप को ट्रांसक्राइब करने के लिए ASR प्लेटफ़ॉर्म का उपयोग करें। इससे बना AI ट्रांसक्रिप्ट आपके टेस्ट के रूप में इस्तेमाल होगा।
  3. दोनों वर्ज़न को अलाइन करें: एडिट की न्यूनतम संख्या जानने के लिए डायनेमिक प्रोग्रामिंग (खास तौर पर लेवेनश्टाइन एल्गोरिदम) का उपयोग करें। हम आगे के सेक्शन में इस एल्गोरिदम को और विस्तार से समझाएंगे।
  4. फ़ॉर्मूला लागू करें: AI से बने वर्ज़न की गलतियों की कुल संख्या को मानव-सत्यापित कॉपी से मिलाकर गिनें, फिर सटीक WER निकालने के लिए WER = (S + D + I) / N का उपयोग करें।

कागज़ पर यह काफ़ी तकनीकी लग सकता है, लेकिन व्यवहार में यह बहुत आसान है। इसका मतलब समझाने के लिए यहाँ एक उदाहरण दिया गया है।

रेफरेंस ट्रांसक्रिप्ट: मिसेज़ डैलोवे ने कहा कि वह फूल खुद खरीदेंगी।

ASR आउटपुट: मिस डैलोवे ने कहा कि वह फूल खरीदेंगी।

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

कुल गलतियों की गणना करें, तो 9 कुल शब्दों में 1 S और 1 D है। 

फ़ॉर्मूला इस्तेमाल करने पर मिलता है: WER = 2 / 9 = 0.222 = 22.2%। 

Python के साथ वर्ड एरर रेट की गणना

हालाँकि मैन्युअल तरीका अच्छी तरह काम करता है, लेकिन Python के साथ WER की गणना करके आप समय बचा सकते हैं। jiwer लाइब्रेरी यह सब पूरी तरह अपने-आप संभालती है।

jiwer के दस्तावेज़ का उपयोग करके आप यह पैकेज इंस्टॉल कर सकते हैं, जो खास तौर पर ASR सिस्टम का मूल्यांकन करने और WER जैसे मुख्य मेट्रिक बनाने के लिए तैयार किया गया है। डाउनलोड होने के बाद, Python के साथ तेज़ी से WER की गणना करने के लिए नीचे दिया गया कोड इस्तेमाल करें:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

ध्यान दें कि इस उदाहरण में ASR आउटपुट मूल रेफरेंस से दो जगह अलग है। शब्द ‘jumps’ को गलत तरीके से ‘leaps’ (एक सब्स्टिट्यूशन) के रूप में ट्रांसक्राइब किया गया और ‘lazy’ से पहले ‘last’ (एक इंसर्शन) जोड़ा गया। रेफरेंस ट्रांसक्रिप्ट के नौ शब्दों में दो गलतियों के साथ, वर्ड एरर रेट (WER) 0.222 या 22.2% आता है।

वर्ड एरर रेट और दूसरे रिकग्निशन मेट्रिक की तुलना

हालाँकि ASR में सटीकता की गणना के लिए WER मानक मेट्रिक है, लेकिन आप दूसरे टूल भी इस्तेमाल कर सकते हैं। उदाहरण के लिए:

  • कैरेक्टर एरर रेट (CER): WER की तरह, यह शब्द स्तर के बजाय कैरेक्टर स्तर पर ट्रांसक्रिप्शन की सटीकता मापता है। यह उन भाषाओं के लिए बेहतर है जिनमें स्पष्ट शब्द सीमाएँ नहीं होतीं (scriptio continua), या ऐसे कामों के लिए जिनमें सही वर्तनी महत्वपूर्ण होती है।
  • मैच एरर रेट (MER): यह ट्रांसक्रिप्शन गलतियों का अनुपात मापता है, लेकिन सब्स्टिट्यूशन, इंसर्शन और डिलीशन को WER से थोड़ा अलग तरीके से देखता है। यह वाक्य में गलतियों के अनुपात पर ध्यान देता है।
  • वर्ड इन्फ़ॉर्मेशन लॉस्ट (WIL): ट्रांसक्रिप्शन के दौरान मूल जानकारी का कितना हिस्सा खो गया, इसका अनुमान। यह WER की सीधी गलती-गिनती के बजाय समझने योग्य होने का माप देता है।
  • एम्बेडिंग एरर रेट (EmbER): ट्रांसक्रिप्शन के बीच सेमेंटिक विश्लेषण देता है। यह WER से आगे बढ़कर सही शब्द और गलत ट्रांसक्रिप्शन के बीच की सेमेंटिक दूरी की जानकारी देता है।

हर मेट्रिक अलग परिस्थिति के लिए सबसे उपयुक्त है। संदर्भ के लिए यहाँ एक टेबल दी गई है:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

लेवेनश्टाइन दूरी के उदाहरण: WER के पीछे का गणित

वर्ड एरर रेट असल में मूल और हाइपोथेसिस आउटपुट के बीच की दूरी का माप है। इस अंतर को गणितीय रूप से समझने के लिए हम लेवेनश्टाइन दूरी का उपयोग करते हैं।

लेवेनश्टाइन दूरी एक सीक्वेंस को दूसरे में बदलने के लिए आवश्यक सिंगल-यूनिट एडिट की न्यूनतम संख्या गिनती है। WER में इसका मतलब खास तौर पर सब्स्टिट्यूशन, इंसर्शन और डिलीशन वाले एडिट हैं। उदाहरण के लिए, अगर हमें Cat को Mat में बदलना हो, तो एक अक्षर ‘C’ को ‘M’ से बदलना होगा। इस तरह लेवेनश्टाइन दूरी 1 होगी।

CER की गणना में यह ज़्यादा दिखता है, लेकिन WER लेवेनश्टाइन दूरी को शब्द स्तर तक बढ़ाता है। हर यूनिट कैरेक्टर के बजाय पूरा शब्द होता है और वास्तविक दूरी बताती है कि हमारे ASR आउटपुट को सटीक मूल में बदलने के लिए कितने शब्द एडिट करने होंगे। 

हम एक मैट्रिक्स बनाते हैं, जिसमें हर सेल मूल ट्रांसक्रिप्ट और ASR ट्रांसक्रिप्ट के बीच की कुल दूरी दिखाता है। लेवेनश्टाइन दूरी फिर मैट्रिक्स को ऊपर-बाएँ से नीचे-दाएँ भरती है और अंतिम सेल शब्द-स्तर के एडिट की कुल संख्या देता है। उस संख्या को N से विभाजित करने पर आपका WER मिलता है। 

हालाँकि इस मैट्रिक्स की गणना आम तौर पर अलग-अलग कैरेक्टर के साथ की जाती है, लेकिन सरलता के लिए यहाँ हमारे पिछले उदाहरण का बड़ा रूप दिया गया है। 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

वर्ड एरर रेट से जुड़ी आम गलतफहमियाँ और समस्याएँ

खास तौर पर जब STT APIs ज़्यादा सुलभ हो रही हैं और ASR सॉफ़्टवेयर व्यापक एजेंट स्टैक का सामान्य हिस्सा बन रहा है, तो हमें अलग-अलग टूल के बीच बहुत सी तुलनाएँ देखने को मिलेंगी। 

अपनी वर्ड एरर रेट की गणना करने से पहले, कुछ आम समस्याओं और गलतफहमियों को समझना ज़रूरी है।

  • सभी गलतियाँ बराबर हैं: WER हर गलती को समान रूप से महत्वपूर्ण मानता है। कई संदर्भों में यह ठीक हो सकता है, लेकिन कुछ उपयोग के मामलों में यह स्वीकार्य नहीं है। उदाहरण के लिए, अस्पताल में 5% एरर, जिसे अच्छा WER माना जाएगा, फिर भी समझ से बाहर हो सकता है, क्योंकि एक या दो गलतियाँ भी मरीज को जोखिम में डाल सकती हैं। इस सीमा के कारण सेमेंटिक वर्ड एरर रेट (SWER) जैसे नए मेट्रिक बने हैं, जो यह मापने की कोशिश करते हैं कि वाक्य का अर्थ सुरक्षित रहा या नहीं, न कि हर शब्द बिल्कुल मेल खाता है या नहीं। 
  • WER 100% से ऊपर जा सकता है: हालाँकि हमने पहले बताया था कि WER 0 और 1 के बीच होता है, फिर भी आपको 100% से अधिक WER मिल सकता है। ऐसा इसलिए है क्योंकि इंसर्शन की गलती, मूल ट्रांसक्रिप्ट के कुल शब्दों से ज़्यादा शब्द बना सकती है। इसका एक आम उदाहरण ‘I’m’ को ‘I am’ के रूप में ट्रांसक्राइब करना है, जहाँ एक शब्द दो बन जाते हैं। 
  • तकनीकी रूप से, कम WER हमेशा बेहतर नहीं होता:कागज़ पर 5% WER, 10% WER से बेहतर है। लेकिन अगर 5% में शामिल गलतियों ने वाक्य का संदर्भ काफ़ी बदल दिया हो और 10% वाली गलतियों ने ऐसा न किया हो, तो पूरी तस्वीर सामने नहीं आती। संदर्भ यहाँ भी बहुत मायने रखता है। इस सेमेंटिक प्रभाव को पकड़ने के लिए ही SWER जैसे मेट्रिक विकसित किए जा रहे हैं।

2024 में Apple ने एक दिलचस्प अध्ययन प्रकाशित किया, जिसमें ऊपर बताए गए आखिरी बिंदु को देखा गया। जब लोगों ने यह देखते हुए 9.4% WER की गणना का आकलन किया कि ASR पढ़ने योग्य था या नहीं, तो उन्होंने उसी अंश को सिर्फ़ 2.2% WER दिया। जिस उदाहरण का परीक्षण किया गया था, उसमें लोगों ने कई मामलों में ‘गलतियों’ को महत्वहीन माना, जिससे ह्यूमन WER मशीनों की तुलना में 4 गुना से अधिक उदार रहा।

WER के लिए उद्योग बेंचमार्क

आदर्श WER काफी हद तक उस उद्योग या उपयोग के मामले पर निर्भर करता है, जिसमें आप ASR तकनीक इस्तेमाल कर रहे हैं। हालाँकि WER के लिए <5% उद्योग बेंचमार्क है, मेडिकल या कानूनी ट्रांसक्रिप्शन जैसे खास उद्योगों को इससे बहुत कम दर चाहिए। 

Artificial Analysis के जुलाई 2026 के अध्ययन में ElevenLabs के Scribe v2 ने 1.5% WER स्कोर किया। हालाँकि, यह याद रखना ज़रूरी है कि ये आँकड़े आमतौर पर प्राथमिक भाषा के रूप में अंग्रेज़ी के आधार पर तैयार किए जाते हैं। दूसरी भाषाओं में STT तकनीक उतनी प्रभावी नहीं हो सकती। 

ElevenLabs Docs में सामान्य WER रेंज का विवरण उन सभी भाषाओं के लिए दिया गया है, जिन्हें Scribe v1 और Scribe v2 सपोर्ट करते हैं।

रिकग्निशन सटीकता बढ़ाने के लिए ElevenAPI से शुरुआत करें

जब आप ऐसा ऐप्लिकेशन या प्रोडक्ट बना रहे हों जहाँ ट्रांसक्रिप्शन की गुणवत्ता मायने रखती हो, तो अच्छी तरह चुनी गई ASR API और सामान्य API के बीच का अंतर पहले आपके WER में और फिर आपके यूज़र के अनुभव में दिखता है। 

ElevenLabs Scribe, स्पीच टू टेक्स्ट लेयर है, जो ElevenAPI के ज़रिए उपलब्ध है। 90+ भाषाओं और उद्योग में अग्रणी WER के साथ, इसमें स्पीकर डायरीकरण, शब्द-स्तरीय टाइमस्टैम्प, कीटर्म प्रॉम्प्टिंग और एंटिटी डिटेक्शन जैसे फ़ीचर भी मिलते हैं।

ElevenLabs Docs में ElevenAPI के बारे में और जानें या साइन अप करके आज ही शुरुआत करें। 

वर्ड एरर रेट FAQ

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं