वर्ड एरर रेट (WER): मुख्य बातें, फॉर्मूला और उपयोग
- लेखक
- Jack Limebear
- प्रकाशित
- आखिरी बार अपडेट किया गया
सुनेंइस आर्टिकल को सुनें
सैद्धांतिक रूप से, वर्ड एरर रेट (WER), किसी ऑटोमैटिक स्पीच रिकग्निशन (ASR) टूल की सटीकता तय करने का एक मेट्रिक है। कम WER का मतलब है कि आपका अंतिम ट्रांसक्रिप्ट ज़्यादा सटीक है, जबकि अधिक एरर रेट गलत ट्रांसक्राइब की गई जानकारी दिखाता है।
व्यवहार में, WER उस मेडिकल ट्रांसक्रिप्शन सॉफ़्टवेयर के बीच अंतर हो सकता है जो लिखता है कि मरीज को प्रिस्क्रिप्शन के ‘पंद्रह मिलीग्राम’ चाहिए, न कि ‘पचास मिलीग्राम’। यह उस सपोर्ट टूल के बीच का अंतर है जो ग्राहक की ज़रूरतों को सटीकता से ट्रांसक्राइब करता है और उस टूल के बीच जो आपके यूज़र को निराश छोड़ देता है।
इस लेख में, हम समझेंगे कि WER क्या है, इसकी गणना कैसे करें और अपने ASR प्रदाता को बेंचमार्क करने के लिए इसका इस्तेमाल कैसे करें।
सारांश
- वर्ड एरर रेट सब्स्टिट्यूशन, डिलीशन और इंसर्शन—इन तीन तरह की गलतियों को गिनता है और उन्हें रेफरेंस ट्रांसक्रिप्ट में शब्दों की संख्या से विभाजित करता है।
- WER का फ़ॉर्मूला है: WER = (S + D + I) / N।
- कम WER स्कोर का मतलब है कि अंतिम आउटपुट ज़्यादा सटीक है।
- 5% से कम WER एक अच्छा बेंचमार्क है, हालांकि कानूनी या मेडिकल ट्रांसक्रिप्शन के लिए इससे भी कम वर्ड एरर रेट की ज़रूरत हो सकती है।
- WER सभी गलतियों को बराबर मानता है, इसलिए संदर्भ के साथ पढ़ने के लिए यह एक परफ़ेक्ट मेट्रिक नहीं है। सेमेंटिक वर्ड एरर रेट (SWER) जैसे उभरते मेट्रिक यह मापकर इस समस्या को हल करने की कोशिश करते हैं कि कथन का अर्थ बना रहा या नहीं।
वर्ड एरर रेट क्या है?
वर्ड एरर रेट (WER), स्पीच टू टेक्स्ट मॉडल में स्पीच रिकग्निशन की सटीकता मापने का मानक मेट्रिक है। यह 0-1 के रूप में दिखाता है कि ट्रांसक्राइब करते समय STT सिस्टम क्या गलत करता है (0.8 का मतलब 80% एरर रेट होगा), जिसे सब्स्टिट्यूशन, डिलीशन और इंसर्शन के आधार पर मापा जाता है।
सब्स्टिट्यूशन तब होता है, जब किसी शब्द की जगह गलत शब्द आ जाए। डिलीशन तब होता है, जब कोई शब्द पूरी तरह छूट जाए। इंसर्शन तब होता है, जब ट्रांसक्रिप्ट में ऐसा शब्द जुड़ जाए जो बोला ही नहीं गया था। WER इन तीनों घटकों का इस्तेमाल करता है और फिर सही ट्रांसक्रिप्ट में शब्दों की संख्या से विभाजित करता है। इससे एक ऐसी संख्या मिलती है, जिसकी तुलना आप दूसरे वेंडर से कर सकते हैं।
WER का फ़ॉर्मूला इस तरह है:
WER = (S + D + I) / N
जहाँ:
- S: सब्स्टिट्यूशन (शब्द गलत है)
- D: डिलीशन (शब्द गायब है)
- I: इंसर्शन (अतिरिक्त शब्द मौजूद है)
- N: रेफरेंस ट्रांसक्रिप्ट में कुल शब्द
WER को दशमलव या प्रतिशत, दोनों रूपों में दिखाया जा सकता है। WER जितना कम होगा, आपका स्कोर उतना बेहतर होगा, क्योंकि मॉडल ने ट्रांसक्राइब करते समय कम गलतियाँ कीं।
व्यवहार में, 10% WER का मतलब है कि आपकी मीटिंग के ट्रांसक्रिप्ट में हर 10 में से लगभग 1 शब्द को दोबारा देखना होगा।
स्पीच रिकग्निशन सिस्टम में वर्ड एरर रेट क्यों अहम है?
वर्ड एरर रेट एक वस्तुनिष्ठ मेट्रिक देता है, जिसका इस्तेमाल टीमें अलग-अलग प्रदाताओं की तुलना के लिए कर सकती हैं। यह मार्केटिंग दावों से आगे जाकर साफ़ दिखाता है कि स्पीच रिकग्निशन मॉडल कितना सटीक है। प्रमाण के आधार पर, अपने विकल्पों का आकलन करने वाली हर कंपनी साफ़ तौर पर देख सकती है कि इस क्षेत्र में कौन-से मॉडल आगे हैं।

स्रोत: Artificial Analysis को 10 जुलाई, 2026 को एक्सेस किया गया।
जुलाई 2026 तक, Artificial Analysis के स्वतंत्र शोध में नॉन-स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल के लिए AA-AgentTalk डेटासेट पर ElevenLabs के Scribe v2 को उद्योग में सबसे कम WER वाला मॉडल बताया गया है, जिसका WER 1.5% है।
वेंडर के मूल्यांकन से आगे, WER का प्रोडक्ट स्तर पर वास्तविक प्रभाव पड़ता है। 12% WER वाला मेडिकल ट्रांसक्रिप्शन सॉफ़्टवेयर मरीज के रिकॉर्ड में गंभीर गलतियाँ ला सकता है। कस्टमर सपोर्ट कॉल में गलत ट्रांसक्रिप्शन से आगे चलकर गलत सेंटिमेंट एनालिसिस या खराब कैटेगराइज़ेशन जैसी समस्याएँ हो सकती हैं।
इन उपयोग-केस से जुड़ी समस्याओं के अलावा, जब ASR सिस्टम विफल होते हैं, तो सबसे ज़्यादा असर अक्सर उन लोगों पर पड़ता है जिनके लिए बोली गई सामग्री तक पहुँचने का ट्रांसक्रिप्ट ही एकमात्र तरीका होता है। World Wide Web Consortium अधिक संदर्भ के लिए, एक्सेसिबिलिटी पहलों से अपेक्षित न्यूनतम मानकों पर विस्तृत दस्तावेज़ उपलब्ध कराता है।
वर्ड एरर रेट की गणना कैसे करें: फ़ॉर्मूला और उदाहरण
स्टेप्स जानने के बाद वर्ड एरर रेट की गणना आसान है। जैसा ऊपर बताया गया है, आप WER = (S + D + I) / N फ़ॉर्मूला इस्तेमाल करेंगे। सभी शब्दों का विवरण ऊपर है, लेकिन त्वरित संदर्भ के लिए ये सब्स्टिट्यूशन, डिलीशन, इंसर्शन और ट्रांसक्रिप्शन में कुल शब्दों के लिए N हैं।
WER की गणना ऐसे करें:
- रेफरेंस ट्रांसक्रिप्ट बनाएं: किसी ऑडियो क्लिप का सटीक ट्रांसक्रिप्शन बनाने के लिए मानव ट्रांसक्रिप्शन और वेरिफ़िकेशन का उपयोग करें।
- अपने STT टूल का इस्तेमाल करें: ऑडियो क्लिप को ट्रांसक्राइब करने के लिए ASR प्लेटफ़ॉर्म का उपयोग करें। इससे बना AI ट्रांसक्रिप्ट आपके टेस्ट के रूप में इस्तेमाल होगा।
- दोनों वर्ज़न को अलाइन करें: एडिट की न्यूनतम संख्या जानने के लिए डायनेमिक प्रोग्रामिंग (खास तौर पर लेवेनश्टाइन एल्गोरिदम) का उपयोग करें। हम आगे के सेक्शन में इस एल्गोरिदम को और विस्तार से समझाएंगे।
- फ़ॉर्मूला लागू करें: AI से बने वर्ज़न की गलतियों की कुल संख्या को मानव-सत्यापित कॉपी से मिलाकर गिनें, फिर सटीक WER निकालने के लिए WER = (S + D + I) / N का उपयोग करें।
कागज़ पर यह काफ़ी तकनीकी लग सकता है, लेकिन व्यवहार में यह बहुत आसान है। इसका मतलब समझाने के लिए यहाँ एक उदाहरण दिया गया है।
रेफरेंस ट्रांसक्रिप्ट: मिसेज़ डैलोवे ने कहा कि वह फूल खुद खरीदेंगी।
ASR आउटपुट: मिस डैलोवे ने कहा कि वह फूल खरीदेंगी।
कुल गलतियों की गणना करें, तो 9 कुल शब्दों में 1 S और 1 D है।
फ़ॉर्मूला इस्तेमाल करने पर मिलता है: WER = 2 / 9 = 0.222 = 22.2%।
Python के साथ वर्ड एरर रेट की गणना
हालाँकि मैन्युअल तरीका अच्छी तरह काम करता है, लेकिन Python के साथ WER की गणना करके आप समय बचा सकते हैं। jiwer लाइब्रेरी यह सब पूरी तरह अपने-आप संभालती है।
jiwer के दस्तावेज़ का उपयोग करके आप यह पैकेज इंस्टॉल कर सकते हैं, जो खास तौर पर ASR सिस्टम का मूल्यांकन करने और WER जैसे मुख्य मेट्रिक बनाने के लिए तैयार किया गया है। डाउनलोड होने के बाद, Python के साथ तेज़ी से WER की गणना करने के लिए नीचे दिया गया कोड इस्तेमाल करें:
ध्यान दें कि इस उदाहरण में ASR आउटपुट मूल रेफरेंस से दो जगह अलग है। शब्द ‘jumps’ को गलत तरीके से ‘leaps’ (एक सब्स्टिट्यूशन) के रूप में ट्रांसक्राइब किया गया और ‘lazy’ से पहले ‘last’ (एक इंसर्शन) जोड़ा गया। रेफरेंस ट्रांसक्रिप्ट के नौ शब्दों में दो गलतियों के साथ, वर्ड एरर रेट (WER) 0.222 या 22.2% आता है।
वर्ड एरर रेट और दूसरे रिकग्निशन मेट्रिक की तुलना
हालाँकि ASR में सटीकता की गणना के लिए WER मानक मेट्रिक है, लेकिन आप दूसरे टूल भी इस्तेमाल कर सकते हैं। उदाहरण के लिए:
- कैरेक्टर एरर रेट (CER): WER की तरह, यह शब्द स्तर के बजाय कैरेक्टर स्तर पर ट्रांसक्रिप्शन की सटीकता मापता है। यह उन भाषाओं के लिए बेहतर है जिनमें स्पष्ट शब्द सीमाएँ नहीं होतीं (scriptio continua), या ऐसे कामों के लिए जिनमें सही वर्तनी महत्वपूर्ण होती है।
- मैच एरर रेट (MER): यह ट्रांसक्रिप्शन गलतियों का अनुपात मापता है, लेकिन सब्स्टिट्यूशन, इंसर्शन और डिलीशन को WER से थोड़ा अलग तरीके से देखता है। यह वाक्य में गलतियों के अनुपात पर ध्यान देता है।
- वर्ड इन्फ़ॉर्मेशन लॉस्ट (WIL): ट्रांसक्रिप्शन के दौरान मूल जानकारी का कितना हिस्सा खो गया, इसका अनुमान। यह WER की सीधी गलती-गिनती के बजाय समझने योग्य होने का माप देता है।
- एम्बेडिंग एरर रेट (EmbER): ट्रांसक्रिप्शन के बीच सेमेंटिक विश्लेषण देता है। यह WER से आगे बढ़कर सही शब्द और गलत ट्रांसक्रिप्शन के बीच की सेमेंटिक दूरी की जानकारी देता है।
हर मेट्रिक अलग परिस्थिति के लिए सबसे उपयुक्त है। संदर्भ के लिए यहाँ एक टेबल दी गई है:
लेवेनश्टाइन दूरी के उदाहरण: WER के पीछे का गणित
वर्ड एरर रेट असल में मूल और हाइपोथेसिस आउटपुट के बीच की दूरी का माप है। इस अंतर को गणितीय रूप से समझने के लिए हम लेवेनश्टाइन दूरी का उपयोग करते हैं।
लेवेनश्टाइन दूरी एक सीक्वेंस को दूसरे में बदलने के लिए आवश्यक सिंगल-यूनिट एडिट की न्यूनतम संख्या गिनती है। WER में इसका मतलब खास तौर पर सब्स्टिट्यूशन, इंसर्शन और डिलीशन वाले एडिट हैं। उदाहरण के लिए, अगर हमें Cat को Mat में बदलना हो, तो एक अक्षर ‘C’ को ‘M’ से बदलना होगा। इस तरह लेवेनश्टाइन दूरी 1 होगी।
CER की गणना में यह ज़्यादा दिखता है, लेकिन WER लेवेनश्टाइन दूरी को शब्द स्तर तक बढ़ाता है। हर यूनिट कैरेक्टर के बजाय पूरा शब्द होता है और वास्तविक दूरी बताती है कि हमारे ASR आउटपुट को सटीक मूल में बदलने के लिए कितने शब्द एडिट करने होंगे।
हम एक मैट्रिक्स बनाते हैं, जिसमें हर सेल मूल ट्रांसक्रिप्ट और ASR ट्रांसक्रिप्ट के बीच की कुल दूरी दिखाता है। लेवेनश्टाइन दूरी फिर मैट्रिक्स को ऊपर-बाएँ से नीचे-दाएँ भरती है और अंतिम सेल शब्द-स्तर के एडिट की कुल संख्या देता है। उस संख्या को N से विभाजित करने पर आपका WER मिलता है।
हालाँकि इस मैट्रिक्स की गणना आम तौर पर अलग-अलग कैरेक्टर के साथ की जाती है, लेकिन सरलता के लिए यहाँ हमारे पिछले उदाहरण का बड़ा रूप दिया गया है।

वर्ड एरर रेट से जुड़ी आम गलतफहमियाँ और समस्याएँ
खास तौर पर जब STT APIs ज़्यादा सुलभ हो रही हैं और ASR सॉफ़्टवेयर व्यापक एजेंट स्टैक का सामान्य हिस्सा बन रहा है, तो हमें अलग-अलग टूल के बीच बहुत सी तुलनाएँ देखने को मिलेंगी।
अपनी वर्ड एरर रेट की गणना करने से पहले, कुछ आम समस्याओं और गलतफहमियों को समझना ज़रूरी है।
- सभी गलतियाँ बराबर हैं: WER हर गलती को समान रूप से महत्वपूर्ण मानता है। कई संदर्भों में यह ठीक हो सकता है, लेकिन कुछ उपयोग के मामलों में यह स्वीकार्य नहीं है। उदाहरण के लिए, अस्पताल में 5% एरर, जिसे अच्छा WER माना जाएगा, फिर भी समझ से बाहर हो सकता है, क्योंकि एक या दो गलतियाँ भी मरीज को जोखिम में डाल सकती हैं। इस सीमा के कारण सेमेंटिक वर्ड एरर रेट (SWER) जैसे नए मेट्रिक बने हैं, जो यह मापने की कोशिश करते हैं कि वाक्य का अर्थ सुरक्षित रहा या नहीं, न कि हर शब्द बिल्कुल मेल खाता है या नहीं।
- WER 100% से ऊपर जा सकता है: हालाँकि हमने पहले बताया था कि WER 0 और 1 के बीच होता है, फिर भी आपको 100% से अधिक WER मिल सकता है। ऐसा इसलिए है क्योंकि इंसर्शन की गलती, मूल ट्रांसक्रिप्ट के कुल शब्दों से ज़्यादा शब्द बना सकती है। इसका एक आम उदाहरण ‘I’m’ को ‘I am’ के रूप में ट्रांसक्राइब करना है, जहाँ एक शब्द दो बन जाते हैं।
- तकनीकी रूप से, कम WER हमेशा बेहतर नहीं होता:कागज़ पर 5% WER, 10% WER से बेहतर है। लेकिन अगर 5% में शामिल गलतियों ने वाक्य का संदर्भ काफ़ी बदल दिया हो और 10% वाली गलतियों ने ऐसा न किया हो, तो पूरी तस्वीर सामने नहीं आती। संदर्भ यहाँ भी बहुत मायने रखता है। इस सेमेंटिक प्रभाव को पकड़ने के लिए ही SWER जैसे मेट्रिक विकसित किए जा रहे हैं।
2024 में Apple ने एक दिलचस्प अध्ययन प्रकाशित किया, जिसमें ऊपर बताए गए आखिरी बिंदु को देखा गया। जब लोगों ने यह देखते हुए 9.4% WER की गणना का आकलन किया कि ASR पढ़ने योग्य था या नहीं, तो उन्होंने उसी अंश को सिर्फ़ 2.2% WER दिया। जिस उदाहरण का परीक्षण किया गया था, उसमें लोगों ने कई मामलों में ‘गलतियों’ को महत्वहीन माना, जिससे ह्यूमन WER मशीनों की तुलना में 4 गुना से अधिक उदार रहा।
WER के लिए उद्योग बेंचमार्क
आदर्श WER काफी हद तक उस उद्योग या उपयोग के मामले पर निर्भर करता है, जिसमें आप ASR तकनीक इस्तेमाल कर रहे हैं। हालाँकि WER के लिए <5% उद्योग बेंचमार्क है, मेडिकल या कानूनी ट्रांसक्रिप्शन जैसे खास उद्योगों को इससे बहुत कम दर चाहिए।
Artificial Analysis के जुलाई 2026 के अध्ययन में ElevenLabs के Scribe v2 ने 1.5% WER स्कोर किया। हालाँकि, यह याद रखना ज़रूरी है कि ये आँकड़े आमतौर पर प्राथमिक भाषा के रूप में अंग्रेज़ी के आधार पर तैयार किए जाते हैं। दूसरी भाषाओं में STT तकनीक उतनी प्रभावी नहीं हो सकती।
ElevenLabs Docs में सामान्य WER रेंज का विवरण उन सभी भाषाओं के लिए दिया गया है, जिन्हें Scribe v1 और Scribe v2 सपोर्ट करते हैं।
रिकग्निशन सटीकता बढ़ाने के लिए ElevenAPI से शुरुआत करें
जब आप ऐसा ऐप्लिकेशन या प्रोडक्ट बना रहे हों जहाँ ट्रांसक्रिप्शन की गुणवत्ता मायने रखती हो, तो अच्छी तरह चुनी गई ASR API और सामान्य API के बीच का अंतर पहले आपके WER में और फिर आपके यूज़र के अनुभव में दिखता है।
ElevenLabs Scribe, स्पीच टू टेक्स्ट लेयर है, जो ElevenAPI के ज़रिए उपलब्ध है। 90+ भाषाओं और उद्योग में अग्रणी WER के साथ, इसमें स्पीकर डायरीकरण, शब्द-स्तरीय टाइमस्टैम्प, कीटर्म प्रॉम्प्टिंग और एंटिटी डिटेक्शन जैसे फ़ीचर भी मिलते हैं।
ElevenLabs Docs में ElevenAPI के बारे में और जानें या साइन अप करके आज ही शुरुआत करें।




