वर्ड एरर रेट (WER): मुख्य बातें, फॉर्मूला और उपयोग
- लेखक
- Jack Limebear
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
सिद्धांत रूप में, वर्ड एरर रेट (WER) ऑटोमैटिक स्पीच रिकग्निशन (ASR) टूल की सटीकता मापने का एक तरीका है। कम WER का मतलब है कि आपकी फाइनल ट्रांसक्रिप्ट ज़्यादा सही है, जबकि ज़्यादा एरर रेट गलत ट्रांसक्रिप्शन दिखाता है।
असल में, WER का फर्क इतना बड़ा हो सकता है कि मेडिकल ट्रांसक्रिप्शन सॉफ्टवेयर 'फिफ्टीन मिलीग्राम' और 'फिफ्टी मिलीग्राम' लिख दे। यह उस गैप को दिखाता है जहाँ एक सपोर्ट टूल ग्राहक की ज़रूरतें सही ट्रांसक्राइब करता है और दूसरा यूज़र को निराश कर देता है।
इस आर्टिकल में, हम बताएंगे कि WER क्या है, इसे कैसे कैलकुलेट करें, और अपने ASR प्रोवाइडर को बेंचमार्क करने के लिए इसका इस्तेमाल कैसे करें।
सारांश
- वर्ड एरर रेट तीन तरह की गलतियों—सब्स्टीट्यूशन, डिलीशन और इंसर्शन—को गिनता है, और इन्हें रेफरेंस ट्रांसक्रिप्ट के शब्दों की संख्या से भाग देता है।
- WER का फॉर्मूला है WER = (S + D + I) / N.
- कम WER स्कोर का मतलब है कि फाइनल आउटपुट ज़्यादा सही है।
- 5% से कम WER अच्छा बेंचमार्क है, लेकिन लीगल या मेडिकल ट्रांसक्रिप्शन में इससे भी कम वर्ड एरर रेट की ज़रूरत हो सकती है।
- WER सभी गलतियों को बराबर मानता है, यानी यह संदर्भ के हिसाब से परफेक्ट मेट्रिक नहीं है। नए मेट्रिक्स जैसे सेमांटिक वर्ड एरर रेट (SWER) यह देखने की कोशिश करते हैं कि क्या बोले गए वाक्य का मतलब सही रहा या नहीं।
वर्ड एरर रेट क्या है?
वर्ड एरर रेट (WER) स्पीच टू टेक्स्ट मॉडल्स में स्पीच रिकग्निशन की सटीकता मापने का स्टैंडर्ड तरीका है। यह 0-1 के बीच एक वैल्यू होती है (0.8 मतलब 80% एरर रेट) जो दिखाती है कि STT सिस्टम ने ट्रांसक्राइब करते समय क्या गलत किया, जिसमें सब्स्टीट्यूशन, डिलीशन और इंसर्शन शामिल हैं।
सब्स्टीट्यूशन तब होती है जब कोई शब्द गलत शब्द से बदल दिया जाता है। डिलीशन तब होती है जब कोई शब्द पूरी तरह छूट जाता है। इंसर्शन तब होती है जब ट्रांसक्रिप्ट में कोई ऐसा शब्द जुड़ जाता है जो बोला ही नहीं गया था। WER इन तीनों को जोड़कर सही ट्रांसक्रिप्ट के शब्दों की संख्या से भाग देता है, जिससे आप अलग-अलग वेंडर्स की तुलना कर सकते हैं।
यह रहा WER का फॉर्मूला:
WER = (S + D + I) / N
जहाँ:
- S: सब्स्टीट्यूशन (शब्द गलत है)
- D: डिलीशन (शब्द गायब है)
- I: इंसर्शन (अतिरिक्त शब्द है)
- N: रेफरेंस ट्रांसक्रिप्ट में कुल शब्द
आप WER को दशमलव या प्रतिशत दोनों में दिखा सकते हैं। जितना कम WER, उतना बेहतर आपका स्कोर, क्योंकि मॉडल ने कम गलतियाँ कीं।
असल में, 10% WER का मतलब है कि आपकी मीटिंग ट्रांसक्रिप्ट के हर 10 में से 1 शब्द को दोबारा देखना ज़रूरी है।
स्पीच रिकग्निशन सिस्टम्स में वर्ड एरर रेट क्यों मायने रखता है?
वर्ड एरर रेट एक ऑब्जेक्टिव मेट्रिक देता है जिससे टीमें अलग-अलग प्रोवाइडर्स की तुलना कर सकती हैं। यह किसी भी मार्केटिंग दावे से हटकर मॉडल की सटीकता को साफ दिखाता है। सबूत के साथ, कोई भी एंटरप्राइज अपने ऑप्शन्स को अच्छे से देख सकता है कि कौन से मॉडल इस फील्ड में आगे हैं।

स्रोत:आर्टिफिशियल एनालिसिस 10 जुलाई, 2026 को एक्सेस किया गया।
जुलाई 2026 तक, स्वतंत्र रिसर्च आर्टिफिशियल एनालिसिस ने ElevenLabs के Scribe v2 को AA-AgentTalk डाटासेट पर नॉन-स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल्स में सबसे कम WER (1.5%) के साथ इंडस्ट्री में टॉप पर रखा है।
वेंडर इवैल्यूएशन से आगे, WER का प्रोडक्ट लेवल पर भी असली असर होता है। मेडिकल ट्रांसक्रिप्शन सॉफ्टवेयर में 12% WER मरीज की रिपोर्ट में गंभीर गलतियाँ ला सकता है। कस्टमर सपोर्ट कॉल में गलत ट्रांसक्रिप्शन से बाद में सेंटिमेंट एनालिसिस या कैटेगराइजेशन में भी गड़बड़ी हो सकती है।
इन यूज़-केस से जुड़ी समस्याओं के अलावा, जब ASR सिस्टम फेल होते हैं, तो सबसे ज़्यादा असर उन लोगों पर पड़ता है जिनके लिए ट्रांसक्रिप्ट ही बोली गई बात सुनने का एकमात्र तरीका है।वर्ल्ड वाइड वेब कंसोर्टियम एक्सेसिबिलिटी इनिशिएटिव्स के लिए अपेक्षित न्यूनतम मानकों पर विस्तार से जानकारी देता है।
वर्ड एरर रेट कैसे कैलकुलेट करें: फॉर्मूला और उदाहरण
वर्ड एरर रेट कैलकुलेट करना आसान है अगर आपको स्टेप्स पता हों। जैसा ऊपर बताया गया, फॉर्मूला है WER = (S + D + I) / N. सभी टर्म्स ऊपर समझाए गए हैं, लेकिन जल्दी से याद रखने के लिए ये सब्स्टीट्यूशन, डिलीशन, इंसर्शन और N (कुल शब्द) हैं।
WER ऐसे कैलकुलेट करें:
- रेफरेंस ट्रांसक्रिप्ट बनाएं: ऑडियो क्लिप की सही ट्रांसक्रिप्शन के लिए ह्यूमन ट्रांसक्रिप्शन और वेरिफिकेशन का इस्तेमाल करें।
- अपना STT टूल इस्तेमाल करें: ऑडियो क्लिप को ट्रांसक्राइब करने के लिए ASR प्लेटफॉर्म का इस्तेमाल करें, जिससे आपको AI ट्रांसक्रिप्ट मिलेगा जिसे आप टेस्ट के लिए इस्तेमाल करेंगे।
- दोनों वर्ज़न को अलाइन करें: मिनिमम एडिट्स पता करने के लिए डायनामिक प्रोग्रामिंग (खासकर Levenshtein एल्गोरिदम) का इस्तेमाल करें। हम इस एल्गोरिदम को आगे विस्तार से बताएंगे।
- फॉर्मूला लगाएं:AI से बनी ट्रांसक्रिप्ट में कुल गलतियाँ गिनें और ह्यूमन-वेरिफाइड कॉपी से तुलना करें, फिर WER = (S + D + I) / N से सही WER निकालें।
यह कागज़ पर थोड़ा टेक्निकल लग सकता है, लेकिन असल में यह काफी आसान है। यह उदाहरण देखें:
रेफरेंस ट्रांसक्रिप्ट:Mrs. Dalloway ने कहा कि वह खुद फूल खरीदेंगी।
ASR आउटपुट:Miss Dalloway ने कहा कि वह खुद फूल खरीदेंगी।
अगर हम कुल गलतियाँ गिनें, तो हमारे पास 1 S और 1 D है, कुल 9 शब्दों में।
फॉर्मूला लगाने पर: WER = 2 / 9 = 0.222 = 22.2%
Python के साथ वर्ड एरर रेट कैलकुलेट करना
मैन्युअल तरीका अच्छा है, लेकिन आप python से WER कैलकुलेट करके समय बचा सकते हैं।jiwer लाइब्रेरी यह सब अपने आप संभाल लेती है।
jiwer डाक्यूमेंटेशन की मदद से आप यह पैकेज इंस्टॉल कर सकते हैं, जो खास तौर पर ASR सिस्टम का मूल्यांकन करने और WER जैसे मुख्य मेट्रिक्स निकालने के लिए बना है। डाउनलोड करने के बाद, आप नीचे दिया गया कोड python में जल्दी से WER निकालने के लिए इस्तेमाल कर सकते हैं:
ध्यान दें कि इस उदाहरण में ASR आउटपुट दो जगहों पर ओरिजिनल रेफरेंस से अलग है। 'jumps' को गलत तरीके से 'leaps' ट्रांसक्राइब किया गया (सब्स्टीट्यूशन) और 'last' को 'lazy' से पहले जोड़ा गया (इंसर्शन)। रेफरेंस ट्रांसक्रिप्ट के 9 शब्दों में दो गलतियों के साथ, वर्ड एरर रेट (WER) 0.222 या 22.2% है।
वर्ड एरर रेट और अन्य रिकग्निशन मेट्रिक्स की तुलना
जहाँ WER ASR में सटीकता मापने का स्टैंडर्ड तरीका है, वहीं कुछ और टूल्स भी हैं जिनका आप इस्तेमाल कर सकते हैं। जैसे:
- कैरेक्टर एरर रेट (CER): WER की तरह ही, यह शब्दों की बजाय अक्षरों के स्तर पर ट्रांसक्रिप्शन की सटीकता मापता है। यह उन भाषाओं के लिए अच्छा है जहाँ शब्दों की सीमाएँ स्पष्ट नहीं होतीं या स्पेलिंग-सेंसिटिव टास्क्स के लिए।
- मैच एरर रेट (MER): ट्रांसक्रिप्शन की गलतियों का अनुपात मापता है, लेकिन सब्स्टीट्यूशन, इंसर्शन और डिलीशन को WER से थोड़ा अलग तरीके से गिनता है। यह वाक्य में गलतियों के अनुपात पर फोकस करता है।
- वर्ड इंफॉर्मेशन लॉस्ट (WIL): यह मापता है कि ट्रांसक्रिप्शन के दौरान ओरिजिनल जानकारी का कितना हिस्सा खो गया, जिससे समझदारी का अंदाजा मिलता है, न कि WER की तरह सीधा एरर काउंट।
- एम्बेडिंग एरर रेट (EmbER): ट्रांसक्रिप्शन के बीच सेमांटिक एनालिसिस देता है। यह WER से आगे जाकर सही शब्द और गलत ट्रांसक्रिप्शन के बीच सेमांटिक दूरी दिखाता है।
इनमें से हर मेट्रिक अलग-अलग सिचुएशन के लिए सबसे अच्छा है। यहाँ एक टेबल है जिसे आप रेफरेंस के लिए देख सकते हैं:
Levenshtein डिस्टेंस के उदाहरण: WER के पीछे का गणित
वर्ड एरर रेट असल में ओरिजिनल और हाइपोथेसिस आउटपुट के बीच की दूरी मापता है। इस फर्क को गणितीय रूप से समझने के लिए हम Levenshtein डिस्टेंस का इस्तेमाल करते हैं।
Levenshtein डिस्टेंस गिनता है कि एक सीक्वेंस को दूसरे में बदलने के लिए कम से कम कितने सिंगल-यूनिट एडिट्स चाहिए। WER के लिए इसका मतलब है—सब्स्टीट्यूशन, इंसर्शन और डिलीशन। जैसे, अगर हमें Cat को Mat में बदलना है, तो 'C' को 'M' से बदलना होगा, यानी Levenshtein डिस्टेंस 1 है।
आप CER कैलकुलेशन में यह ज़्यादा देखेंगे, लेकिन WER Levenshtein डिस्टेंस को शब्द स्तर पर स्केल करता है। यहाँ हर यूनिट एक पूरा शब्द होता है, जिससे पता चलता है कि हमारे ASR आउटपुट को सही ओरिजिनल में बदलने के लिए कितने शब्द बदलने होंगे।
हम एक मैट्रिक्स बनाते हैं जहाँ हर सेल ओरिजिनल ट्रांसक्रिप्ट और ASR ट्रांसक्रिप्ट के बीच कुल दूरी दिखाता है। Levenshtein डिस्टेंस फिर टॉप-लेफ्ट से बॉटम-राइट तक मैट्रिक्स भरता है, और आखिरी सेल आपको कुल वर्ड-लेवल एडिट्स देता है। इस नंबर को N से भाग देने पर आपका WER निकलता है।
यह मैट्रिक्स आमतौर पर अक्षरों के साथ कैलकुलेट किया जाता है, लेकिन यहाँ हमारे पिछले उदाहरण का स्केल्ड-अप वर्ज़न है ताकि समझना आसान हो।

वर्ड एरर रेट से जुड़ी आम गलतफहमियाँ और समस्याएँ
खासकर जबSTT API ज़्यादा सुलभ हो रहे हैं और ASR सॉफ्टवेयर एजेंट स्टैक्स का आम हिस्सा बन रहे हैं, तो अलग-अलग टूल्स की तुलना ज़्यादा देखने को मिलेगी।
अपना खुद का वर्ड एरर रेट निकालने से पहले, कुछ आम समस्याएँ और गलतफहमियाँ हैं जिन्हें आपको समझना चाहिए।
- सभी गलतियाँ बराबर मानी जाती हैं: WER हर गलती को उतना ही महत्वपूर्ण मानता है। कई बार यह ठीक है, लेकिन कुछ मामलों में यह स्वीकार्य नहीं है। जैसे, अस्पताल में 5% एरर जिसे अच्छा WER माना जाएगा, वह भी समझ से बाहर हो सकता है, क्योंकि एक-दो गलतियाँ भी मरीज के लिए जोखिम पैदा कर सकती हैं। इसी वजह से नए मेट्रिक्स जैसे सेमांटिक वर्ड एरर रेट (SWER) बनाए गए हैं, जो यह मापते हैं कि वाक्य का मतलब सही रहा या नहीं, न कि हर शब्द बिल्कुल मैच हुआ या नहीं।
- WER 100% से ज़्यादा भी हो सकता है: पहले बताया गया था कि WER 0 से 1 के बीच होता है, लेकिन आप 100% से ज़्यादा WER भी देख सकते हैं। ऐसा इसलिए होता है क्योंकि इंसर्शन एरर ओरिजिनल ट्रांसक्रिप्ट से ज़्यादा शब्द बना सकता है। जैसे 'I'm' को 'I am' ट्रांसक्राइब करना, जहाँ एक शब्द दो हो जाते हैं।
- कम WER हमेशा बेहतर नहीं होता: कागज़ पर 5% WER, 10% WER से बेहतर है। लेकिन अगर 5% में हुई गलतियाँ वाक्य का मतलब ही बदल दें और 10% में ऐसा न हो, तो पूरी कहानी नहीं दिखती। यहाँ संदर्भ बहुत मायने रखता है, और SWER जैसे मेट्रिक्स इसी सेमांटिक असर को पकड़ने के लिए बनाए गए हैं।
2024 में, Apple ने एक दिलचस्प स्टडी पब्लिश की थी जिसमें ऊपर बताई गई बात को एक्सप्लोर किया गया। जब इंसानों ने 9.4% WER के साथ ASR की पढ़ने लायकता देखी, तो उन्होंने उसी पैसेज कोसिर्फ 2.2% WER दिया। उनके उदाहरण में, इंसानों ने कई बार 'गलतियों' को मामूली माना, जिससे ह्यूमन WER मशीनों से 4 गुना ज़्यादा माफ़ करने वाला निकला।
WER के लिए इंडस्ट्री बेंचमार्क्स
आदर्श WER इस बात पर निर्भर करता है कि आप किस इंडस्ट्री या यूज़ केस में ASR टेक्नोलॉजी इस्तेमाल कर रहे हैं। जहाँ <5% WER इंडस्ट्री बेंचमार्क है, वहीं मेडिकल या लीगल ट्रांसक्रिप्शन में इससे भी कम रेट चाहिए।
आर्टिफिशियल एनालिसिस जुलाई 2026 की स्टडी में, ElevenLabs के Scribe v2 ने 1.5% WER स्कोर किया। लेकिन ध्यान रखें कि ये आंकड़े आमतौर पर इंग्लिश को प्राइमरी लैंग्वेज मानकर लिए जाते हैं। दूसरी भाषाओं में STT टेक्नोलॉजी इतनी असरदार नहीं हो सकती।
ElevenLabs Docs मेंजनरल WER बैंड्स को डिटेल में बताया गया है, जो Scribe v1 और Scribe v2 द्वारा सपोर्ट की जाने वाली सभी भाषाओं में लागू होते हैं।
रिकग्निशन सटीकता बढ़ाने के लिए ElevenAPI से शुरुआत करें
जब आप ऐसा ऐप या प्रोडक्ट बना रहे हैं जहाँ ट्रांसक्रिप्शन क्वालिटी मायने रखती है, तो एक अच्छा ASR API और एक औसत API का फर्क सबसे पहले आपके WER और फिर आपके यूज़र्स के अनुभव में दिखता है।
ElevenLabs Scribeस्पीच टू टेक्स्ट लेयर है, जोElevenAPI के ज़रिए एक्सेस की जा सकती है। 90+ भाषाओं और इंडस्ट्री-लीडिंग WER के साथ, इसमें स्पीकर डायराइज़ेशन, वर्ड-लेवल टाइमस्टैम्प्स, कीटर्म प्रॉम्प्टिंग और एंटिटी डिटेक्शन जैसी खूबियाँ भी मिलती हैं।
देखेंElevenLabs Docs ताकि ElevenAPI के बारे में और जान सकें यासाइन अप करें और शुरुआत करें।
.webp&w=3840&q=80)

.webp&w=3840&q=80)
.webp&w=3840&q=80)
