कॉन्टेंट पर जाएं

वर्ड एरर रेट (WER): मुख्य बातें, फॉर्मूला और उपयोग

लेखक
Jack Limebear
प्रकाशित

सुनेंइस आर्टिकल को सुनें

सिद्धांत रूप में, वर्ड एरर रेट (WER) ऑटोमैटिक स्पीच रिकग्निशन (ASR) टूल की सटीकता मापने का एक तरीका है। कम WER का मतलब है कि आपकी फाइनल ट्रांसक्रिप्ट ज़्यादा सही है, जबकि ज़्यादा एरर रेट गलत ट्रांसक्रिप्शन दिखाता है।

असल में, WER का फर्क इतना बड़ा हो सकता है कि मेडिकल ट्रांसक्रिप्शन सॉफ्टवेयर 'फिफ्टीन मिलीग्राम' और 'फिफ्टी मिलीग्राम' लिख दे। यह उस गैप को दिखाता है जहाँ एक सपोर्ट टूल ग्राहक की ज़रूरतें सही ट्रांसक्राइब करता है और दूसरा यूज़र को निराश कर देता है।

इस आर्टिकल में, हम बताएंगे कि WER क्या है, इसे कैसे कैलकुलेट करें, और अपने ASR प्रोवाइडर को बेंचमार्क करने के लिए इसका इस्तेमाल कैसे करें।

सारांश

  • वर्ड एरर रेट तीन तरह की गलतियों—सब्स्टीट्यूशन, डिलीशन और इंसर्शन—को गिनता है, और इन्हें रेफरेंस ट्रांसक्रिप्ट के शब्दों की संख्या से भाग देता है।
  • WER का फॉर्मूला है WER = (S + D + I) / N.
  • कम WER स्कोर का मतलब है कि फाइनल आउटपुट ज़्यादा सही है।
  • 5% से कम WER अच्छा बेंचमार्क है, लेकिन लीगल या मेडिकल ट्रांसक्रिप्शन में इससे भी कम वर्ड एरर रेट की ज़रूरत हो सकती है।
  • WER सभी गलतियों को बराबर मानता है, यानी यह संदर्भ के हिसाब से परफेक्ट मेट्रिक नहीं है। नए मेट्रिक्स जैसे सेमांटिक वर्ड एरर रेट (SWER) यह देखने की कोशिश करते हैं कि क्या बोले गए वाक्य का मतलब सही रहा या नहीं।

वर्ड एरर रेट क्या है?

वर्ड एरर रेट (WER) स्पीच टू टेक्स्ट मॉडल्स में स्पीच रिकग्निशन की सटीकता मापने का स्टैंडर्ड तरीका है। यह 0-1 के बीच एक वैल्यू होती है (0.8 मतलब 80% एरर रेट) जो दिखाती है कि STT सिस्टम ने ट्रांसक्राइब करते समय क्या गलत किया, जिसमें सब्स्टीट्यूशन, डिलीशन और इंसर्शन शामिल हैं।

सब्स्टीट्यूशन तब होती है जब कोई शब्द गलत शब्द से बदल दिया जाता है। डिलीशन तब होती है जब कोई शब्द पूरी तरह छूट जाता है। इंसर्शन तब होती है जब ट्रांसक्रिप्ट में कोई ऐसा शब्द जुड़ जाता है जो बोला ही नहीं गया था। WER इन तीनों को जोड़कर सही ट्रांसक्रिप्ट के शब्दों की संख्या से भाग देता है, जिससे आप अलग-अलग वेंडर्स की तुलना कर सकते हैं।

यह रहा WER का फॉर्मूला:

WER = (S + D + I) / N

जहाँ:

  • S: सब्स्टीट्यूशन (शब्द गलत है)
  • D: डिलीशन (शब्द गायब है)
  • I: इंसर्शन (अतिरिक्त शब्द है)
  • N: रेफरेंस ट्रांसक्रिप्ट में कुल शब्द

आप WER को दशमलव या प्रतिशत दोनों में दिखा सकते हैं। जितना कम WER, उतना बेहतर आपका स्कोर, क्योंकि मॉडल ने कम गलतियाँ कीं।

असल में, 10% WER का मतलब है कि आपकी मीटिंग ट्रांसक्रिप्ट के हर 10 में से 1 शब्द को दोबारा देखना ज़रूरी है।

स्पीच रिकग्निशन सिस्टम्स में वर्ड एरर रेट क्यों मायने रखता है?

वर्ड एरर रेट एक ऑब्जेक्टिव मेट्रिक देता है जिससे टीमें अलग-अलग प्रोवाइडर्स की तुलना कर सकती हैं। यह किसी भी मार्केटिंग दावे से हटकर मॉडल की सटीकता को साफ दिखाता है। सबूत के साथ, कोई भी एंटरप्राइज अपने ऑप्शन्स को अच्छे से देख सकता है कि कौन से मॉडल इस फील्ड में आगे हैं।

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

स्रोत:आर्टिफिशियल एनालिसिस 10 जुलाई, 2026 को एक्सेस किया गया।

जुलाई 2026 तक, स्वतंत्र रिसर्च आर्टिफिशियल एनालिसिस ने ElevenLabs के Scribe v2 को AA-AgentTalk डाटासेट पर नॉन-स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल्स में सबसे कम WER (1.5%) के साथ इंडस्ट्री में टॉप पर रखा है।

वेंडर इवैल्यूएशन से आगे, WER का प्रोडक्ट लेवल पर भी असली असर होता है। मेडिकल ट्रांसक्रिप्शन सॉफ्टवेयर में 12% WER मरीज की रिपोर्ट में गंभीर गलतियाँ ला सकता है। कस्टमर सपोर्ट कॉल में गलत ट्रांसक्रिप्शन से बाद में सेंटिमेंट एनालिसिस या कैटेगराइजेशन में भी गड़बड़ी हो सकती है।

इन यूज़-केस से जुड़ी समस्याओं के अलावा, जब ASR सिस्टम फेल होते हैं, तो सबसे ज़्यादा असर उन लोगों पर पड़ता है जिनके लिए ट्रांसक्रिप्ट ही बोली गई बात सुनने का एकमात्र तरीका है।वर्ल्ड वाइड वेब कंसोर्टियम एक्सेसिबिलिटी इनिशिएटिव्स के लिए अपेक्षित न्यूनतम मानकों पर विस्तार से जानकारी देता है।

वर्ड एरर रेट कैसे कैलकुलेट करें: फॉर्मूला और उदाहरण

वर्ड एरर रेट कैलकुलेट करना आसान है अगर आपको स्टेप्स पता हों। जैसा ऊपर बताया गया, फॉर्मूला है WER = (S + D + I) / N. सभी टर्म्स ऊपर समझाए गए हैं, लेकिन जल्दी से याद रखने के लिए ये सब्स्टीट्यूशन, डिलीशन, इंसर्शन और N (कुल शब्द) हैं।

WER ऐसे कैलकुलेट करें:

  1. रेफरेंस ट्रांसक्रिप्ट बनाएं: ऑडियो क्लिप की सही ट्रांसक्रिप्शन के लिए ह्यूमन ट्रांसक्रिप्शन और वेरिफिकेशन का इस्तेमाल करें।
  2. अपना STT टूल इस्तेमाल करें: ऑडियो क्लिप को ट्रांसक्राइब करने के लिए ASR प्लेटफॉर्म का इस्तेमाल करें, जिससे आपको AI ट्रांसक्रिप्ट मिलेगा जिसे आप टेस्ट के लिए इस्तेमाल करेंगे।
  3. दोनों वर्ज़न को अलाइन करें: मिनिमम एडिट्स पता करने के लिए डायनामिक प्रोग्रामिंग (खासकर Levenshtein एल्गोरिदम) का इस्तेमाल करें। हम इस एल्गोरिदम को आगे विस्तार से बताएंगे।
  4. फॉर्मूला लगाएं:AI से बनी ट्रांसक्रिप्ट में कुल गलतियाँ गिनें और ह्यूमन-वेरिफाइड कॉपी से तुलना करें, फिर WER = (S + D + I) / N से सही WER निकालें।

यह कागज़ पर थोड़ा टेक्निकल लग सकता है, लेकिन असल में यह काफी आसान है। यह उदाहरण देखें:

रेफरेंस ट्रांसक्रिप्ट:Mrs. Dalloway ने कहा कि वह खुद फूल खरीदेंगी।

ASR आउटपुट:Miss Dalloway ने कहा कि वह खुद फूल खरीदेंगी।

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

अगर हम कुल गलतियाँ गिनें, तो हमारे पास 1 S और 1 D है, कुल 9 शब्दों में।

फॉर्मूला लगाने पर: WER = 2 / 9 = 0.222 = 22.2%

Python के साथ वर्ड एरर रेट कैलकुलेट करना

मैन्युअल तरीका अच्छा है, लेकिन आप python से WER कैलकुलेट करके समय बचा सकते हैं।jiwer लाइब्रेरी यह सब अपने आप संभाल लेती है।

jiwer डाक्यूमेंटेशन की मदद से आप यह पैकेज इंस्टॉल कर सकते हैं, जो खास तौर पर ASR सिस्टम का मूल्यांकन करने और WER जैसे मुख्य मेट्रिक्स निकालने के लिए बना है। डाउनलोड करने के बाद, आप नीचे दिया गया कोड python में जल्दी से WER निकालने के लिए इस्तेमाल कर सकते हैं:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

ध्यान दें कि इस उदाहरण में ASR आउटपुट दो जगहों पर ओरिजिनल रेफरेंस से अलग है। 'jumps' को गलत तरीके से 'leaps' ट्रांसक्राइब किया गया (सब्स्टीट्यूशन) और 'last' को 'lazy' से पहले जोड़ा गया (इंसर्शन)। रेफरेंस ट्रांसक्रिप्ट के 9 शब्दों में दो गलतियों के साथ, वर्ड एरर रेट (WER) 0.222 या 22.2% है।

वर्ड एरर रेट और अन्य रिकग्निशन मेट्रिक्स की तुलना

जहाँ WER ASR में सटीकता मापने का स्टैंडर्ड तरीका है, वहीं कुछ और टूल्स भी हैं जिनका आप इस्तेमाल कर सकते हैं। जैसे:

  • कैरेक्टर एरर रेट (CER): WER की तरह ही, यह शब्दों की बजाय अक्षरों के स्तर पर ट्रांसक्रिप्शन की सटीकता मापता है। यह उन भाषाओं के लिए अच्छा है जहाँ शब्दों की सीमाएँ स्पष्ट नहीं होतीं या स्पेलिंग-सेंसिटिव टास्क्स के लिए।
  • मैच एरर रेट (MER): ट्रांसक्रिप्शन की गलतियों का अनुपात मापता है, लेकिन सब्स्टीट्यूशन, इंसर्शन और डिलीशन को WER से थोड़ा अलग तरीके से गिनता है। यह वाक्य में गलतियों के अनुपात पर फोकस करता है।
  • वर्ड इंफॉर्मेशन लॉस्ट (WIL): यह मापता है कि ट्रांसक्रिप्शन के दौरान ओरिजिनल जानकारी का कितना हिस्सा खो गया, जिससे समझदारी का अंदाजा मिलता है, न कि WER की तरह सीधा एरर काउंट।
  • एम्बेडिंग एरर रेट (EmbER): ट्रांसक्रिप्शन के बीच सेमांटिक एनालिसिस देता है। यह WER से आगे जाकर सही शब्द और गलत ट्रांसक्रिप्शन के बीच सेमांटिक दूरी दिखाता है।

इनमें से हर मेट्रिक अलग-अलग सिचुएशन के लिए सबसे अच्छा है। यहाँ एक टेबल है जिसे आप रेफरेंस के लिए देख सकते हैं:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Levenshtein डिस्टेंस के उदाहरण: WER के पीछे का गणित

वर्ड एरर रेट असल में ओरिजिनल और हाइपोथेसिस आउटपुट के बीच की दूरी मापता है। इस फर्क को गणितीय रूप से समझने के लिए हम Levenshtein डिस्टेंस का इस्तेमाल करते हैं।

Levenshtein डिस्टेंस गिनता है कि एक सीक्वेंस को दूसरे में बदलने के लिए कम से कम कितने सिंगल-यूनिट एडिट्स चाहिए। WER के लिए इसका मतलब है—सब्स्टीट्यूशन, इंसर्शन और डिलीशन। जैसे, अगर हमें Cat को Mat में बदलना है, तो 'C' को 'M' से बदलना होगा, यानी Levenshtein डिस्टेंस 1 है।

आप CER कैलकुलेशन में यह ज़्यादा देखेंगे, लेकिन WER Levenshtein डिस्टेंस को शब्द स्तर पर स्केल करता है। यहाँ हर यूनिट एक पूरा शब्द होता है, जिससे पता चलता है कि हमारे ASR आउटपुट को सही ओरिजिनल में बदलने के लिए कितने शब्द बदलने होंगे।

हम एक मैट्रिक्स बनाते हैं जहाँ हर सेल ओरिजिनल ट्रांसक्रिप्ट और ASR ट्रांसक्रिप्ट के बीच कुल दूरी दिखाता है। Levenshtein डिस्टेंस फिर टॉप-लेफ्ट से बॉटम-राइट तक मैट्रिक्स भरता है, और आखिरी सेल आपको कुल वर्ड-लेवल एडिट्स देता है। इस नंबर को N से भाग देने पर आपका WER निकलता है।

यह मैट्रिक्स आमतौर पर अक्षरों के साथ कैलकुलेट किया जाता है, लेकिन यहाँ हमारे पिछले उदाहरण का स्केल्ड-अप वर्ज़न है ताकि समझना आसान हो।

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

वर्ड एरर रेट से जुड़ी आम गलतफहमियाँ और समस्याएँ

खासकर जबSTT API ज़्यादा सुलभ हो रहे हैं और ASR सॉफ्टवेयर एजेंट स्टैक्स का आम हिस्सा बन रहे हैं, तो अलग-अलग टूल्स की तुलना ज़्यादा देखने को मिलेगी।

अपना खुद का वर्ड एरर रेट निकालने से पहले, कुछ आम समस्याएँ और गलतफहमियाँ हैं जिन्हें आपको समझना चाहिए।

  • सभी गलतियाँ बराबर मानी जाती हैं: WER हर गलती को उतना ही महत्वपूर्ण मानता है। कई बार यह ठीक है, लेकिन कुछ मामलों में यह स्वीकार्य नहीं है। जैसे, अस्पताल में 5% एरर जिसे अच्छा WER माना जाएगा, वह भी समझ से बाहर हो सकता है, क्योंकि एक-दो गलतियाँ भी मरीज के लिए जोखिम पैदा कर सकती हैं। इसी वजह से नए मेट्रिक्स जैसे सेमांटिक वर्ड एरर रेट (SWER) बनाए गए हैं, जो यह मापते हैं कि वाक्य का मतलब सही रहा या नहीं, न कि हर शब्द बिल्कुल मैच हुआ या नहीं।
  • WER 100% से ज़्यादा भी हो सकता है: पहले बताया गया था कि WER 0 से 1 के बीच होता है, लेकिन आप 100% से ज़्यादा WER भी देख सकते हैं। ऐसा इसलिए होता है क्योंकि इंसर्शन एरर ओरिजिनल ट्रांसक्रिप्ट से ज़्यादा शब्द बना सकता है। जैसे 'I'm' को 'I am' ट्रांसक्राइब करना, जहाँ एक शब्द दो हो जाते हैं।
  • कम WER हमेशा बेहतर नहीं होता: कागज़ पर 5% WER, 10% WER से बेहतर है। लेकिन अगर 5% में हुई गलतियाँ वाक्य का मतलब ही बदल दें और 10% में ऐसा न हो, तो पूरी कहानी नहीं दिखती। यहाँ संदर्भ बहुत मायने रखता है, और SWER जैसे मेट्रिक्स इसी सेमांटिक असर को पकड़ने के लिए बनाए गए हैं।

2024 में, Apple ने एक दिलचस्प स्टडी पब्लिश की थी जिसमें ऊपर बताई गई बात को एक्सप्लोर किया गया। जब इंसानों ने 9.4% WER के साथ ASR की पढ़ने लायकता देखी, तो उन्होंने उसी पैसेज कोसिर्फ 2.2% WER दिया। उनके उदाहरण में, इंसानों ने कई बार 'गलतियों' को मामूली माना, जिससे ह्यूमन WER मशीनों से 4 गुना ज़्यादा माफ़ करने वाला निकला।

WER के लिए इंडस्ट्री बेंचमार्क्स

आदर्श WER इस बात पर निर्भर करता है कि आप किस इंडस्ट्री या यूज़ केस में ASR टेक्नोलॉजी इस्तेमाल कर रहे हैं। जहाँ <5% WER इंडस्ट्री बेंचमार्क है, वहीं मेडिकल या लीगल ट्रांसक्रिप्शन में इससे भी कम रेट चाहिए।

आर्टिफिशियल एनालिसिस जुलाई 2026 की स्टडी में, ElevenLabs के Scribe v2 ने 1.5% WER स्कोर किया। लेकिन ध्यान रखें कि ये आंकड़े आमतौर पर इंग्लिश को प्राइमरी लैंग्वेज मानकर लिए जाते हैं। दूसरी भाषाओं में STT टेक्नोलॉजी इतनी असरदार नहीं हो सकती।

ElevenLabs Docs मेंजनरल WER बैंड्स को डिटेल में बताया गया है, जो Scribe v1 और Scribe v2 द्वारा सपोर्ट की जाने वाली सभी भाषाओं में लागू होते हैं।

रिकग्निशन सटीकता बढ़ाने के लिए ElevenAPI से शुरुआत करें

जब आप ऐसा ऐप या प्रोडक्ट बना रहे हैं जहाँ ट्रांसक्रिप्शन क्वालिटी मायने रखती है, तो एक अच्छा ASR API और एक औसत API का फर्क सबसे पहले आपके WER और फिर आपके यूज़र्स के अनुभव में दिखता है।

ElevenLabs Scribeस्पीच टू टेक्स्ट लेयर है, जोElevenAPI के ज़रिए एक्सेस की जा सकती है। 90+ भाषाओं और इंडस्ट्री-लीडिंग WER के साथ, इसमें स्पीकर डायराइज़ेशन, वर्ड-लेवल टाइमस्टैम्प्स, कीटर्म प्रॉम्प्टिंग और एंटिटी डिटेक्शन जैसी खूबियाँ भी मिलती हैं।

देखेंElevenLabs Docs ताकि ElevenAPI के बारे में और जान सकें यासाइन अप करें और शुरुआत करें।

वर्ड एरर रेट FAQ

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं