कंटेंट पर जाएं

Scribe v2 Medical अब सभी के लिए उपलब्ध है

लेखक
Min Kim
प्रकाशित

सुनेंइस आर्टिकल को सुनें

क्लिनिकल ऑडियो, सटीक स्पीच रिकग्निशन की सबसे कठिन परीक्षाओं में से एक है। दवाओं के नाम लंबे, दुर्लभ और आसानी से गड़बड़ होने वाले होते हैं (hydroxyzine और hydralazine में सिर्फ़ एक गलत सुना गया शब्दांश का अंतर है)। शब्दावली भी सघन होती है, जिसमें डोज़, यूनिट, शरीर-रचना और पैथोलॉजी के शब्द तेज़ी से लगातार आ सकते हैं। दांव भी ज़्यादा हैं, क्योंकि ट्रांसक्रिप्शन की गलती से मरीज़ की देखभाल प्रभावित हो सकती है।

इसीलिए ElevenLabs आज जारी कर रहा है Scribe v2 मेडिकल, हमारा क्लिनिकल ऑडियो के लिए फ़ाइन-ट्यून किया गया स्पीच टू टेक्स्ट मॉडल, जो अब ElevenAPI पर सभी के लिए उपलब्ध है। ElevenLabs के टेस्ट में, यह मेडिकल ASR बेंचमार्क पर सबसे कम वर्ड एरर रेट (WER) हासिल करता है और हमारे बेस Scribe v2 मॉडल की तुलना में क्लिनिकल ऑडियो पर WER को 18% कम करता है।

जनरल-पर्पज़ मॉडल रोज़मर्रा की बातचीत संभालने में अच्छे होते हैं, लेकिन जहां क्लिनिकल वर्कफ़्लो को उनकी सबसे ज़्यादा ज़रूरत होती है, वहां उनका प्रदर्शन कमज़ोर पड़ जाता है। हमने सार्वजनिक बेंचमार्क पर, जिन्हें कोई भी दोहरा सकता है, दवाओं के नामों और क्लिनिकल डिक्टेशन पर केंद्रित Scribe v2 का मेडिकल फ़ाइन-ट्यून प्रशिक्षित किया।

क्लिनिकल उपयोग के मामलों के लिए Scribe v2 Medical एक स्पष्ट विकल्प है 

Eka Medical ASR बेंचमार्क

आंतरिक टेस्ट में, Scribe v2 Medical ने ElevenLabs के टेस्ट में प्रकाशित हर नतीजे से कम WER हासिल किया Eka Medical ASR बेंचमार्क पर। इस मूल्यांकन डेटासेट में 3,619 अंग्रेज़ी क्लिनिकल ऑडियो सैंपल हैं — अलग-अलग दवा और स्थिति के नाम, क्लिनिकल वाक्य, और क्लिनिशियन व मरीज़ों की बातचीत सहित — जिनमें हर टर्म के लिए एनोटेशन और डेटासेट कार्ड पर प्रकाशित लीडरबोर्ड शामिल है। 

Eka

Omi Health मेडिकल स्पीच टू टेक्स्ट बेंचमार्क

प्रदर्शन सिर्फ़ एक बेंचमार्क तक सीमित नहीं है। Omi हेल्थ के पास 30 स्पीच टू टेक्स्ट सिस्टम का एक सार्वजनिक लीडरबोर्ड है, जिन्हें 1,513 क्लिनिकल अंग्रेज़ी क्लिप्स (57 परामर्शों में 7.2 घंटे) पर स्कोर किया गया है।

Omi ने इस बेंचमार्क पर Scribe v2 Medical का सीधे मूल्यांकन किया। टेस्ट किए गए सभी 30 सिस्टम में इसका ओवरऑल WER सबसे कम है (5.88%), और यह बेस Scribe v2 की तुलना में डोज़ की सटीकता में काफ़ी सुधार करता है (86.2% बनाम 79.8%)। 

Omi का बेंचमार्क 25 सितंबर को Scribe v2 Medical के नतीजों के साथ अपडेट होगा, और ऊपर दिए गए आंकड़े उस अपडेट से पहले उनकी अनुमति से साझा किए गए हैं।

प्रोडक्शन में ग्राहक

ग्राहक पहले से ही प्रोडक्शन में Scribe v2 Medical इस्तेमाल कर रहे हैं और क्लिनिकल ऑडियो में सुधार देख रहे हैं।

"Deepgram से ElevenLabs Scribe v2 Medical पर स्विच करने के बाद, क्लिनिकल टर्मिनोलॉजी पर हमें कहीं ज़्यादा सटीकता मिल रही है, और इससे टीम के काम करने का तरीका बदल गया है," CareCo के सीईओ और संस्थापक Mendel Erlenwein ने कहा। "जब हमारे कोऑर्डिनेटर ट्रांसक्रिप्ट पर भरोसा कर पाते हैं, तो वे नोट्स ठीक करने में कम समय और मरीज़ों से फोन पर बात करने में ज़्यादा समय दे सकते हैं। हमारे मरीज़ जटिल उपचार-पद्धतियों पर हैं, और केयर टीम जो नोट पढ़ती है, उसका सही होना ज़रूरी है।"

जो सुधार सबसे ज़्यादा मायने रखते हैं

पूरे ट्रांसक्रिप्ट का WER कभी-कभी क्लिनिकल सेटिंग में सबसे अहम बात छिपा सकता है, क्योंकि क्लिनिकल बातचीत भी मुख्य रूप से सामान्य बोलचाल से बनी होती है। Eka हर सैंपल में मेडिकल टर्म को एनोटेट करता है, इसलिए सिर्फ़ उन टर्म पर स्कोर करना संभव है। सिर्फ़ मेडिकल टर्म के WER में, Scribe v2 Medical बेस मॉडल की तुलना में 14% कम गलतियां करता है (9.5% बनाम 11.1%), और सबसे बड़ा सुधार तब दिखता है जब टर्म पूरे वाक्यों में आते हैं (7.5% बनाम 9.9%)।

Fine-tuning lowers medical term error rates overall and in clinical sentences, but not conversation.

इसी डेटा से एक सावधानी यह भी सामने आती है कि अलग-अलग एक-शब्द वाले क्लिप (बिना किसी आसपास के संदर्भ के बोला गया सिर्फ़ एक दवा का नाम) Scribe v2 Medical समेत लीडरबोर्ड के हर मॉडल के लिए सबसे कठिन स्थिति बने हुए हैं। अलग-थलग टर्म पर इसका WER 14.3% था, जबकि यही टर्म वाक्यों में आने पर 7.5% था। बिल्कुल संदर्भ न होने पर, गलत सुना गया शब्दांश यादगार गलतियां पैदा कर सकता है:

  • etodolac (एक NSAID) → "It'll do the luck"
  • levomilnacipran (एक एंटीडिप्रेसेंट) → "Leave me alone now, Sephora."
  • methdilazine (एक एंटीहिस्टामिन) → "Let's play our scene."

इन गलतियों को कम करने का एक तरीका है कीटर्म प्रॉम्प्टिंग, जिससे आप दवाओं के नाम या मेडिकल वाक्यांशों को हाइलाइट कर सकते हैं, ताकि मॉडल उनके सफल ट्रांसक्रिप्शन की ओर झुके।

मुख्य बेंचमार्क से आगे

v2 Medical की सटीकता सिर्फ़ अंग्रेज़ी तक सीमित नहीं है। 

पर Corti का MedDictate बेंचमार्क, जो एक सार्वजनिक क्लिनिकल डिक्टेशन डेटासेट है, Scribe v2 Medical बेस Scribe v2 मॉडल की तुलना में WER को लगभग 36% कम करता है, और यह सुधार तीनों भाषाओं में बना रहता है:

Error rates are lower with Scribe v2 Medical than Scribe v2 across all languages.

टीम ने यह भी सत्यापित किया कि मेडिकल फ़ाइन-ट्यून दूसरे क्षेत्रों के प्रदर्शन को कम नहीं करता। CommonVoice से लिए गए रोज़मर्रा के गैर-मेडिकल भाषण के 6,000 सैंपल पर, राउंड करने पर Scribe v2 Medical का स्कोर बेस Scribe v2 के बराबर है — दोनों में 5.3% WER। इसलिए v2 Medical के साथ आपको एक विशेष मेडिकल मॉडल के फ़ायदे मिलते हैं — बिना इस बेंचमार्क पर सटीकता खोए।

सुरक्षित स्वास्थ्य जानकारी के लिए बनाया गया

Scribe v2 Medical उन एंटरप्राइज़ ग्राहकों के लिए HIPAA-eligible है, जिनके पास Business Associate Agreements (BAA) हैं और ज़ीरो रिटेंशन मोड (ZRM) सक्षम है।

स्पीच टू टेक्स्ट API अनुरोधों के लिए ZRM सक्षम होने पर, हर अनुरोध पूरा होते ही ऑडियो इनपुट और टेक्स्ट आउटपुट तुरंत हटा दिए जाते हैं। ElevenLabs इनमें से किसी को भी सुरक्षित नहीं रखता, और आपके एप्लिकेशन को पूरा API रिस्पॉन्स मिलता है तथा ट्रांसक्रिप्ट कैसे रखे जाएं, इसका नियंत्रण आपके पास होता है।

शुरू करें

Scribe v2 Medical स्पीच टू टेक्स्ट API पर उपलब्ध है। बस नया मॉडल id पास करें: scribe_v2_medical

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({ apiKey: "YOUR_API_KEY" });

const fileData = await fs.promises.readFile("clinical_audio.mp3");

const transcription = await elevenlabs.speechToText.convert({
  file: new Blob([fileData], { type: "audio/mp3" });,
  modelId: "scribe_v2_medical",
});

console.log(transcription.text);

मॉडल बैच स्पीच टू टेक्स्ट एंडपॉइंट पर चलता है। 

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं