मिलिए Scribe से
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
Scribe, हमारा पहला स्पीच टू टेक्स्ट मॉडल, दुनिया का सबसे सटीक ट्रांसक्रिप्शन मॉडल है। वास्तविक दुनिया के ऑडियो की अप्रत्याशितता को संभालने के लिए बनाया गया Scribe, 99 भाषाओं में स्पीच को ट्रांसक्राइब करता है। इसमें शब्द-स्तर के टाइमस्टैम्प, स्पीकर डायराइज़ेशन और ऑडियो-इवेंट टैगिंग शामिल हैं—और यह सब आसान इंटीग्रेशन के लिए एक संरचित रिस्पॉन्स में मिलता है।

Scribe को सटीकता के लिए तैयार किया गया है। 99 भाषाओं में FLEURS और Common Voice बेंचमार्क टेस्ट में, यह लगातार Gemini 2.0 Flash, Whisper Large V3 और Deepgram Nova-3 जैसे प्रमुख मॉडलों से बेहतर प्रदर्शन करता है। मीटिंग सारांश हों, फ़िल्म के सबटाइटल हों या गानों के बोल—Scribe इतालवी (98.7%), अंग्रेज़ी (96.7%) और 97 अन्य भाषाओं में ऑटोमेटेड ट्रांसक्रिप्शन की सबसे कम वर्ड एरर रेट देता है।
Scribe ASR को सभी के लिए सुलभ बनाता है—सर्बियाई, कैंटोनीज़ और मलयालम जैसी पारंपरिक रूप से कम समर्थित भाषाओं में त्रुटियों को काफी कम करता है, जहाँ दूसरे मॉडलों की वर्ड एरर रेट अक्सर 40% से अधिक होती है।

डेवलपर आज ही हमारे स्पीच टू टेक्स्ट API के ज़रिए Scribe इंटीग्रेट कर सकते हैं और स्पीकर डायराइज़ेशन और शब्द-स्तर के टाइमस्टैम्प व गैर-स्पीच इवेंट मार्कर (जैसे हँसी) के साथ संरचित JSON ट्रांसक्रिप्ट पा सकते हैं। रीयल-टाइम ऐप्लिकेशन के लिए कम-लेटेंसी वाला वर्ज़न जल्द जारी किया जाएगा।
क्रिएटर्स और व्यवसाय ElevenLabs डैशबोर्ड के ज़रिए सीधे Scribe का इस्तेमाल करके ऑडियो या वीडियो फ़ाइलें अपलोड कर सकते हैं और फ़ॉर्मैट किए हुए ट्रांसक्रिप्ट बना सकते हैं।
Scribe के साथ बनाना शुरू करें:
API डॉक्यूमेंटेशन | ElevenLabs डैशबोर्ड में आज़माएं
बेंचमार्क
FLEURS - वर्ड एरर रेट % - 102 भाषाएँ

Common Voice - वर्ड एरर रेट % - 102 भाषाएँ

योगदान
रिसर्च लीड, ट्रेनिंग, आर्किटेक्चर
Flavio Schneider
प्रोजेक्ट लीड, प्री-ट्रेनिंग डेटा, फाइन-ट्यूनिंग डेटा
Tim von Känel
इन्फ़रेंस, ऑप्टिमाइज़ेशन
Maximiliano Levi
रिसर्च योगदानकर्ता
Johan Nordberg, Piotr Dabkowski
फ्रंटएंड
Austin Malerba
बैकएंड
Hristo Stoychev
डेटा अधिग्रहण
Alex George

.webp&w=3840&q=80)


