Eleven v3 अब सभी के लिए उपलब्ध है
- लेखक
- Joe Reeve
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
हमारा सबसे उन्नत टेक्स्ट टू स्पीच मॉडल Eleven v3 अब Alpha से बाहर आ गया है और सभी के लिए उपलब्ध है।
Alpha रिलीज़ के बाद से, हम मॉडल को लगातार बेहतर बनाते रहे हैं। दो मुख्य सुधार:
ज़्यादा स्थिर। टेस्टिंग में, यूज़र्स ने पिछले Alpha रिलीज़ की तुलना में 72% मामलों में नए वर्ज़न को पसंद किया।
ज़्यादा सटीक। हमने अलग-अलग भाषाओं में नंबर, प्रतीक और विशेष नोटेशन को संभालने की मॉडल की क्षमता में काफ़ी सुधार किया है।
सटीकता में सुधार
टेक्स्ट टू स्पीच मॉडल को आपके लिखे टेक्स्ट को समझना होता है और तय करना होता है कि उसे कैसे बोलना है। एक ही प्रतीक का मतलब अलग-अलग संदर्भों में अलग हो सकता है।
इस फ़ोन नंबर पर विचार करें: "+49 170 9876543"
कुछ मामलों में, हमारे मॉडल इसे "प्लस उनचास, एक सौ सत्तर, अट्ठानवे लाख छिहत्तर हज़ार पाँच सौ तैंतालीस" के रूप में पढ़ते थे—यानी अंकों के क्रम के बजाय उन्हें बड़ी संख्याओं के रूप में समझते थे। सही उच्चारण है "प्लस चार नौ, एक सात शून्य, नौ आठ सात छह पाँच चार तीन।"
इस तरह की गलतियाँ कई श्रेणियों में दिखीं—खेलों के स्कोर, रासायनिक सूत्र, मुद्राएँ, निर्देशांक—यानी हर जगह जहाँ मॉडल को प्रतीकों को समझकर तय करना था कि उन्हें कैसे बोलना है।
हमने 8 भाषाओं में 27 श्रेणियों वाले एक आंतरिक बेंचमार्क पर टेस्ट किया।
कुल मिलाकर: गलतियों में 68% की कमी। त्रुटि दर 15.3% से घटकर 4.9% हो गई।
श्रेणी के अनुसार त्रुटि दर:
सुधार उन श्रेणियों में सबसे अहम हैं जहाँ संदर्भ से अर्थ तय होता है—जहाँ आसपास के टेक्स्ट के आधार पर कोलन खेल का स्कोर, समय या आस्पेक्ट रेशियो बता सकता है।
उदाहरण
मुद्राएँ — सही परिमाण:
इनपुट: ¥250,000
पहले: 25,000 येन
बाद में: 250,000 येन
रासायनिक सूत्र — प्रतीक सही तरह से बनाए रखे गए:
इनपुट: SO₂
पहले: "सल्फ़र डबल" (गलत उच्चारण)
बाद में: "एस ओ टू"
खेलों के स्कोर — संदर्भ के अनुसार व्याख्या:
इनपुट: अंतिम स्कोर: 102-98
पहले: "एक सौ दो माइनस अट्ठानवे"
बाद में: "एक सौ दो से अट्ठानवे"
उपलब्धता
Eleven v3 अब सभी प्लेटफ़ॉर्म पर सभी के लिए उपलब्ध है।


.jpg&w=3840&q=80)
.png&w=3840&q=80)
