Eleven v3 अब सभी के लिए उपलब्ध है
- लेखक
- Joe Reeve
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
हमारा सबसे उन्नत टेक्स्ट टू स्पीच मॉडल, Eleven v3, अब Alpha से बाहर आ गया है और सभी के लिए उपलब्ध है।
Alpha रिलीज़ के बाद से, हम मॉडल को और बेहतर बनाते रहे हैं। दो अहम सुधार:
ज़्यादा स्थिर। टेस्टिंग में, यूज़र्स ने पिछले Alpha रिलीज़ की तुलना में 72% मामलों में नए वर्शन को पसंद किया।
ज़्यादा सटीक। हमने अलग-अलग भाषाओं में मॉडल द्वारा संख्याओं, प्रतीकों और विशेष नोटेशन को संभालने के तरीके में काफी सुधार किया है।
सटीकता में सुधार
टेक्स्ट टू स्पीच मॉडल को आपके लिखे हुए टेक्स्ट को समझना और उसे बोलने का तरीका तय करना होता है। एक ही प्रतीक के अलग-अलग संदर्भों में अलग अर्थ हो सकते हैं।
इस फ़ोन नंबर पर विचार करें: "+49 170 9876543"
कुछ मामलों में, हमारे मॉडल इसे "plus forty-nine, one hundred seventy, nine million eight hundred seventy-six thousand five hundred forty-three" के रूप में पढ़ते थे - अंकों को अंक-क्रम के बजाय बड़ी संख्याओं के रूप में समझते हुए। सही उच्चारण है "plus four nine, one seven zero, nine eight seven six five four three."
ऐसी गलतियां कई श्रेणियों में दिखीं - खेल के स्कोर, रासायनिक सूत्र, मुद्राएं, निर्देशांक - यानी हर उस जगह, जहाँ मॉडल को प्रतीकों को समझकर तय करना था कि उन्हें कैसे बोला जाए।
हमने 8 भाषाओं में 27 श्रेणियों वाले एक आंतरिक बेंचमार्क पर टेस्ट किया।
कुल मिलाकर: गलतियों में 68% की कमी। गलती की दर 15.3% से घटकर 4.9% हो गई।
श्रेणी के अनुसार गलती की दर:
सुधार उन श्रेणियों में सबसे ज़्यादा हैं, जहाँ संदर्भ से अर्थ तय होता है - आसपास के टेक्स्ट के आधार पर कोलन खेल के स्कोर, समय या आस्पेक्ट रेशियो को दिखा सकता है।
उदाहरण
मुद्राएं — सही राशि:
इनपुट: ¥250,000
पहले: 25,000 येन
बाद में: 250,000 येन
रासायनिक सूत्र — प्रतीक सही तरीके से बनाए रखे गए:
इनपुट: SO₂
पहले: "sulfur double" (अस्पष्ट)
बाद में: "S O two"
खेल के स्कोर — संदर्भ के अनुसार व्याख्या:
इनपुट: अंतिम स्कोर: 102-98
पहले: "one hundred two minus ninety-eight"
बाद में: "one hundred two to ninety-eight"
उपलब्धता
Eleven v3 अब सभी प्लेटफ़ॉर्म पर सभी के लिए उपलब्ध है।




