हंस सकने वाला पहला AI
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
अपनी पिछली पोस्ट में, हमने अपने स्पीच सिंथेसिस टूल से बनाए गए कुछ लंबे सैंपल दिखाए थे और संक्षेप में बताया था कि हमारे मॉडल का अनोखा डिज़ाइन उसे स्वाभाविक गति वाली, गैर-रोबोटिक आवाज़ बनाने देता है। आज हम आपको दिखाएंगे कि यह किसी भी दूसरे मॉडल से ज़्यादा भावनात्मक रूप से समृद्ध और संदर्भ को समझने वाला भी है। इसलिए इसे सुनना न सिर्फ़ बेहद दिलचस्प है, बल्कि यह किताबों और वीडियो गेम्स को आवाज़ देने से लेकर विज्ञापन तक के कामों के लिए भी उपयुक्त है।
भावनाएं
हमारे मॉडल की दोनों खूबियां—प्रवाह और सही उतार-चढ़ाव—इसके देखे गए भरपूर ट्रेनिंग डेटा (500 हज़ार घंटों से ज़्यादा!) से आती हैं। लेकिन असली अहम बात यह है कि यह उस डेटा से कैसे सीखता है, जो इसके डिज़ाइन पर निर्भर करता है। सबसे बुनियादी स्तर पर, इसे लिखे हुए शब्दों में मौजूद भावनाओं को समझने और यह तय करने के लिए बनाया गया है कि बोलने वाले की आवाज़ खुश, गुस्से वाली, उदास या तटस्थ होनी चाहिए। कुछ उदाहरण देखें:
स्वर और मूड के सभी अंतर सिर्फ़ टेक्स्ट से आते हैं—आउटपुट पर किसी और चीज़ का असर नहीं पड़ा। किसी वाक्य को कैसे बोलना है, यह तय करने में विराम-चिह्न और शब्दों के अर्थ अहम भूमिका निभाते हैं। लेकिन यह भी ध्यान दें कि जब वक्ता जीत से खुश होता है, तो मॉडल हंसी जैसी ऐसी आवाज़ें भी विश्वसनीय ढंग से बनाता है जो सामान्य बोलचाल का हिस्सा नहीं होतीं (जल्द ही हम उन अलग-अलग हंसियों का संकलन जारी करेंगे, जिन्हें हमारा AI बना सकता है!)। इसी तरह, जब वक्ता को कोई चीज़ बेहद मज़ेदार लगती है, तो मॉडल उसकी प्रतिक्रिया को सही ढंग से बढ़ा-चढ़ाकर व्यक्त करता है—यह ‘बहुतऽऽऽ मज़ेदार’ है।
संदर्भ
लेकिन सिर्फ़ अलग-अलग शब्दों का अर्थ जानना काफी नहीं है। हमारा मॉडल हर कथन के आसपास के व्यापक संदर्भ को भी उतनी ही संवेदनशीलता से समझता है—वह यह देखकर तय करता है कि कोई बात अर्थपूर्ण है या नहीं, कि वह उससे पहले और बाद के टेक्स्ट से कैसे जुड़ती है। यह व्यापक दृष्टिकोण उसे कई वाक्यों में फैले विचार पर एक समान भावनात्मक पैटर्न लागू करके लंबे अंशों में सही उतार-चढ़ाव लाने देता है, जैसा कि लंबे कंटेंट वाली हमारी पिछली पोस्ट में दिखाया गया था। इससे वह तर्क संबंधी गलतियों से भी बचता है। उदाहरण के लिए, कुछ शब्द एक ही तरह लिखे जाते हैं, लेकिन उनके अर्थ अलग होते हैं, जैसे वर्तमान और भूतकाल में ‘read’ या समय की इकाई और किसी बहुत छोटी चीज़ के अर्थ में ‘minute’। किसी स्थिति में कौन-सा अर्थ सही है, यह संदर्भ पर निर्भर करता है:
लिखित बनाम बोले गए शब्द
चूंकि हम अपने प्लेटफ़ॉर्म को लंबे कंटेंट की ज़रूरतों के लिए डिज़ाइन करते हैं, इसलिए हमारे मॉडल को यह भी समझना चाहिए कि लिखने में आम तौर पर इस्तेमाल होने वाले चिह्न, संक्षिप्त रूप और कुछ परंपराओं का उच्चारण किसी खास तरीके से किया जाए या उन्हें शाब्दिक रूप से न बोला जाए। उदाहरण के लिए, मॉडल को पता होना चाहिए कि FBI, TNT और ATM का उच्चारण UNESCO या NASA से अलग होता है। इसी तरह, लिखित रूप में $3tr बिल्कुल ठीक है, लेकिन ज़ोर से पढ़ते समय इसे ‘तीन ट्रिलियन डॉलर’ बनना चाहिए।
मानवीय हस्तक्षेप
इन बारीक अंतरों को पहचानना बेहद ज़रूरी है, क्योंकि हमारा लक्ष्य जनरेशन प्रक्रिया में मानवीय हस्तक्षेप की ज़रूरत को कम से कम करना है। आखिरकार, हम अपने टूल की कुछ मिनटों में ऑडियोबुक बनाने की क्षमता का प्रचार इसलिए नहीं करते कि किसी को पूरा ऑडियो सुनकर फिर पूरा टेक्स्ट दोबारा लिखना पड़े। फिर भी, भले ही हम उच्चारण के लिए अपने मॉडल के नियम लगातार अपडेट करते हैं, यह संभव है कि कोई चीज़ उसे उलझा दे। इसके लिए हम अब अनिश्चितता को चिह्नित करने वाला एक सिस्टम बना रहे हैं, जिससे यूज़र तुरंत देख सकेंगे कि टेक्स्ट के किन हिस्सों में मॉडल को समस्या हुई और उसे सिखा सकेंगे कि उन्हें कैसे कहा जाना चाहिए।
अनगिनत उपयोग
हमने जो भी क्षमताएं दिखाई हैं, वे हमारे सॉफ़्टवेयर को सबसे बहुमुखी AI वॉइसिंग टूल बनाने की दिशा में कदम हैं।
समाचार प्रकाशकों ने पहले ही पाया है कि अपनी ऑडियो मौजूदगी बढ़ाना सब्सक्राइबर्स को बनाए रखने का शानदार तरीका है। हर लेख के साथ उसका ऑडियो संस्करण जोड़ने का बड़ा फ़ायदा यह है कि लोग कोई और काम करते हुए भी उसे सुन सकते हैं। ऐसा करने वाले प्रकाशक अक्सर वॉइस ऐक्टर इस्तेमाल करते हैं, जो महंगा पड़ता है और सभी लेख कवर नहीं हो पाते। या वे अपनी रिपोर्टर्स से कहानियां पढ़वाते हैं, जिसमें बहुत समय लगता है और इसलिए खर्च भी बढ़ता है। जो लोग अपने कंटेंट को आवाज़ देने के लिए सिंथेटिक स्पीच इस्तेमाल करते हैं, वे पैसे तो बचाते हैं, लेकिन गुणवत्ता से समझौता करते हैं। अब ElevenLabs के साथ समझौता करने की ज़रूरत नहीं है—आप दोनों का सबसे अच्छा लाभ पा सकते हैं।
या फिर कुछ ही मिनटों में ऑडियोबुक बनाने की कल्पना करें, जिसमें हर किरदार के लिए अलग और भावनात्मक रूप से असरदार वॉइसओवर हो। इससे न सिर्फ़ किताबों से जुड़ने के नए तरीके मिलते हैं, बल्कि सीखने में कठिनाई वाले लोगों के लिए पहुंच भी काफी आसान हो जाती है।
अब उन संभावनाओं के बारे में सोचिए जो वीडियो गेम डेवलपर्स के लिए खुल गई हैं। अब उन्हें यह नहीं सोचना पड़ेगा कि कोई खास किरदार इतना महत्वपूर्ण है या नहीं कि असली ऐक्टर्स से उसे आवाज़ दिलाने की भारी लागत सही ठहराई जा सके। अब सभी NPCs की अपनी आवाज़ और व्यक्तित्व हो सकते हैं।
विज्ञापन एजेंसियां और प्रोड्यूसर्स अब किसी भी कैंपेन के टोन के हिसाब से वॉइसओवर पर खुलकर प्रयोग कर सकते हैं और उन्हें बदल सकते हैं—चाहे वह स्पोर्ट्स TV चैनल के लिए हो या लग्ज़री घड़ी के ब्रांड के लिए। किसी भी ऐक्टर की आवाज़ को क्लोनिंग के लिए लाइसेंस किया जा सकता है, ताकि ऐक्टर की भौतिक मौजूदगी के बिना बदलाव तुरंत लागू किए जा सकें। या अगर वे पूरी तरह सिंथेटिक आवाज़ चुनते हैं, तो विज्ञापनदाताओं को वॉइस राइट्स के लिए बायआउट भुगतान की चिंता भी नहीं करनी पड़ती।
वर्चुअल असिस्टेंट अधिक जीवंत बन सकते हैं, क्योंकि वॉइस क्लोनिंग उन्हें किसी खास यूज़र के लिए परिचित आवाज़ में बोलने देती है और डिलीवरी में यह नई गहराई उनके साथ बातचीत को भी ज़्यादा स्वाभाविक बनाती है।
ElevenLabs बीटा
हमारे बीटा प्लेटफ़ॉर्म के लिए साइन अप करने और खुद आज़माने के लिए यहां जाएं। हम लगातार सुधार कर रहे हैं और इस शुरुआती चरण में यूज़र का हर फ़ीडबैक हमारे लिए बहुत मूल्यवान है। आनंद लें!




