वॉइस चेंजर पेश है
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
Voice Changer को पहले स्पीच टू स्पीच कहा जाता था। AI वॉइस एजेंट्स के संदर्भ में, "स्पीच टू स्पीच" का मतलब ऐसे फ्यूज़्ड आर्किटेक्चर से भी है, जहाँ एक ही मॉडल सीधे ऑडियो इनपुट और आउटपुट को संभालता है। ElevenAgents अपने प्लेटफ़ॉर्म के लिए उन्नत कैस्केडेड आर्किटेक्चर का इस्तेमाल करता है। और जानें: कैस्केडेड बनाम फ्यूज़्ड मॉडल्स.
वॉइस चेंजर
हमने वॉइस चेंजर को स्पीच सिंथेसिस में जोड़ा है। वॉइस चेंजर एक वॉइस कन्वर्ज़न टूल है, जो एक आवाज़ की रिकॉर्डिंग को इस तरह बदल देता है कि वह किसी दूसरी आवाज़ में बोली हुई लगे — और मूल परफ़ॉर्मेंस भी बनी रहे। यानी, रिकॉर्डिंग में डाले गए भाव, टाइमिंग, गति और उच्चारण आउटपुट वॉइस में भी बने रहते हैं।
इससे आपको उतना नियंत्रण मिलता है, जितना सिर्फ़ टेक्स्ट टू स्पीच प्रॉम्प्ट्स से हमेशा नहीं मिल सकता। इसके दो मुख्य तरीके हैं।
आवाज़ में ज़्यादा भाव लाएं। टेक्स्ट टू स्पीच प्रॉम्प्ट्स के ज़रिए भावनात्मक निर्देशों पर हर आवाज़ एक जैसा जवाब नहीं देती। वॉइस चेंजर आपको बहुत भावपूर्ण स्पीच रिकॉर्ड या अपलोड करने और उस भावनात्मक दायरे को किसी दूसरी आवाज़ में दोहराने देता है। अगर आपको किसी पेशेवर नैरेटर की आवाज़ ज़्यादा गर्मजोशी भरी चाहिए, या बच्चों की किताब का कोई किरदार ज़्यादा चंचल सुनाई देना चाहिए, तो आप खुद उस तरह बोलकर वॉइस चेंजर से उसे लक्ष्य आवाज़ में ट्रांसफ़र कर सकते हैं।
स्पीच डिलीवरी को बारीकी से नियंत्रित करें। हमारे टेक्स्ट टू स्पीच मॉडल आमतौर पर शुरू से ही इंटोनेशन को अच्छी तरह संभालते हैं। लेकिन जब आपको किसी खास वाक्यांश की डिलीवरी पर सटीक नियंत्रण चाहिए — ज़ोर कहाँ हो, विराम कैसे पड़े, लय कैसी लगे — तब वॉइस चेंजर आपको अपनी आवाज़ में उसे दिखाने और फिर उस डिलीवरी को अपनी चुनी हुई किसी भी आवाज़ पर लागू करने देता है। वॉइस चेंजर को सीधे Studio में इंटिग्रेट करने के बाद यह और उपयोगी होगा, लेकिन लक्ष्य वही है: आपको अपने आउटपुट पर सटीक नियंत्रण देना।
हमारे कम्युनिटी के एक सदस्य का वॉकथ्रू देखें:
रिसर्च
सोर्स स्पीच को टारगेट स्पीच में बदलने के लिए, हमें सोर्स स्पीच के कंटेंट को टारगेट स्पीच की विशेषताओं के साथ व्यक्त करना होता है। इसका एक उपयोगी उदाहरण फेस-स्वैपिंग है: ऐसे ऐप्स जो दो चेहरों को मिलाकर, एक व्यक्ति की विशेषताओं को दूसरे के मैप किए गए ढाँचे में दिखाते हैं।
इसके लिए चेहरे की इमेज लेकर उसकी विशेषताओं को मैप किया जाता है। नीचे दिए उदाहरण में मार्कर्स यही करते हैं — वे उन सीमाओं को तय करते हैं जिनके भीतर दूसरा चेहरा रेंडर किया जाएगा।
वॉइस कन्वर्ज़न की कुंजी यह है कि सोर्स स्पीच के कंटेंट को टारगेट स्पीच के फोनीम्स का इस्तेमाल करके रेंडर किया जाए। लेकिन यहाँ भी वही संतुलन है जो फेस-स्वैपिंग के उदाहरण में है: किसी चेहरे की विशेषताओं को मैप करने के लिए जितने ज़्यादा मार्कर्स इस्तेमाल करेंगे, उनके भीतर मैप किए जाने वाले चेहरे पर उतनी ही ज़्यादा पाबंदियाँ लगेंगी। कम मार्कर्स का मतलब है कम पाबंदियाँ।
वॉइस कन्वर्ज़न में भी यही बात लागू होती है। हम टारगेट स्पीच को जितनी ज़्यादा प्राथमिकता देते हैं, उतना ही सोर्स स्पीच से तालमेल बिगड़ने का जोखिम होता है। लेकिन अगर उसे पर्याप्त प्राथमिकता नहीं देते, तो उस स्पीच की खासियत का बड़ा हिस्सा खोने का जोखिम रहता है। उदाहरण के लिए, अगर हम गुस्से में चिल्लाते किसी व्यक्ति की रिकॉर्डिंग को फुसफुसाती आवाज़ में रेंडर करें, तो मुश्किल होगी। सोर्स स्पीच के भावों को बहुत ज़्यादा प्राथमिकता देने पर यह एहसास खो जाता है कि बोलने वाली आवाज़ फुसफुसाती हुई है। फुसफुसाती स्पीच पैटर्न पर बहुत ज़्यादा ज़ोर देने से सोर्स स्पीच का भावनात्मक असर खो जाता है।
प्रोडक्ट और हालिया अपडेट्स
प्रीमेड वॉइस में बदलाव
हम स्पीच सिंथेसिस में उपलब्ध डिफ़ॉल्ट वॉइस में बदलाव कर रहे हैं। हम कुछ वॉइस को हटाकर उनकी जगह नई वॉइस लाएंगे। आने वाले हफ्तों में 20 से ज़्यादा नई वॉइस जोड़ने की योजना है।
हम UI में यह जानकारी भी दिखाना शुरू करेंगे कि हर वॉइस के कितने समय तक उपलब्ध रहने की उम्मीद है। दिसंबर के दौरान, वॉइस की विविधता बेहतर बनाने के लिए हम अपने वॉइस शेयरिंग और उपयोग मुआवज़ा फीचर्स को नया रूप देंगे। जल्द ही और जानकारी मिलेगी।
Eleven Turbo v2 और uLaw 8khz फ़ॉर्मैट
Turbo v2 हमारी टीम के महीनों के रिसर्च का नतीजा है। इसे रियल-टाइम इंटरैक्शन के लिए डिज़ाइन किया गया है, लेकिन यह हर उपयोग के लिए काम करता है। यह IVR सिस्टम्स के लिए मानक (m)uLaw 8kHz फ़ॉर्मैट को भी सपोर्ट करता है।
Studio के साथ नॉर्मलाइज़ेशन और मेटाडेटा
Studio अब इंडस्ट्री-स्टैंडर्ड ऑडियोबुक सबमिशन गाइडलाइंस को सपोर्ट करता है, जिनमें गेन एडजस्टमेंट और डायनेमिक कंप्रेशन शामिल हैं। आप अपने Studio प्रोजेक्ट में सीधे मेटाडेटा (ISBN, लेखक और शीर्षक) भी एम्बेड कर सकते हैं।
उच्चारण शब्दकोश
यह हमारे सबसे ज़्यादा अनुरोध किए गए फीचर्स में से एक रहा है। पिछले महीने, हमने अपने अंग्रेज़ी मॉडल्स में IPA और CMU डिक्शनरी का इस्तेमाल करके उच्चारण बताने के लिए SSML टैग सपोर्ट जोड़ा था। अब हमने उच्चारण शब्दकोश का सपोर्ट Studio UI में जारी कर दिया है, जिससे आप IPA, CMU या शब्द प्रतिस्थापन (उपनाम) के ज़रिए उच्चारण बताने वाली फ़ाइल अपलोड कर सकते हैं। डिक्शनरी फ़ाइलें इंडस्ट्री-स्टैंडर्ड ओपन .PLS लेक्सिकॉन फ़ाइल फ़ॉर्मैट का इस्तेमाल करती हैं।
IPA और CMU को फ़िलहाल Turbo v2 English सपोर्ट करता है। शब्द प्रतिस्थापन सभी मॉडल्स और भाषाओं में सपोर्टेड हैं। पूरा दस्तावेज़ यहाँ उपलब्ध है।
अगर आपका कोई फ़ीडबैक है, तो Discord पर हमसे संपर्क करने में संकोच न करें!
वॉइस चेंजर आज़माएं
जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफ़ॉर्मेंस पर पूरा नियंत्रण रखते हुए। फुसफुसाहट, हँसी, ऐक्सेंट और भावनाओं के हल्के संकेत भी कैप्चर करें।
जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफॉर्मेंस पर पूरा कंट्रोल आपके पास है। फुसफुसाहट, हंसी, एक्सेंट और हल्के इमोशनल इशारे भी कैप्चर करें।




