वॉइस चेंजर पेश है
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
Voice Changer को मूल रूप से स्पीच टू स्पीच कहा जाता था। AI वॉइस एजेंट्स के संदर्भ में, “स्पीच टू स्पीच” का अर्थ ऐसी फ्यूज़्ड आर्किटेक्चर से भी है, जहाँ एक ही मॉडल सीधे ऑडियो इनपुट और आउटपुट संभालता है। ElevenAgents अपने प्लेटफ़ॉर्म के लिए उन्नत कैस्केडेड आर्किटेक्चर इस्तेमाल करता है। और जानें: कैस्केडेड बनाम फ्यूज़्ड मॉडल.
वॉइस चेंजर
हमने स्पीच सिंथेसिस में वॉइस चेंजर जोड़ा है। वॉइस चेंजर एक वॉइस कन्वर्ज़न टूल है, जो एक आवाज़ की रिकॉर्डिंग को इस तरह बदलता है कि वह किसी दूसरी आवाज़ में बोली हुई लगे—मूल परफ़ॉर्मेंस को बनाए रखते हुए। यानी रिकॉर्डिंग में डाले गए भाव, टाइमिंग, गति और उच्चारण आउटपुट वॉइस में भी बने रहते हैं।
इससे आपको उतना नियंत्रण मिलता है, जो सिर्फ़ टेक्स्ट टू स्पीच प्रॉम्प्ट से हमेशा नहीं मिल पाता। इसे इस्तेमाल करने के दो मुख्य तरीके हैं।
आवाज़ में ज़्यादा भाव लाएं। हर आवाज़ टेक्स्ट टू स्पीच प्रॉम्प्ट के ज़रिए दिए गए भावनात्मक निर्देशों पर समान रूप से अच्छी प्रतिक्रिया नहीं देती। वॉइस चेंजर से आप बेहद भावपूर्ण स्पीच रिकॉर्ड या अपलोड कर सकते हैं और उस भावनात्मक रेंज को किसी दूसरी आवाज़ में दोहरा सकते हैं। अगर आपको किसी प्रोफ़ेशनल नैरेटर की आवाज़ ज़्यादा गर्मजोशी भरी चाहिए, या बच्चों की किताब का कोई किरदार ज़्यादा चंचल सुनाई देना चाहिए, तो आप खुद उसे बोलकर वॉइस चेंजर से उस डिलीवरी को टारगेट वॉइस में ट्रांसफ़र कर सकते हैं।
स्पीच डिलीवरी को बारीकी से ट्यून करें। हमारे टेक्स्ट टू स्पीच मॉडल आमतौर पर शुरू से ही इंटोनेशन को अच्छी तरह संभालते हैं। लेकिन जब आपको किसी खास वाक्यांश की डिलीवरी पर सटीक नियंत्रण चाहिए—किस शब्द पर ज़ोर हो, ठहराव कैसा लगे, लय कैसी हो—तो वॉइस चेंजर आपको अपनी आवाज़ में उसे दिखाने और फिर उस डिलीवरी को अपनी चुनी हुई किसी भी आवाज़ पर लागू करने देता है। जब हम वॉइस चेंजर को सीधे Studio में इंटीग्रेट करेंगे, तो यह और भी उपयोगी हो जाएगा, लेकिन मकसद वही है: आपको अपने आउटपुट पर सटीक नियंत्रण देना।
हमारे कम्युनिटी के एक सदस्य का वॉकथ्रू यहाँ है:
रिसर्च
सोर्स स्पीच को टारगेट स्पीच में बदलने के लिए, हमें सोर्स स्पीच के कंटेंट को टारगेट स्पीच की विशेषताओं के साथ व्यक्त करना होता है। इसका एक उपयोगी उदाहरण फेस-स्वैपिंग है: ऐसे ऐप्स जो दो चेहरों को मिलाते हैं और एक व्यक्ति की विशेषताओं को दूसरे के मैप किए गए ढाँचे में दिखाते हैं।
इसके लिए चेहरे की इमेज लेकर उसकी विशेषताओं को मैप किया जाता है। नीचे दिए उदाहरण के मार्कर यही काम करते हैं—वे वे सीमाएं हैं, जिनके भीतर दूसरा चेहरा रेंडर किया जाएगा।
वॉइस कन्वर्ज़न में मुख्य बात यह है कि सोर्स स्पीच के कंटेंट को टारगेट स्पीच के फ़ोनीम का इस्तेमाल करके रेंडर किया जाए। लेकिन यहाँ भी वही समझौता है जो फेस-स्वैपिंग के उदाहरण में है: किसी चेहरे की विशेषताओं को मैप करने के लिए जितने ज़्यादा मार्कर इस्तेमाल करेंगे, उनके भीतर मैप किए जाने वाले चेहरे पर उतनी ही ज़्यादा पाबंदियां लगेंगी। कम मार्कर का मतलब कम पाबंदियां।
वॉइस कन्वर्ज़न में भी यही बात लागू होती है। हम टारगेट स्पीच को जितनी ज़्यादा प्राथमिकता देते हैं, सोर्स स्पीच के साथ तालमेल बिगड़ने का जोखिम उतना ही बढ़ता है। लेकिन अगर उसे पर्याप्त प्राथमिकता न दें, तो उस स्पीच की खासियत का बड़ा हिस्सा खोने का जोखिम रहता है। उदाहरण के लिए, अगर हम गुस्से में चिल्लाते हुए किसी व्यक्ति की रिकॉर्डिंग को फुसफुसाती आवाज़ में रेंडर करें, तो समस्या होगी। सोर्स स्पीच के भावों को बहुत ज़्यादा प्राथमिकता देने पर यह एहसास खो जाता है कि बोलने वाली आवाज़ फुसफुसाती है। फुसफुसाती स्पीच पैटर्न पर बहुत ज़्यादा ज़ोर देने पर सोर्स स्पीच का भावनात्मक असर खो जाता है।
प्रोडक्ट और हालिया अपडेट
प्रीमेड वॉइस में बदलाव
हम स्पीच सिंथेसिस में उपलब्ध डिफ़ॉल्ट वॉइस में बदलाव कर रहे हैं। हम कुछ वॉइस हटा देंगे और उनकी जगह नई वॉइस लाएंगे। आने वाले हफ्तों में 20 से ज़्यादा नई वॉइस जोड़ने की योजना है।
हम UI में यह जानकारी भी देना शुरू करेंगे कि हर वॉइस के कितने समय तक उपलब्ध रहने की उम्मीद है। दिसंबर भर हम वॉइस की विविधता बेहतर करने के लिए वॉइस शेयरिंग और उपयोग के लिए मिलने वाले भुगतान की सुविधाओं को नया रूप देंगे। जल्द ही और जानकारी मिलेगी।
Eleven Turbo v2 और uLaw 8khz फ़ॉर्मैट
Turbo v2 हमारी टीम के महीनों के रिसर्च का नतीजा है। इसे रीयल-टाइम इंटरैक्शन के लिए डिज़ाइन किया गया है, लेकिन यह हर उपयोग के मामले में काम करता है। यह IVR सिस्टम के लिए मानक (m)uLaw 8kHz फ़ॉर्मैट को भी सपोर्ट करता है।
Studio के साथ नॉर्मलाइज़ेशन और मेटाडेटा
Studio अब इंडस्ट्री-स्टैंडर्ड ऑडियोबुक सबमिशन गाइडलाइंस को सपोर्ट करता है, जिनमें गेन एडजस्टमेंट और डायनामिक कंप्रेशन शामिल हैं। आप अपने Studio प्रोजेक्ट में सीधे मेटाडेटा (ISBN, लेखक और शीर्षक) भी एम्बेड कर सकते हैं।
उच्चारण शब्दकोश
यह हमारी सबसे ज़्यादा मांगी गई सुविधाओं में से एक रही है। पिछले महीने, हमने अपने अंग्रेज़ी मॉडल के साथ IPA और CMU शब्दकोशों का उपयोग करके उच्चारण तय करने के लिए SSML टैग सपोर्ट जोड़ा था। अब हमने Studio UI में उच्चारण शब्दकोश का सपोर्ट जारी कर दिया है, जिससे आप IPA, CMU या शब्द प्रतिस्थापन (उपनाम) का उपयोग करके उच्चारण तय करने वाली फ़ाइल अपलोड कर सकते हैं। शब्दकोश फ़ाइलें इंडस्ट्री-स्टैंडर्ड ओपन .PLS लेक्सिकॉन फ़ाइल फ़ॉर्मैट का उपयोग करती हैं।
IPA और CMU को फ़िलहाल Turbo v2 English सपोर्ट करता है। शब्द प्रतिस्थापन सभी मॉडल और भाषाओं में सपोर्ट किए जाते हैं। पूरा डॉक्यूमेंटेशन यहाँ उपलब्ध है।
अगर आपका कोई फ़ीडबैक है, तो Discord पर हमसे संपर्क करने में संकोच न करें!
वॉइस चेंजर आज़माएं
इसे जैसे चाहें वैसे कहें और परफ़ॉर्मेंस पर पूरा नियंत्रण रखते हुए, इसे बिल्कुल अलग आवाज़ में सुनें। फुसफुसाहट, हंसी, ऐक्सेंट और भावनाओं के बारीक संकेत कैप्चर करें।
जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफॉर्मेंस पर पूरा कंट्रोल आपके पास है। फुसफुसाहट, हंसी, एक्सेंट और हल्के इमोशनल इशारे भी कैप्चर करें।




