कंटेंट पर जाएं

वॉइस चेंजर पेश है

प्रकाशित

सुनेंइस आर्टिकल को सुनें

Voice Changer को मूल रूप से स्पीच टू स्पीच कहा जाता था। AI वॉइस एजेंट्स के संदर्भ में, “स्पीच टू स्पीच” का अर्थ ऐसी फ्यूज़्ड आर्किटेक्चर से भी है, जहाँ एक ही मॉडल सीधे ऑडियो इनपुट और आउटपुट संभालता है। ElevenAgents अपने प्लेटफ़ॉर्म के लिए उन्नत कैस्केडेड आर्किटेक्चर इस्तेमाल करता है। और जानें: कैस्केडेड बनाम फ्यूज़्ड मॉडल.

वॉइस चेंजर

हमने स्पीच सिंथेसिस में वॉइस चेंजर जोड़ा है। वॉइस चेंजर एक वॉइस कन्वर्ज़न टूल है, जो एक आवाज़ की रिकॉर्डिंग को इस तरह बदलता है कि वह किसी दूसरी आवाज़ में बोली हुई लगे—मूल परफ़ॉर्मेंस को बनाए रखते हुए। यानी रिकॉर्डिंग में डाले गए भाव, टाइमिंग, गति और उच्चारण आउटपुट वॉइस में भी बने रहते हैं।

इससे आपको उतना नियंत्रण मिलता है, जो सिर्फ़ टेक्स्ट टू स्पीच प्रॉम्प्ट से हमेशा नहीं मिल पाता। इसे इस्तेमाल करने के दो मुख्य तरीके हैं।

आवाज़ में ज़्यादा भाव लाएं। हर आवाज़ टेक्स्ट टू स्पीच प्रॉम्प्ट के ज़रिए दिए गए भावनात्मक निर्देशों पर समान रूप से अच्छी प्रतिक्रिया नहीं देती। वॉइस चेंजर से आप बेहद भावपूर्ण स्पीच रिकॉर्ड या अपलोड कर सकते हैं और उस भावनात्मक रेंज को किसी दूसरी आवाज़ में दोहरा सकते हैं। अगर आपको किसी प्रोफ़ेशनल नैरेटर की आवाज़ ज़्यादा गर्मजोशी भरी चाहिए, या बच्चों की किताब का कोई किरदार ज़्यादा चंचल सुनाई देना चाहिए, तो आप खुद उसे बोलकर वॉइस चेंजर से उस डिलीवरी को टारगेट वॉइस में ट्रांसफ़र कर सकते हैं।

स्पीच डिलीवरी को बारीकी से ट्यून करें। हमारे टेक्स्ट टू स्पीच मॉडल आमतौर पर शुरू से ही इंटोनेशन को अच्छी तरह संभालते हैं। लेकिन जब आपको किसी खास वाक्यांश की डिलीवरी पर सटीक नियंत्रण चाहिए—किस शब्द पर ज़ोर हो, ठहराव कैसा लगे, लय कैसी हो—तो वॉइस चेंजर आपको अपनी आवाज़ में उसे दिखाने और फिर उस डिलीवरी को अपनी चुनी हुई किसी भी आवाज़ पर लागू करने देता है। जब हम वॉइस चेंजर को सीधे Studio में इंटीग्रेट करेंगे, तो यह और भी उपयोगी हो जाएगा, लेकिन मकसद वही है: आपको अपने आउटपुट पर सटीक नियंत्रण देना।

हमारे कम्युनिटी के एक सदस्य का वॉकथ्रू यहाँ है:

रिसर्च

सोर्स स्पीच को टारगेट स्पीच में बदलने के लिए, हमें सोर्स स्पीच के कंटेंट को टारगेट स्पीच की विशेषताओं के साथ व्यक्त करना होता है। इसका एक उपयोगी उदाहरण फेस-स्वैपिंग है: ऐसे ऐप्स जो दो चेहरों को मिलाते हैं और एक व्यक्ति की विशेषताओं को दूसरे के मैप किए गए ढाँचे में दिखाते हैं।

इसके लिए चेहरे की इमेज लेकर उसकी विशेषताओं को मैप किया जाता है। नीचे दिए उदाहरण के मार्कर यही काम करते हैं—वे वे सीमाएं हैं, जिनके भीतर दूसरा चेहरा रेंडर किया जाएगा।

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

वॉइस कन्वर्ज़न में मुख्य बात यह है कि सोर्स स्पीच के कंटेंट को टारगेट स्पीच के फ़ोनीम का इस्तेमाल करके रेंडर किया जाए। लेकिन यहाँ भी वही समझौता है जो फेस-स्वैपिंग के उदाहरण में है: किसी चेहरे की विशेषताओं को मैप करने के लिए जितने ज़्यादा मार्कर इस्तेमाल करेंगे, उनके भीतर मैप किए जाने वाले चेहरे पर उतनी ही ज़्यादा पाबंदियां लगेंगी। कम मार्कर का मतलब कम पाबंदियां।

वॉइस कन्वर्ज़न में भी यही बात लागू होती है। हम टारगेट स्पीच को जितनी ज़्यादा प्राथमिकता देते हैं, सोर्स स्पीच के साथ तालमेल बिगड़ने का जोखिम उतना ही बढ़ता है। लेकिन अगर उसे पर्याप्त प्राथमिकता न दें, तो उस स्पीच की खासियत का बड़ा हिस्सा खोने का जोखिम रहता है। उदाहरण के लिए, अगर हम गुस्से में चिल्लाते हुए किसी व्यक्ति की रिकॉर्डिंग को फुसफुसाती आवाज़ में रेंडर करें, तो समस्या होगी। सोर्स स्पीच के भावों को बहुत ज़्यादा प्राथमिकता देने पर यह एहसास खो जाता है कि बोलने वाली आवाज़ फुसफुसाती है। फुसफुसाती स्पीच पैटर्न पर बहुत ज़्यादा ज़ोर देने पर सोर्स स्पीच का भावनात्मक असर खो जाता है।

प्रोडक्ट और हालिया अपडेट

प्रीमेड वॉइस में बदलाव

हम स्पीच सिंथेसिस में उपलब्ध डिफ़ॉल्ट वॉइस में बदलाव कर रहे हैं। हम कुछ वॉइस हटा देंगे और उनकी जगह नई वॉइस लाएंगे। आने वाले हफ्तों में 20 से ज़्यादा नई वॉइस जोड़ने की योजना है।

हम UI में यह जानकारी भी देना शुरू करेंगे कि हर वॉइस के कितने समय तक उपलब्ध रहने की उम्मीद है। दिसंबर भर हम वॉइस की विविधता बेहतर करने के लिए वॉइस शेयरिंग और उपयोग के लिए मिलने वाले भुगतान की सुविधाओं को नया रूप देंगे। जल्द ही और जानकारी मिलेगी।

Eleven Turbo v2 और uLaw 8khz फ़ॉर्मैट

Turbo v2 हमारी टीम के महीनों के रिसर्च का नतीजा है। इसे रीयल-टाइम इंटरैक्शन के लिए डिज़ाइन किया गया है, लेकिन यह हर उपयोग के मामले में काम करता है। यह IVR सिस्टम के लिए मानक (m)uLaw 8kHz फ़ॉर्मैट को भी सपोर्ट करता है।

Studio के साथ नॉर्मलाइज़ेशन और मेटाडेटा

Studio अब इंडस्ट्री-स्टैंडर्ड ऑडियोबुक सबमिशन गाइडलाइंस को सपोर्ट करता है, जिनमें गेन एडजस्टमेंट और डायनामिक कंप्रेशन शामिल हैं। आप अपने Studio प्रोजेक्ट में सीधे मेटाडेटा (ISBN, लेखक और शीर्षक) भी एम्बेड कर सकते हैं।

उच्चारण शब्दकोश

यह हमारी सबसे ज़्यादा मांगी गई सुविधाओं में से एक रही है। पिछले महीने, हमने अपने अंग्रेज़ी मॉडल के साथ IPA और CMU शब्दकोशों का उपयोग करके उच्चारण तय करने के लिए SSML टैग सपोर्ट जोड़ा था। अब हमने Studio UI में उच्चारण शब्दकोश का सपोर्ट जारी कर दिया है, जिससे आप IPA, CMU या शब्द प्रतिस्थापन (उपनाम) का उपयोग करके उच्चारण तय करने वाली फ़ाइल अपलोड कर सकते हैं। शब्दकोश फ़ाइलें इंडस्ट्री-स्टैंडर्ड ओपन .PLS लेक्सिकॉन फ़ाइल फ़ॉर्मैट का उपयोग करती हैं।

IPA और CMU को फ़िलहाल Turbo v2 English सपोर्ट करता है। शब्द प्रतिस्थापन सभी मॉडल और भाषाओं में सपोर्ट किए जाते हैं। पूरा डॉक्यूमेंटेशन यहाँ उपलब्ध है।

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

अगर आपका कोई फ़ीडबैक है, तो Discord पर हमसे संपर्क करने में संकोच न करें!

वॉइस चेंजर आज़माएं

इसे जैसे चाहें वैसे कहें और परफ़ॉर्मेंस पर पूरा नियंत्रण रखते हुए, इसे बिल्कुल अलग आवाज़ में सुनें। फुसफुसाहट, हंसी, ऐक्सेंट और भावनाओं के बारीक संकेत कैप्चर करें।

जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफॉर्मेंस पर पूरा कंट्रोल आपके पास है। फुसफुसाहट, हंसी, एक्सेंट और हल्के इमोशनल इशारे भी कैप्चर करें।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं