पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

वॉइस चेंजर पेश है

प्रकाशित

सुनेंइस आर्टिकल को सुनें

Voice Changer को पहले स्पीच टू स्पीच कहा जाता था। AI वॉइस एजेंट्स के संदर्भ में, "स्पीच टू स्पीच" का मतलब ऐसे फ्यूज़्ड आर्किटेक्चर से भी है, जहाँ एक ही मॉडल सीधे ऑडियो इनपुट और आउटपुट को संभालता है। ElevenAgents अपने प्लेटफ़ॉर्म के लिए उन्नत कैस्केडेड आर्किटेक्चर का इस्तेमाल करता है। और जानें: कैस्केडेड बनाम फ्यूज़्ड मॉडल्स.

वॉइस चेंजर

हमने वॉइस चेंजर को स्पीच सिंथेसिस में जोड़ा है। वॉइस चेंजर एक वॉइस कन्वर्ज़न टूल है, जो एक आवाज़ की रिकॉर्डिंग को इस तरह बदल देता है कि वह किसी दूसरी आवाज़ में बोली हुई लगे — और मूल परफ़ॉर्मेंस भी बनी रहे। यानी, रिकॉर्डिंग में डाले गए भाव, टाइमिंग, गति और उच्चारण आउटपुट वॉइस में भी बने रहते हैं।

इससे आपको उतना नियंत्रण मिलता है, जितना सिर्फ़ टेक्स्ट टू स्पीच प्रॉम्प्ट्स से हमेशा नहीं मिल सकता। इसके दो मुख्य तरीके हैं।

आवाज़ में ज़्यादा भाव लाएं। टेक्स्ट टू स्पीच प्रॉम्प्ट्स के ज़रिए भावनात्मक निर्देशों पर हर आवाज़ एक जैसा जवाब नहीं देती। वॉइस चेंजर आपको बहुत भावपूर्ण स्पीच रिकॉर्ड या अपलोड करने और उस भावनात्मक दायरे को किसी दूसरी आवाज़ में दोहराने देता है। अगर आपको किसी पेशेवर नैरेटर की आवाज़ ज़्यादा गर्मजोशी भरी चाहिए, या बच्चों की किताब का कोई किरदार ज़्यादा चंचल सुनाई देना चाहिए, तो आप खुद उस तरह बोलकर वॉइस चेंजर से उसे लक्ष्य आवाज़ में ट्रांसफ़र कर सकते हैं।

स्पीच डिलीवरी को बारीकी से नियंत्रित करें। हमारे टेक्स्ट टू स्पीच मॉडल आमतौर पर शुरू से ही इंटोनेशन को अच्छी तरह संभालते हैं। लेकिन जब आपको किसी खास वाक्यांश की डिलीवरी पर सटीक नियंत्रण चाहिए — ज़ोर कहाँ हो, विराम कैसे पड़े, लय कैसी लगे — तब वॉइस चेंजर आपको अपनी आवाज़ में उसे दिखाने और फिर उस डिलीवरी को अपनी चुनी हुई किसी भी आवाज़ पर लागू करने देता है। वॉइस चेंजर को सीधे Studio में इंटिग्रेट करने के बाद यह और उपयोगी होगा, लेकिन लक्ष्य वही है: आपको अपने आउटपुट पर सटीक नियंत्रण देना।

हमारे कम्युनिटी के एक सदस्य का वॉकथ्रू देखें:

रिसर्च

सोर्स स्पीच को टारगेट स्पीच में बदलने के लिए, हमें सोर्स स्पीच के कंटेंट को टारगेट स्पीच की विशेषताओं के साथ व्यक्त करना होता है। इसका एक उपयोगी उदाहरण फेस-स्वैपिंग है: ऐसे ऐप्स जो दो चेहरों को मिलाकर, एक व्यक्ति की विशेषताओं को दूसरे के मैप किए गए ढाँचे में दिखाते हैं।

इसके लिए चेहरे की इमेज लेकर उसकी विशेषताओं को मैप किया जाता है। नीचे दिए उदाहरण में मार्कर्स यही करते हैं — वे उन सीमाओं को तय करते हैं जिनके भीतर दूसरा चेहरा रेंडर किया जाएगा।

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

वॉइस कन्वर्ज़न की कुंजी यह है कि सोर्स स्पीच के कंटेंट को टारगेट स्पीच के फोनीम्स का इस्तेमाल करके रेंडर किया जाए। लेकिन यहाँ भी वही संतुलन है जो फेस-स्वैपिंग के उदाहरण में है: किसी चेहरे की विशेषताओं को मैप करने के लिए जितने ज़्यादा मार्कर्स इस्तेमाल करेंगे, उनके भीतर मैप किए जाने वाले चेहरे पर उतनी ही ज़्यादा पाबंदियाँ लगेंगी। कम मार्कर्स का मतलब है कम पाबंदियाँ।

वॉइस कन्वर्ज़न में भी यही बात लागू होती है। हम टारगेट स्पीच को जितनी ज़्यादा प्राथमिकता देते हैं, उतना ही सोर्स स्पीच से तालमेल बिगड़ने का जोखिम होता है। लेकिन अगर उसे पर्याप्त प्राथमिकता नहीं देते, तो उस स्पीच की खासियत का बड़ा हिस्सा खोने का जोखिम रहता है। उदाहरण के लिए, अगर हम गुस्से में चिल्लाते किसी व्यक्ति की रिकॉर्डिंग को फुसफुसाती आवाज़ में रेंडर करें, तो मुश्किल होगी। सोर्स स्पीच के भावों को बहुत ज़्यादा प्राथमिकता देने पर यह एहसास खो जाता है कि बोलने वाली आवाज़ फुसफुसाती हुई है। फुसफुसाती स्पीच पैटर्न पर बहुत ज़्यादा ज़ोर देने से सोर्स स्पीच का भावनात्मक असर खो जाता है।

प्रोडक्ट और हालिया अपडेट्स

प्रीमेड वॉइस में बदलाव

हम स्पीच सिंथेसिस में उपलब्ध डिफ़ॉल्ट वॉइस में बदलाव कर रहे हैं। हम कुछ वॉइस को हटाकर उनकी जगह नई वॉइस लाएंगे। आने वाले हफ्तों में 20 से ज़्यादा नई वॉइस जोड़ने की योजना है।

हम UI में यह जानकारी भी दिखाना शुरू करेंगे कि हर वॉइस के कितने समय तक उपलब्ध रहने की उम्मीद है। दिसंबर के दौरान, वॉइस की विविधता बेहतर बनाने के लिए हम अपने वॉइस शेयरिंग और उपयोग मुआवज़ा फीचर्स को नया रूप देंगे। जल्द ही और जानकारी मिलेगी।

Eleven Turbo v2 और uLaw 8khz फ़ॉर्मैट

Turbo v2 हमारी टीम के महीनों के रिसर्च का नतीजा है। इसे रियल-टाइम इंटरैक्शन के लिए डिज़ाइन किया गया है, लेकिन यह हर उपयोग के लिए काम करता है। यह IVR सिस्टम्स के लिए मानक (m)uLaw 8kHz फ़ॉर्मैट को भी सपोर्ट करता है।

Studio के साथ नॉर्मलाइज़ेशन और मेटाडेटा

Studio अब इंडस्ट्री-स्टैंडर्ड ऑडियोबुक सबमिशन गाइडलाइंस को सपोर्ट करता है, जिनमें गेन एडजस्टमेंट और डायनेमिक कंप्रेशन शामिल हैं। आप अपने Studio प्रोजेक्ट में सीधे मेटाडेटा (ISBN, लेखक और शीर्षक) भी एम्बेड कर सकते हैं।

उच्चारण शब्दकोश

यह हमारे सबसे ज़्यादा अनुरोध किए गए फीचर्स में से एक रहा है। पिछले महीने, हमने अपने अंग्रेज़ी मॉडल्स में IPA और CMU डिक्शनरी का इस्तेमाल करके उच्चारण बताने के लिए SSML टैग सपोर्ट जोड़ा था। अब हमने उच्चारण शब्दकोश का सपोर्ट Studio UI में जारी कर दिया है, जिससे आप IPA, CMU या शब्द प्रतिस्थापन (उपनाम) के ज़रिए उच्चारण बताने वाली फ़ाइल अपलोड कर सकते हैं। डिक्शनरी फ़ाइलें इंडस्ट्री-स्टैंडर्ड ओपन .PLS लेक्सिकॉन फ़ाइल फ़ॉर्मैट का इस्तेमाल करती हैं।

IPA और CMU को फ़िलहाल Turbo v2 English सपोर्ट करता है। शब्द प्रतिस्थापन सभी मॉडल्स और भाषाओं में सपोर्टेड हैं। पूरा दस्तावेज़ यहाँ उपलब्ध है।

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

अगर आपका कोई फ़ीडबैक है, तो Discord पर हमसे संपर्क करने में संकोच न करें!

वॉइस चेंजर आज़माएं

जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफ़ॉर्मेंस पर पूरा नियंत्रण रखते हुए। फुसफुसाहट, हँसी, ऐक्सेंट और भावनाओं के हल्के संकेत भी कैप्चर करें।

जैसे चाहें वैसे बोलें और उसे बिल्कुल अलग आवाज़ में सुनें, परफॉर्मेंस पर पूरा कंट्रोल आपके पास है। फुसफुसाहट, हंसी, एक्सेंट और हल्के इमोशनल इशारे भी कैप्चर करें।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं