वॉइस क्लोनिंग

जानें कि हमारे बेहतरीन मॉडलों से अपनी वॉइस को कैसे क्लोन करें।

परिचय

वॉइस क्लोन करने के लिए दो मुख्य विकल्प हैं: इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग। इंस्टेंट वॉइस क्लोनिंग आपकी वॉइस क्लोन करने का तेज़ और आसान तरीका है, जबकि प्रोफेशनल वॉइस क्लोनिंग ज़्यादा सटीक और कस्टमाइज़ करने योग्य विकल्प है।

इंस्टेंट वॉइस क्लोनिंग

इंस्टेंट वॉइस
क्लोनिंग

इंस्टेंट वॉइस क्लोनिंग से आप छोटे सैंपल से लगभग तुरंत वॉइस क्लोन बना सकते हैं। इंस्टेंट वॉइस क्लोन (IVC) बनाने पर कोई कस्टम AI मॉडल ट्रेन या तैयार नहीं किया जाता। इसके बजाय, यह सटीक वॉइस पर ट्रेनिंग करने की जगह ट्रेनिंग डेटा से मिले पहले के ज्ञान के आधार पर अनुमान लगाता है।

यह बहुत-सी वॉइसेस के लिए बेहद अच्छी तरह काम करता है। हालांकि, IVC की सबसे बड़ी सीमा तब होती है, जब आप किसी बहुत अनोखी वॉइस या ऐसे एक्सेंट वाली वॉइस को क्लोन करना चाहते हैं जिसका AI ने ट्रेनिंग के दौरान व्यापक रूप से अनुभव नहीं किया हो। ऐसे मामलों में, स्पष्ट ट्रेनिंग के साथ कस्टम मॉडल बनाने के लिए प्रोफेशनल वॉइस क्लोनिंग इस्तेमाल करना सबसे अच्छा विकल्प हो सकता है।

प्रोफेशनल वॉइस क्लोनिंग

प्रोफेशनल वॉइस
क्लोनिंग

प्रोफेशनल वॉइस क्लोनिंग हमारी Creator योजना या उससे ऊपर की योजनाओं में उपलब्ध सुविधा है। प्रोफेशनल वॉइस क्लोनिंग से आप बड़े वॉइस डेटा सेट पर समर्पित मॉडल ट्रेन करके अपनी वॉइस का ज़्यादा वास्तविक मॉडल तैयार कर सकते हैं। इससे बना मॉडल मूल वॉइस से लगभग अलग नहीं पहचाना जा सकता।

कस्टम मॉडल को फाइन-ट्यूनिंग और ट्रेनिंग की ज़रूरत होती है, इसलिए PVC को ट्रेन करने में IVC की तुलना में ज़्यादा समय लगता है। आमतौर पर फाइन-ट्यूनिंग पूरी होने में 3-6 घंटे लगते हैं, लेकिन फाइन-ट्यूनिंग की कतार में मौजूद दूसरे PVC की संख्या के आधार पर कभी-कभी इसमें थोड़ा ज़्यादा समय लग सकता है।

ऑडियो रिकॉर्डिंग के लिए शुरुआती गाइड

अगर आप ऑडियो रिकॉर्डिंग में नए हैं, तो शुरुआत करने के लिए यहां कुछ सुझाव दिए गए हैं।

रिकॉर्डिंग की जगह

ऑडियो रिकॉर्ड करते समय, उपयुक्त जगह चुनें और कमरे की गूंज/रीवरब को कम करने की व्यवस्था करें। इसलिए, हमें कमरे को जितना संभव हो सके उतना “डेड” बनाना है। ध्वनिक रूप से ट्रीट किया गया वोकल बूथ इसी काम के लिए होता है। अगर आपके पास वोकल बूथ उपलब्ध नहीं है, तो आप DIY वोकल बूथ, “कंबल का किला” या अलमारी जैसे कुछ विकल्प आज़मा सकते हैं।

DIY ध्वनिक व्यवस्था के कुछ YouTube उदाहरण यहां दिए गए हैं:

माइक्रोफ़ोन, पॉप-फ़िल्टर और ऑडियो इंटरफ़ेस

एक अच्छा माइक्रोफ़ोन बहुत ज़रूरी है। माइक्रोफ़ोन की कीमत $100 से $10,000 तक हो सकती है, लेकिन ज़्यादातर वॉइसओवर काम के लिए $150 से $300 का प्रोफेशनल XLR माइक्रोफ़ोन पर्याप्त है।

किफायती लेकिन उच्च-गुणवत्ता वाले वॉइसओवर सेटअप के लिए, Focusrite इंटरफ़ेस के साथ Audio-Technica AT2020 या Rode NT1 microphone पर विचार करें। $300 से $500 की कीमत वाला यह सेटअप प्रोफेशनल उपयोग के लिए उपयुक्त उच्च-गुणवत्ता रिकॉर्डिंग देता है और साफ़ नतीजों के लिए इसमें सेल्फ़-नॉइज़ बहुत कम होता है।

रिकॉर्डिंग करते समय माइक्रोफ़ोन के सामने सही पॉप-फ़िल्टर लगाना पक्का करें, ताकि प्लोसिव, सांस और हवा सीधे डायफ्राम/माइक्रोफ़ोन से न टकराएं। वरना आवाज़ खराब लगेगी और क्लोनिंग प्रक्रिया में भी समस्या आएगी।

डिजिटल ऑडियो वर्कस्टेशन (DAW)

कई अलग-अलग रिकॉर्डिंग समाधान उपलब्ध हैं, जो एक ही काम करते हैं: ऑडियो रिकॉर्ड करना। हालांकि, वे सभी समान नहीं हैं। जब तक वे कम से कम 24 बिट्स की बिटरेट के साथ 44.1kHz या 48kHz पर WAV फ़ाइलें रिकॉर्ड कर सकते हैं, वे ठीक रहेंगे। आपको किसी फैंसी पोस्ट-प्रोसेसिंग, प्लगइन, डीनॉइज़र या किसी और चीज़ की ज़रूरत नहीं है, क्योंकि हम ऑडियो रिकॉर्डिंग को सरल रखना चाहते हैं।

अगर आप कोई सुझाव चाहते हैं, तो हम REAPER जैसा विकल्प सुझाएंगे, जो बेहद लचीला शानदार DAW है। यह बहुत-से ऑडियो कामों के लिए इंडस्ट्री स्टैंडर्ड है। एक और अच्छा मुफ़्त विकल्प Audacity है।

डिजिटल डिस्टॉर्शन और अत्यधिक नॉइज़ से बचने के लिए रिकॉर्डिंग लेवल को सही रखें—न बहुत तेज़, न बहुत धीमा। वॉइसओवर काम के लिए -6 dB से -3 dB की पीक और -18 dB की औसत लाउडनेस रखें, ताकि नॉइज़ फ़्लोर कम करते हुए स्पष्टता बनी रहे। प्रोजेक्ट और रिकॉर्डिंग वातावरण के आधार पर सर्वोत्तम परिणामों के लिए ध्यान से मॉनिटर करें और ज़रूरत के मुताबिक लेवल समायोजित करें।

पोज़िशनिंग

एक उपयोगी नियम है कि माइक्रोफ़ोन से लगभग दो मुट्ठी, यानी लगभग 20cm (7-8 in) की दूरी रखें और आपके व माइक्रोफ़ोन के बीच पॉप फ़िल्टर हो। कुछ लोग पॉप फ़िल्टर को पूरी तरह पीछे रखना पसंद करते हैं, ताकि वे उसे सीधे उसके साथ सटा सकें। इससे उन्हें माइक्रोफ़ोन से एक जैसी दूरी बनाए रखने में आसानी होती है।

माइक्रोफ़ोन में सीधे सांस जाने या प्लोसिव आवाज़ों से बचने का एक और आम तरीका है कि कोण बनाकर बोला जाए। कोण बनाकर बोलने से सांस छोड़ते समय निकलने वाली हवा के सीधे माइक्रोफ़ोन से टकराने की संभावना कम हो जाती है और वह उसके पास से निकल जाती है।

प्रदर्शन

आपका प्रदर्शन इस पूरी रिकॉर्डिंग सेशन के सबसे महत्वपूर्ण पहलुओं में से एक है। AI आपकी वॉइस से जुड़ी हर चीज़ को अपनी सर्वोत्तम क्षमता से क्लोन करने की कोशिश करेगा, और उसकी क्षमता बहुत अधिक है। इसका मतलब है कि यह आपकी बोलने की लय, टोनैलिटी, प्रदर्शन शैली, आपके रुकने की अवधि, आपका हकलाना, गहरी सांसें लेना, सांस वाली आवाज़ में बोलना या बहुत ज़्यादा “उम्” और “आह” कहना—इन सबको दोहराने की कोशिश करेगा; यह उन्हें भी दोहरा सकता है। इसलिए, ऑडियो फ़ाइल में हमें ठीक वैसा ही प्रदर्शन और वॉइस चाहिए जिसे हम क्लोन करना चाहते हैं, न कम न ज़्यादा। यही वजह है कि ऐसा स्क्रिप्ट ढूंढना काफी ज़रूरी है जिसे आप पढ़ सकें और जो उस टोनैलिटी से मेल खाता हो जिसका हम लक्ष्य रख रहे हैं।

AI के लिए रिकॉर्डिंग करते समय एकरूपता बनाए रखना बहुत ज़रूरी है। अगर आप कोई वॉइस रिकॉर्ड कर रहे हैं, तो उसे पूरे समय बहुत अभिव्यक्तिपूर्ण रखें या पूरे समय बहुत शांत रखें; आप दोनों को मिला नहीं सकते, वरना AI अस्थिर हो सकता है क्योंकि उसे समझ नहीं आएगा कि वॉइस का कौन-सा हिस्सा क्लोन करना है। एक्सेंट के साथ भी यही बात लागू होती है—पूरी रिकॉर्डिंग में वही एक्सेंट रखें। सही क्लोन के लिए एकरूपता ज़रूरी है!

अक्सर पूछे जाने वाले सवाल

प्रोफेशनल वॉइस क्लोनिंग, इंस्टेंट वॉइस क्लोनिंग से अलग है, जो आपको 2 मिनट से कम ऑडियो के साथ तेज़ी से वॉइस क्लोन करने देती है। प्रोफेशनल वॉइस क्लोनिंग से आप अपनी वॉइस का ज़्यादा वास्तविक मॉडल ट्रेन कर सकते हैं। यह बड़े वॉइस डेटासेट पर एक समर्पित मॉडल को ट्रेन करके हासिल किया जाता है, जिससे ऐसा मॉडल बनता है जो आपकी मूल वॉइस से लगभग अलग नहीं पहचाना जा सकता।

प्रोफेशनल वॉइस क्लोन के लिए फ़ाइन-ट्यूनिंग और ट्रेनिंग ज़रूरी होती है, इसलिए अपने वॉइस क्लोन को इस्तेमाल करने से पहले कुछ समय लगेगा। इसका अनुमान देना मुश्किल है क्योंकि यह आपसे पहले कतार में मौजूद लोगों की संख्या और कुछ अन्य कारकों पर निर्भर करता है, लेकिन आमतौर पर फ़ाइन-ट्यूनिंग में 3–6 घंटे लगते हैं।

आपका प्रोफेशनल वॉइस क्लोन तैयार होने पर आपको ईमेल से सूचना मिलेगी।

इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग के लिए, हम कई तरह की फ़ाइल स्वीकार करते हैं। हम 192kbps या उससे अधिक के MP3 की पुरज़ोर सलाह देते हैं।

सुझाया गया फ़ॉर्मैट

  • MP3, 192kbps या अधिक

सुझाई गई अवधि

  • इंस्टेंट वॉइस क्लोनिंग: अच्छी गुणवत्ता का 1–2 मिनट का ऑडियो
  • प्रोफेशनल वॉइस क्लोनिंग: अच्छी गुणवत्ता का 30–180 मिनट का ऑडियो

WAV जैसे असंपीड़ित फ़ॉर्मैट आमतौर पर क्लोन की गुणवत्ता नहीं बढ़ाते और अपलोड प्रक्रिया में समस्याएँ पैदा कर सकते हैं। इसके बजाय रिकॉर्डिंग की गुणवत्ता पर ध्यान दें: बिना बैकग्राउंड नॉइज़, कमरे की गूँज या कई स्पीकर वाली साफ़ रिकॉर्डिंग इस्तेमाल करें। वॉल्यूम और टोन एक जैसा रखें और लंबे मौन अंतराल न हों।

ज़्यादा जानकारी के लिए इंस्टेंट वॉइस क्लोनिंग (IVC) और प्रोफेशनल वॉइस क्लोनिंग (PVC) देखें।

ElevenLabs दो क्लोनिंग विकल्प देता है:

  • इंस्टेंट वॉइस क्लोनिंग: करीब 1–3 मिनट के ऑडियो से तेज़ नतीजे। ज़्यादातर आवाज़ों के लिए अच्छी तरह काम करती है, लेकिन असामान्य एक्सेंट या खास आवाज़ों के साथ मुश्किल हो सकती है।
  • प्रोफेशनल वॉइस क्लोनिंग: 30 मिनट से करीब 3 घंटे के ऑडियो का इस्तेमाल करके बेहतर गुणवत्ता देती है। फाइन-ट्यूनिंग में आमतौर पर 3–6 घंटे लगते हैं और कतार में बहुत-सी आवाज़ें होने पर अधिक समय लग सकता है।

अगर इंस्टेंट वॉइस क्लोनिंग आपकी आवाज़ या एक्सेंट को अच्छी तरह कैप्चर नहीं करती, तो प्रोफेशनल वॉइस क्लोनिंग आज़माएं।

क्लोन बनने के बाद उसका एक्सेंट या टोन बदला नहीं जा सकता। नतीजा बेहतर करने के लिए इस्तेमाल किए गए ऑडियो सैंपल बदलें। सैंपल में छोटे बदलाव से बड़ा अंतर आ सकता है।

ElevenLabs में, हम बौद्धिक संपदा अधिकारों का सम्मान करने और अपनी टेक्नोलॉजी के संभावित दुरुपयोग को रोकने के लिए सुरक्षा उपाय लागू करने, दोनों के लिए पूरी तरह प्रतिबद्ध हैं:

  • हम सिर्फ़ उन क्लाइंट्स के साथ काम करते हैं जो हमारी सेवा की शर्तों और निषिद्ध उपयोग नीति का पालन करते हैं। ये हमारी टेक्नोलॉजी का किसी भी गैरकानूनी या हानिकारक उद्देश्य के लिए दुर्भावनापूर्ण इस्तेमाल प्रतिबंधित करती हैं;
  • हम वॉइस मालिकों और उनके लाइसेंसधारकों को अपने अधिकारों का दावा करने में सहयोग देते हैं और सभी ज्ञात उल्लंघनों की समीक्षा करके कार्रवाई करते हैं;
  • हमारे मॉडल्स से जनरेट किया गया हर ऑडियो तुरंत उस यूज़र तक ट्रेस किया जा सकता है जिसने उसे जनरेट किया है।

हम जो टेक्नोलॉजी विकसित कर रहे हैं वह नई है और इसके लिए स्पष्ट नियम अभी लागू नहीं किए गए हैं। एक AI रिसर्च लैब के रूप में हमारा एक लक्ष्य इस टेक्नोलॉजी के अस्तित्व, इसकी क्षमता और इसकी सीमाओं के बारे में जागरूकता फैलाना भी है।

आप अपने वॉइस क्लोन्स को अलग फ़ाइलों के रूप में डाउनलोड या एक्सपोर्ट नहीं कर सकते। वॉइस क्लोन्स आपके ElevenLabs अकाउंट में ही रहते हैं।

फिर भी आप ElevenLabs वेबसाइट के बाहर अपनी ElevenLabs वॉइसेज़ इस्तेमाल कर सकते हैं। आपकी API key से थर्ड-पार्टी सेवाएं ElevenLabs API को कॉल कर सकती हैं और आपके अकाउंट की वॉइसेज़ से स्पीच जनरेट कर सकती हैं।

अगर आप बाद में किसी क्लोन को दोबारा बनाना चाहते हैं, तो उसे बनाने के लिए इस्तेमाल किए गए मूल ऑडियो सैंपल्स संभालकर रखें। एक ही ऑडियो इस्तेमाल करने पर भी हर क्लोन की आवाज़ थोड़ी अलग होगी।

विस्तृत गाइड के लिए, हम आपको Instant Voice Cloning और Professional Voice Cloning पर हमारा डॉक्यूमेंटेशन पढ़ने की सलाह देते हैं।

सीधी बात: अच्छा और एक-जैसा इनपुट = अच्छा और एक-जैसा आउटपुट।

लंबाई

  • Instant Voice Cloning: अच्छी क्वालिटी के ऑडियो के 1 - 2 मिनट
  • Professional Voice Cloning: अच्छी क्वालिटी के ऑडियो के 30 - 180 मिनट

जितने अच्छे और स्पष्ट ऑडियो क्लिप्स मिल सकें, उनका इस्तेमाल करें। उनमें सिर्फ़ एक स्पीकर होना चाहिए, बैकग्राउंड नॉइज़ या रुकावट नहीं होनी चाहिए, और उनकी आवाज़ तेज़ व साफ़ होनी चाहिए।

सिर्फ़ लंबाई बढ़ाने के लिए अलग-अलग क्वालिटी के बहुत-से क्लिप्स इस्तेमाल करने के बजाय, ऐसे क्लिप्स को प्राथमिकता दें जिनमें माइक्रोफ़ोन की क्वालिटी साफ़ तौर पर बहुत अच्छी हो और जिनकी क्वालिटी व टोन पूरे क्लिप में एक-जैसी हो। कुल अवधि बढ़ाने पर ध्यान न दें।

पक्का करें कि आपके क्लिप्स में ज़्यादातर डायलॉग स्पीकर की उस बोलने की शैली और इंटोनेशन से मेल खाते हों, जिसे आप सबसे ज़्यादा पसंद करते हैं। ऐसे डायलॉग के बहुत ज़्यादा हिस्से नहीं होने चाहिए जिनमें स्पीकर आपके पसंदीदा स्पीच पैटर्न से अलग बोलता हो।

ज़रूरत हो तो बैकग्राउंड नॉइज़ कम करने के लिए नॉइज़ रिमूवर का इस्तेमाल करें।

आप हमारे डॉक्यूमेंटेशन में यहाँ ज़्यादा जानकारी पा सकते हैं।

हां। आप Flash v2.5 और Multilingual v2 द्वारा समर्थित किसी भी भाषा में अपनी वॉइस क्लोन कर सकते हैं। समर्थित भाषाओं की पूरी सूची यहाँ देखें।

आप ऐसी भाषा बोलने वाली वॉइस भी क्लोन कर सकते हैं, जिसे AI सपोर्ट नहीं करता। क्लोन स्पीकर का टोन कैप्चर कर सकता है, लेकिन वह उस भाषा में बोल नहीं पाएगा और नतीजे अनुमान से अलग हो सकते हैं। हम इसकी सलाह नहीं देते।

नहीं। आप सिर्फ़ अपनी वॉइस का Professional Voice Clone बना सकते हैं। किसी की सहमति होने पर भी आप किसी और की वॉइस क्लोन नहीं कर सकते। सभी Professional Voice Clones में यह पुष्टि करने के लिए वेरिफ़िकेशन प्रक्रिया ज़रूरी है कि वॉइस आपकी है।

अगर कोई व्यक्ति अपनी वॉइस आपके साथ शेयर करना चाहता है, तो वह अपने अकाउंट पर Professional Voice Clone बनाकर उसे वेरिफ़ाई कर सकता है, फिर शेयरिंग लिंक से उसे निजी तौर पर आपके साथ शेयर कर सकता है। हमारे लेख में और जानें: मैं वॉइस कैसे शेयर करूं?

दुर्भाग्य से, यह संभव नहीं है। आपके Professional Voice Clone (PVC) के सेटअप के दौरान बताया गया था कि वेरिफ़िकेशन स्टेज पर जाने के बाद, अपनी वॉइस वेरिफ़ाई करने तक आप इस प्रक्रिया में आगे बढ़ चुके होते हैं और वापस नहीं जा सकते।

अगर आपको अपने Professional Voice Clone के लिए मदद चाहिए, तो support@elevenlabs.io पर ईमेल करके सपोर्ट से संपर्क करें।

सभी Professional Voice Clones (PVCs) अपने आप Flash v2.5, Turbo v2.5 और Multilingual v2 मॉडल्स पर ट्रेन होंगे। अंग्रेज़ी ऑडियो पर ट्रेन किए गए PVCs अपने आप Flash v2 और Turbo v2 मॉडल्स पर भी ट्रेन होंगे।

अगर आपके पास पहले से PVC है, तो अब आपके पास उसे अतिरिक्त मॉडल्स पर फ़ाइन-ट्यून करने का विकल्प है। भविष्य में, अगर फ़ाइन-ट्यूनिंग सपोर्ट करने वाले नए मॉडल्स रिलीज़ होते हैं, तो आपको नोटिफ़िकेशन मिलेगा। यह एक एक्सक्लेमेशन आइकन से दिखाया जाता है, जो My Voices. में वॉइस सूची में आपकी वॉइस के दाईं ओर दिखाई देगा। इस आइकन पर होवर करने पर नोटिफ़िकेशन दिखेगा।

फ़ाइन-ट्यूनिंग प्रक्रिया शुरू करने के लिए, My Voices, में सूची में अपनी वॉइस के नाम पर होवर करें। आपको सभी उपलब्ध मॉडल्स दिखेंगे। जिन मॉडल्स पर वॉइस पहले ही फ़ाइन-ट्यून हो चुकी है, वे टिक आइकन के साथ दिखेंगे, और फ़ाइन-ट्यूनिंग के लिए उपलब्ध मॉडल्स प्लस आइकन के साथ दिखेंगे। फ़ाइन-ट्यूनिंग शुरू करने के लिए, बस मॉडल पर क्लिक करें। 

जब वॉइस फ़ाइन-ट्यून हो रही हो, तो प्रगति देखने के लिए मॉडल नाम पर होवर कर सकते हैं। ध्यान दें कि वॉइस कैशिंग की वजह से, नवीनतम प्रगति देखने के लिए आपको पेज रिफ़्रेश करना पड़ सकता है। फ़ाइन-ट्रेनिंग पूरी होने के बाद, आपको ऐप में और ईमेल से नोटिफ़िकेशन मिलेगा।

Professional Voice Clone (PVC) स्लॉट्स आपकी सब्सक्रिप्शन टियर के हिसाब से अलग-अलग होते हैं:


बेस PVC स्लॉट्स
  • Free और Starter प्लान: कोई PVC स्लॉट उपलब्ध नहीं
  • Creator, Pro और पुराने Scale प्लान: 1 PVC स्लॉट
  • Scale और पुराने Business प्लान: 3 PVC स्लॉट्स
  • Business प्लान: 10 PVC स्लॉट्स
  • Enterprise प्लान: PVC स्लॉट्स की कस्टम संख्या

अतिरिक्त PVC स्लॉट्स

जब आपके द्वारा वॉइस लाइब्रेरी में शेयर किए गए Professional Voice Clone को Studio Quality के रूप में मार्क किया जाता है, तो आप अतिरिक्त PVC स्लॉट्स पा सकते हैं।

  • Studio Quality रिव्यू सिर्फ़ उन वॉइसेज़ पर लागू होता है जिन्हें आपने वॉइस लाइब्रेरी में शेयर किया है
  • आपकी वॉइस वॉइस लाइब्रेरी में स्वीकार होने के बाद Studio Quality रिव्यू अपने आप होता है। यह तुरंत नहीं होता
  • अगर आपके शेयर किए गए PVC को Studio Quality के रूप में मार्क किया जाता है, तो आपको अपने आप एक अतिरिक्त PVC स्लॉट मिलता है
  • अगर कई शेयर की गई वॉइसेज़ को Studio Quality के रूप में मार्क किया जाए, तो यह कई बार हो सकता है
  • आप ज़्यादा PVCs नहीं बना सकते, जब तक कि आप इनमें से कोई एक काम न करें:
    • वॉइस लाइब्रेरी में शेयर की गई वॉइसेज़ के Studio Quality रिव्यू से अतिरिक्त स्लॉट्स पाएं
    • Scale या उससे ऊपर के प्लान में अपग्रेड करें
ज़रूरी नोट्स
  • Professional Voice Clones का इस्तेमाल सिर्फ़ अपनी वॉइस क्लोन करने के लिए किया जा सकता है
  • अगर आप Creator टियर से नीचे के प्लान में डाउनग्रेड करते हैं, तो आपका PVC आपके अकाउंट में रहेगा, लेकिन Creator या उससे ऊपर अपग्रेड करने तक आप उसका इस्तेमाल नहीं कर पाएंगे
  • आपके पास मौजूद कस्टम वॉइसेज़ की कुल संख्या, जिसमें PVCs भी शामिल हैं, आपकी सब्सक्रिप्शन टियर पर निर्भर करती है

इंस्टेंट वॉइस क्लोनिंग से क्लोनिंग करना थोड़ा जटिल हो सकता है, और इसके लिए हमारे कुछ सामान्य दिशानिर्देश हैं। हालांकि, ये सिर्फ दिशानिर्देश हैं। सैंपल की संख्या या लंबाई के लिए हमारे कोई तय नियम नहीं हैं। हमने देखा है कि यूज़र्स ने सिर्फ़ 30 सेकंड के सैंपल इस्तेमाल किए और बेहतरीन नतीजे पाए, जबकि कुछ यूज़र्स ने 10 मिनट के ऑडियो का इस्तेमाल किया और उनके नतीजे खराब रहे। लेकिन कुछ बातें हैं जिन पर आपको ध्यान देना चाहिए।

  • इंस्टेंट वॉइस क्लोनिंग इस्तेमाल करते समय ऑडियो की गुणवत्ता सबसे अहम पहलू है।
  • सैंपल की संख्या मायने नहीं रखती; कुल अवधि ज़रूरी है। 2–3 मिनट से ज़्यादा ऑडियो रखने से बहुत कम सुधार मिलेगा और कुछ मामलों में क्लोन की स्थिरता पर बुरा असर भी पड़ सकता है।

अपनी वॉइस सत्यापित करने के बाद, उसे इस्तेमाल करने से पहले हमारे मॉडल्स पर फ़ाइन-ट्यूनिंग करनी होगी। इस दौरान, आप My Voices में अपनी वॉइस के नाम पर कर्सर ले जाकर उसका स्टेटस देख सकते हैं। यहाँ आपकी वॉइस के लिए उपलब्ध सभी मॉडल दिखेंगे। हर मॉडल का स्टेटस देखने के लिए उसके नाम पर कर्सर ले जाएँ। 

अगर कुछ गड़बड़ हुई है, तो आपको यह स्टेटस दिख सकता है:

हमें खेद है कि ट्रेनिंग रन में समस्या आई और इसे फिर से शुरू किया गया है। आगे कोई कार्रवाई ज़रूरी नहीं है। इसका मतलब है कि कुछ गड़बड़ हुई, लेकिन आपकी वॉइस को फ़ाइन-ट्यूनिंग प्रक्रिया दोबारा शुरू करने के लिए अपने-आप कतार में डाल दिया गया है। आपकी वॉइस को अगली कोशिश में फ़ाइन-ट्यूनिंग प्रक्रिया सफलतापूर्वक पूरी कर लेनी चाहिए, लेकिन अगर कई बार विफलता होती है, तो डेटासेट में ऐसी समस्या हो सकती है जिसे AI हल नहीं कर सकता।

इसे ठीक करने के लिए आप वॉइस डिलीट करके शुरुआत से डेटा फिर से अपलोड कर सकते हैं। इससे कुछ यूज़र्स को मदद मिली है।

अगर इससे समस्या हल नहीं होती, तो आपको अपने ट्रेनिंग ऑडियो की समीक्षा करनी पड़ सकती है और संभव है कि अलग ट्रेनिंग ऑडियो इस्तेमाल करना पड़े।

फ़ाइन-ट्यूनिंग प्रक्रिया के दौरान विफलता होने पर आप हमें support@elevenlabs.io पर ईमेल करके सहायता टीम से संपर्क कर सकते हैं।

अगर आप अपना प्रोफेशनल वॉइस क्लोन बनाते समय सत्यापन की सभी कोशिशों में विफल हो जाते हैं, तो 24 घंटे इंतज़ार कर सकते हैं, जिसके बाद आप प्रक्रिया फिर से आज़मा पाएँगे।

आप support@elevenlabs.io पर ईमेल करके सहायता टीम से भी संपर्क कर सकते हैं, ताकि वे आपके लिए इसकी जाँच कर सकें। अगर सब कुछ सही लगता है, तो वे आपकी सत्यापन कोशिशें रीसेट कर देंगे, ताकि आप प्रक्रिया फिर से आज़मा सकें।

अपने प्रोफेशनल वॉइस क्लोन को सफलतापूर्वक सत्यापित करने के लिए ये सुझाव अपनाएँ:

  • पक्का करें कि आपके वेब ब्राउज़र को माइक्रोफ़ोन इस्तेमाल करने की अनुमति है और आपका माइक्रोफ़ोन म्यूट नहीं है।
  • सुनिश्चित करें कि कंप्यूटर के माइक्रोफ़ोन से रिकॉर्ड किया गया ऑडियो क्लोनिंग के लिए अपलोड किए गए ऑडियो जैसा सुनाई देता है और उसमें बैकग्राउंड नॉइज़ या बाहरी ऑडियो का हस्तक्षेप नहीं है।
  • जिस ऑडियो से आपने वॉइस को ट्रेन किया था, उसी जैसी शैली में बोलने की कोशिश करें।
  • सत्यापन की हर लाइन सिर्फ़ एक बार पढ़ें, फिर रिकॉर्डिंग रोकने के लिए Stop दबाएँ। लाइन को एक से ज़्यादा बार पढ़ने पर सत्यापन प्रक्रिया विफल हो सकती है।

अगर आप अपने प्रोफेशनल वॉइस क्लोन (PVC) को फ़ाइन-ट्यूनिंग प्रक्रिया पूरी होने और इस्तेमाल के लिए उपलब्ध होने से पहले इस्तेमाल करने की कोशिश करते हैं, तो आपको यह त्रुटि दिखाई देगी।

PVC बनाने पर, इस्तेमाल के लिए उपलब्ध होने से पहले उसे कई प्रक्रियाओं से गुज़रना होता है। अपनी वॉइस सत्यापित करने के बाद, उसे प्रोसेस किया जाएगा और फ़ाइन-ट्यूनिंग के लिए कतार में डाल दिया जाएगा। फ़ाइन-ट्यूनिंग के लिए पहले से कतार में मौजूद अन्य वॉइस की संख्या के आधार पर, हमारा अनुमान है कि इस प्रक्रिया में आमतौर पर 3–6 घंटे लगेंगे, लेकिन इसमें 24 घंटे तक लग सकते हैं।

आप My Voices में अपनी वॉइस की सूची से वॉइस ढूँढकर और फिर ज़्यादा जानकारी देखने के लिए View पर क्लिक करके अपने PVC की प्रगति देख सकते हैं। मौजूदा स्टेटस देखने के लिए हर मॉडल पर कर्सर ले जाएँ।  

हर स्टेटस के मतलब की ज़्यादा जानकारी के लिए मेरे प्रोफेशनल वॉइस क्लोन का स्टेटस क्या दर्शाता है? देखें।

आपके PVC की फ़ाइन-ट्यूनिंग पूरी होने और इस्तेमाल के लिए उपलब्ध होने पर, आपको पॉप-अप नोटिफ़िकेशन दिखेगा और ईमेल से भी सूचना मिलेगी।

प्रोसेस होने के दौरान आपका प्रोफेशनल वॉइस क्लोन कुछ अलग चरणों से गुज़रेगा। ये चरण My Voices में आपके प्रोफेशनल वॉइस क्लोन के लिए दिखाए गए स्टेटस में दिखाई देते हैं।

मौजूदा स्टेटस देखने के लिए, सूची में अपनी वॉइस ढूँढें और दाईं ओर दिख रहे आइकन देखें।

ड्राफ़्ट: इस स्टेटस का मतलब है कि आपकी वॉइस अधूरी है। आमतौर पर ऐसा तब होता है जब आपने वॉइस बनाना पूरा नहीं किया है या आपने अभी तक वॉइस सत्यापित नहीं की है।

सत्यापन प्रक्रिया शुरू करने के लिए, टिक आइकन पर क्लिक करें।

वॉइस बनाने की प्रक्रिया पर वापस जाने के लिए More actions (तीन डॉट) पर क्लिक करें और Edit voice चुनें।

अपनी वॉइस सत्यापित करने के बाद, उसे इस्तेमाल करने से पहले हमारे मॉडल्स पर फ़ाइन-ट्यूनिंग करनी होगी। आप My Voices में अपनी वॉइस के नाम पर कर्सर ले जाकर इस प्रक्रिया को ट्रैक कर सकते हैं। यहाँ सभी उपलब्ध मॉडल्स की सूची दिखेगी और हर मॉडल का स्टेटस बताने के लिए एक आइकन होगा। 

ज़्यादा जानकारी के लिए मॉडल के नाम पर कर्सर ले जाएँ। आपको इनमें से कोई एक स्टेटस दिखेगा:

ट्रेनिंग रन शेड्यूल हो गया है: इसका मतलब है कि आपकी वॉइस ट्रेनिंग के लिए उपलब्ध स्लॉट खुलने का इंतज़ार कर रही है। आपकी वॉइस कितनी देर तक कतार में रहेगी, यह कतार में मौजूद अन्य वॉइस की संख्या पर निर्भर करेगा।

डेटासेट बनाया जा रहा है और फ़ाइन-ट्यूनिंग चल रही है: स्लॉट खुलने के बाद फ़ाइन-ट्यूनिंग शुरू होगी। इसमें 6–24 घंटे लग सकते हैं। प्रतिशत के रूप में दिखेगा कि आपकी वॉइस ट्रेनिंग प्रक्रिया के हर चरण में कितनी आगे बढ़ चुकी है।

हमें खेद है कि ट्रेनिंग रन में समस्या आई और इसे फिर से शुरू किया गया है। आगे कोई कार्रवाई ज़रूरी नहीं है

इसका मतलब है कि कुछ गड़बड़ हुई, लेकिन आपकी वॉइस को फ़ाइन-ट्यूनिंग प्रक्रिया दोबारा शुरू करने के लिए अपने-आप कतार में डाल दिया गया है। आपकी वॉइस को अगली कोशिश में फ़ाइन-ट्यूनिंग प्रक्रिया सफलतापूर्वक पूरी कर लेनी चाहिए, लेकिन अगर कई बार विफलता होती है, तो हमें support@elevenlabs.io पर ईमेल करके सहायता टीम से संपर्क करें।

वॉइस मॉडल के साथ इस्तेमाल के लिए तैयार है: इसका मतलब है कि इस मॉडल के लिए फ़ाइन-ट्यूनिंग प्रक्रिया पूरी हो गई है और अब आप इस मॉडल के साथ अपनी वॉइस इस्तेमाल कर सकते हैं।

फ़ाइन-ट्यूनिंग शुरू करने के लिए क्लिक करें: कुछ मॉडल्स अपने-आप ट्रेन नहीं होते और फ़ाइन-ट्रेनिंग शुरू करने के लिए आपको मॉडल के नाम पर क्लिक करना होगा। अगर आपकी वॉइस के लिए फ़ाइन-ट्यूनिंग के अतिरिक्त मॉडल उपलब्ध हो गए हैं, तो आपकी वॉइस के आगे विस्मयादिबोधक आइकन दिखेगा। 

फ़ाइन-ट्यूनिंग प्रक्रिया शुरू करने के लिए, अपनी वॉइस के नाम पर कर्सर ले जाएँ और मॉडल के नाम पर क्लिक करें।

हम Flash v2.5 मॉडल द्वारा समर्थित सभी भाषाओं के लिए प्रोफेशनल वॉइस क्लोनिंग का समर्थन करते हैं।

फ़िलहाल, प्रोफेशनल वॉइस क्लोनिंग के साथ हम इन भाषाओं का समर्थन करते हैं:

  • 🇺🇸 अंग्रेज़ी (USA)
  • 🇬🇧 अंग्रेज़ी (UK)
  • 🇦🇺 अंग्रेज़ी (ऑस्ट्रेलिया)
  • 🇨🇦 अंग्रेज़ी (कनाडा)
  • 🇯🇵 जापानी
  • 🇨🇳 चीनी
  • 🇩🇪 जर्मन
  • 🇮🇳 हिंदी
  • 🇫🇷 फ़्रेंच (फ़्रांस)
  • 🇨🇦 फ़्रेंच (कनाडा)
  • 🇰🇷 कोरियाई
  • 🇧🇷 पुर्तगाली (ब्राज़ील)
  • 🇵🇹 पुर्तगाली (पुर्तगाल)
  • 🇮🇹 इतालवी
  • 🇪🇸 स्पेनिश (स्पेन)
  • 🇲🇽 स्पेनिश (मेक्सिको)
  • 🇮🇩 इंडोनेशियाई
  • 🇳🇱 डच
  • 🇹🇷 तुर्की
  • 🇵🇭 फ़िलिपीनो
  • 🇵🇱 पोलिश
  • 🇸🇪 स्वीडिश
  • 🇧🇬 बल्गेरियाई
  • 🇷🇴 रोमानियाई
  • 🇸🇦 अरबी (सऊदी अरब)
  • 🇦🇪 अरबी (UAE)
  • 🇨🇿 चेक
  • 🇬🇷 ग्रीक
  • 🇫🇮 फ़िनिश
  • 🇭🇷 क्रोएशियाई
  • 🇲🇾 मलय
  • 🇸🇰 स्लोवाक
  • 🇩🇰 डेनिश
  • 🇮🇳 तमिल
  • 🇺🇦 यूक्रेनी
  • 🇷🇺 रूसी
  • 🇭🇺 हंगेरियन
  • 🇳🇴 नॉर्वेजियन
  • 🇻🇳 वियतनामी

प्रोफेशनल वॉइस क्लोनिंग में किसी खास वक्ता की आवाज़ के बड़े डेटासेट पर मॉडल को ट्रेन (फाइन-ट्यून) करके एक कस्टम मॉडल बनाया जाता है।

सैंपल अपलोड करने और अपनी आवाज़ सत्यापित करने के बाद, आपका प्रोफेशनल वॉइस क्लोन कतार में जोड़ दिया जाएगा। अनुमानित ट्रेनिंग समय करीब 3–6 घंटे है। यह कुछ कारकों पर निर्भर करता है, इसलिए सटीक अनुमान देना मुश्किल है। कभी-कभी इसमें अधिक समय लग सकता है।

आप माय वॉइसेज़ में अपनी वॉइस का मौजूदा स्टेटस देख सकते हैं। अधिक जानकारी के लिए मेरे प्रोफेशनल वॉइस क्लोन के स्टेटस का क्या मतलब है? देखें।

आपके PVC की फाइन-ट्यूनिंग प्रक्रिया पूरी होने पर, आपको ऐप में और ईमेल से सूचना मिलेगी कि आपकी वॉइस अब इस्तेमाल के लिए तैयार है।

No results