इंस्टेंट वॉइस क्लोनिंग

जानें कि हमारे बेहतरीन मॉडलों से अपनी वॉइस को तुरंत कैसे क्लोन करें।

वॉइस क्लोनिंग प्रोडक्ट सुविधा

इंस्टेंट वॉइस क्लोन बनाना

वॉइस क्लोन करते समय यह ध्यान रखना ज़रूरी है कि AI को किन चीज़ों पर ट्रेन किया गया है: कौन-सी भाषाएं और किस तरह का डेटासेट। हर मॉडल और उसकी खूबियों के बारे में मॉडल्स पेज पर और पढ़ें।

गाइड

अगर आपको कानूनी तौर पर अनुमत चीज़ों को लेकर कोई संदेह है, तो अधिक जानकारी के लिए कृपया सेवा की शर्तें और हमारी AI सुरक्षा जानकारी देखें।

1

इंस्टेंट वॉइस क्लोनिंग पेज पर जाएं

ElevenLabs डैशबोर्ड में बाईं ओर वॉइसेस सेक्शन चुनें, फिर प्लस आइकन पर क्लिक करें।

मोडल से इंस्टेंट वॉइस क्लोन चुनें।

2

अपना ऑडियो अपलोड या रिकॉर्ड करें

अपना ऑडियो अपलोड या रिकॉर्ड करने के लिए स्क्रीन पर दिए गए निर्देशों का पालन करें।

3

वॉइस विवरण की पुष्टि करें

वॉइस क्लोनिंग IVC मोडल

अपने वॉइस क्लोन का नाम और लेबल दें, पुष्टि करें कि आपको वॉइस क्लोन करने का अधिकार और सहमति है, फिर वॉइस सेव करें पर क्लिक करें।

4

अपना वॉइस क्लोन इस्तेमाल करें

डैशबोर्ड के वॉइसेस सेक्शन में माय वॉइसेस पर क्लिक करें, फिर इस्तेमाल शुरू करने के लिए यूज़ वॉइस पर क्लिक करें।

सर्वोत्तम तरीके

कम से कम 1 मिनट का ऑडियो रिकॉर्ड करें

3 मिनट से ज़्यादा रिकॉर्ड करने से बचें। इससे बहुत कम सुधार होगा और कुछ मामलों में क्लोन पर नकारात्मक असर भी पड़ सकता है।

ऑडियो कैसे रिकॉर्ड किया गया है, यह सैंपल की कुल अवधि (कुल रनटाइम) से ज़्यादा महत्वपूर्ण है। आपके इस्तेमाल किए गए सैंपल की संख्या मायने नहीं रखती; उनकी कुल अवधि (कुल रनटाइम) ही महत्वपूर्ण है।

बिना किसी रीवरब, आर्टिफैक्ट या बैकग्राउंड नॉइज़ के लगभग 1-2 मिनट का साफ़ ऑडियो सुझाया जाता है। जब हम “ऑडियो या रिकॉर्डिंग क्वालिटी” कहते हैं, तो हमारा मतलब MP3 या WAV जैसे कोडेक से नहीं है; हमारा मतलब है कि ऑडियो कैसे कैप्चर किया गया। हालांकि, ऑडियो कोडेक के लिए 128 kbps या उससे अधिक का MP3 इस्तेमाल करने की सलाह दी जाती है। ज़्यादा बिटरेट से क्लोन की क्वालिटी पर कोई खास असर नहीं पड़ता।

ऑडियो एक जैसा रखें

AI ऑडियो में सुनी हर चीज़ की नकल करने की कोशिश करेगा। इसमें व्यक्ति की बोलने की गति, उतार-चढ़ाव, एक्सेंट, टोनैलिटी, सांस लेने का पैटर्न और उसकी तीव्रता, साथ ही नॉइज़ और मुंह से आने वाली क्लिक की आवाज़ें शामिल हैं। भ्रम पैदा करने वाले नॉइज़ और आर्टिफैक्ट भी इसमें शामिल हो जाते हैं।

पक्का करें कि वॉइस का टोन और प्रदर्शन पूरे समय एक जैसा रहे। साथ ही, सभी सैंपल में वॉइस की ऑडियो क्वालिटी भी एक जैसी रखें। भले ही आप सिर्फ़ एक सैंपल इस्तेमाल कर रहे हों, पक्का करें कि वह पूरे सैंपल में एक जैसा रहे। AI को बहुत डायनामिक ऑडियो देने से, यानी पिच और वॉल्यूम में बड़े उतार-चढ़ाव होने पर, नतीजे कम अनुमानित होंगे।

अपने प्रदर्शन को दोहराएं

एक और ज़रूरी बात यह है कि AI आपकी दी हुई वॉइस के प्रदर्शन को दोहराने की कोशिश करेगा। अगर आप धीरे, एक ही टोन में और कम भावनाओं के साथ बोलते हैं, तो AI भी वैसा ही करेगा। दूसरी ओर, अगर आप बहुत भावनाओं के साथ तेज़ी से बोलते हैं, तो AI उसे दोहराने की कोशिश करेगा।

सभी सैंपल में वॉइस का एक जैसा रहना बेहद ज़रूरी है, सिर्फ़ टोन में ही नहीं बल्कि प्रदर्शन में भी। बहुत ज़्यादा अंतर होने पर AI भ्रमित हो सकता है, जिससे हर जनरेशन का आउटपुट अधिक अलग हो सकता है।

वॉल्यूम का सही संतुलन रखें

वॉल्यूम का सही संतुलन रखें, ताकि ऑडियो न बहुत धीमा हो और न बहुत तेज़। आदर्श रूप से यह -23 dB से -18 dB RMS के बीच होना चाहिए और ट्रू पीक -3 dB होनी चाहिए।

अक्सर पूछे जाने वाले सवाल

प्रोफेशनल वॉइस क्लोनिंग, इंस्टेंट वॉइस क्लोनिंग से अलग है, जो आपको 2 मिनट से कम ऑडियो के साथ तेज़ी से वॉइस क्लोन करने देती है। प्रोफेशनल वॉइस क्लोनिंग से आप अपनी वॉइस का ज़्यादा वास्तविक मॉडल ट्रेन कर सकते हैं। यह बड़े वॉइस डेटासेट पर एक समर्पित मॉडल को ट्रेन करके हासिल किया जाता है, जिससे ऐसा मॉडल बनता है जो आपकी मूल वॉइस से लगभग अलग नहीं पहचाना जा सकता।

प्रोफेशनल वॉइस क्लोन के लिए फ़ाइन-ट्यूनिंग और ट्रेनिंग ज़रूरी होती है, इसलिए अपने वॉइस क्लोन को इस्तेमाल करने से पहले कुछ समय लगेगा। इसका अनुमान देना मुश्किल है क्योंकि यह आपसे पहले कतार में मौजूद लोगों की संख्या और कुछ अन्य कारकों पर निर्भर करता है, लेकिन आमतौर पर फ़ाइन-ट्यूनिंग में 3–6 घंटे लगते हैं।

आपका प्रोफेशनल वॉइस क्लोन तैयार होने पर आपको ईमेल से सूचना मिलेगी।

इंस्टेंट वॉइस क्लोनिंग से क्लोनिंग करना थोड़ा जटिल हो सकता है, और इसके लिए हमारे कुछ सामान्य दिशानिर्देश हैं। हालांकि, ये सिर्फ दिशानिर्देश हैं। सैंपल की संख्या या लंबाई के लिए हमारे कोई तय नियम नहीं हैं। हमने देखा है कि यूज़र्स ने सिर्फ़ 30 सेकंड के सैंपल इस्तेमाल किए और बेहतरीन नतीजे पाए, जबकि कुछ यूज़र्स ने 10 मिनट के ऑडियो का इस्तेमाल किया और उनके नतीजे खराब रहे। लेकिन कुछ बातें हैं जिन पर आपको ध्यान देना चाहिए।

  • इंस्टेंट वॉइस क्लोनिंग इस्तेमाल करते समय ऑडियो की गुणवत्ता सबसे अहम पहलू है।
  • सैंपल की संख्या मायने नहीं रखती; कुल अवधि ज़रूरी है। 2–3 मिनट से ज़्यादा ऑडियो रखने से बहुत कम सुधार मिलेगा और कुछ मामलों में क्लोन की स्थिरता पर बुरा असर भी पड़ सकता है।

इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग के लिए, हम कई तरह की फ़ाइल स्वीकार करते हैं। हम 192kbps या उससे अधिक के MP3 की पुरज़ोर सलाह देते हैं।

सुझाया गया फ़ॉर्मैट

  • MP3, 192kbps या अधिक

सुझाई गई अवधि

  • इंस्टेंट वॉइस क्लोनिंग: अच्छी गुणवत्ता का 1–2 मिनट का ऑडियो
  • प्रोफेशनल वॉइस क्लोनिंग: अच्छी गुणवत्ता का 30–180 मिनट का ऑडियो

WAV जैसे असंपीड़ित फ़ॉर्मैट आमतौर पर क्लोन की गुणवत्ता नहीं बढ़ाते और अपलोड प्रक्रिया में समस्याएँ पैदा कर सकते हैं। इसके बजाय रिकॉर्डिंग की गुणवत्ता पर ध्यान दें: बिना बैकग्राउंड नॉइज़, कमरे की गूँज या कई स्पीकर वाली साफ़ रिकॉर्डिंग इस्तेमाल करें। वॉल्यूम और टोन एक जैसा रखें और लंबे मौन अंतराल न हों।

ज़्यादा जानकारी के लिए इंस्टेंट वॉइस क्लोनिंग (IVC) और प्रोफेशनल वॉइस क्लोनिंग (PVC) देखें।

ElevenLabs में, हम बौद्धिक संपदा अधिकारों का सम्मान करने और अपनी टेक्नोलॉजी के संभावित दुरुपयोग को रोकने के लिए सुरक्षा उपाय लागू करने, दोनों के लिए पूरी तरह प्रतिबद्ध हैं:

  • हम सिर्फ़ उन क्लाइंट्स के साथ काम करते हैं जो हमारी सेवा की शर्तों और निषिद्ध उपयोग नीति का पालन करते हैं। ये हमारी टेक्नोलॉजी का किसी भी गैरकानूनी या हानिकारक उद्देश्य के लिए दुर्भावनापूर्ण इस्तेमाल प्रतिबंधित करती हैं;
  • हम वॉइस मालिकों और उनके लाइसेंसधारकों को अपने अधिकारों का दावा करने में सहयोग देते हैं और सभी ज्ञात उल्लंघनों की समीक्षा करके कार्रवाई करते हैं;
  • हमारे मॉडल्स से जनरेट किया गया हर ऑडियो तुरंत उस यूज़र तक ट्रेस किया जा सकता है जिसने उसे जनरेट किया है।

हम जो टेक्नोलॉजी विकसित कर रहे हैं वह नई है और इसके लिए स्पष्ट नियम अभी लागू नहीं किए गए हैं। एक AI रिसर्च लैब के रूप में हमारा एक लक्ष्य इस टेक्नोलॉजी के अस्तित्व, इसकी क्षमता और इसकी सीमाओं के बारे में जागरूकता फैलाना भी है।

विस्तृत गाइड के लिए, हम आपको Instant Voice Cloning और Professional Voice Cloning पर हमारा डॉक्यूमेंटेशन पढ़ने की सलाह देते हैं।

सीधी बात: अच्छा और एक-जैसा इनपुट = अच्छा और एक-जैसा आउटपुट।

लंबाई

  • Instant Voice Cloning: अच्छी क्वालिटी के ऑडियो के 1 - 2 मिनट
  • Professional Voice Cloning: अच्छी क्वालिटी के ऑडियो के 30 - 180 मिनट

जितने अच्छे और स्पष्ट ऑडियो क्लिप्स मिल सकें, उनका इस्तेमाल करें। उनमें सिर्फ़ एक स्पीकर होना चाहिए, बैकग्राउंड नॉइज़ या रुकावट नहीं होनी चाहिए, और उनकी आवाज़ तेज़ व साफ़ होनी चाहिए।

सिर्फ़ लंबाई बढ़ाने के लिए अलग-अलग क्वालिटी के बहुत-से क्लिप्स इस्तेमाल करने के बजाय, ऐसे क्लिप्स को प्राथमिकता दें जिनमें माइक्रोफ़ोन की क्वालिटी साफ़ तौर पर बहुत अच्छी हो और जिनकी क्वालिटी व टोन पूरे क्लिप में एक-जैसी हो। कुल अवधि बढ़ाने पर ध्यान न दें।

पक्का करें कि आपके क्लिप्स में ज़्यादातर डायलॉग स्पीकर की उस बोलने की शैली और इंटोनेशन से मेल खाते हों, जिसे आप सबसे ज़्यादा पसंद करते हैं। ऐसे डायलॉग के बहुत ज़्यादा हिस्से नहीं होने चाहिए जिनमें स्पीकर आपके पसंदीदा स्पीच पैटर्न से अलग बोलता हो।

ज़रूरत हो तो बैकग्राउंड नॉइज़ कम करने के लिए नॉइज़ रिमूवर का इस्तेमाल करें।

आप हमारे डॉक्यूमेंटेशन में यहाँ ज़्यादा जानकारी पा सकते हैं।

हां। आप Flash v2.5 और Multilingual v2 द्वारा समर्थित किसी भी भाषा में अपनी वॉइस क्लोन कर सकते हैं। समर्थित भाषाओं की पूरी सूची यहाँ देखें।

आप ऐसी भाषा बोलने वाली वॉइस भी क्लोन कर सकते हैं, जिसे AI सपोर्ट नहीं करता। क्लोन स्पीकर का टोन कैप्चर कर सकता है, लेकिन वह उस भाषा में बोल नहीं पाएगा और नतीजे अनुमान से अलग हो सकते हैं। हम इसकी सलाह नहीं देते।

आप अपने वॉइस क्लोन्स को अलग फ़ाइलों के रूप में डाउनलोड या एक्सपोर्ट नहीं कर सकते। वॉइस क्लोन्स आपके ElevenLabs अकाउंट में ही रहते हैं।

फिर भी आप ElevenLabs वेबसाइट के बाहर अपनी ElevenLabs वॉइसेज़ इस्तेमाल कर सकते हैं। आपकी API key से थर्ड-पार्टी सेवाएं ElevenLabs API को कॉल कर सकती हैं और आपके अकाउंट की वॉइसेज़ से स्पीच जनरेट कर सकती हैं।

अगर आप बाद में किसी क्लोन को दोबारा बनाना चाहते हैं, तो उसे बनाने के लिए इस्तेमाल किए गए मूल ऑडियो सैंपल्स संभालकर रखें। एक ही ऑडियो इस्तेमाल करने पर भी हर क्लोन की आवाज़ थोड़ी अलग होगी।

ElevenLabs दो क्लोनिंग विकल्प देता है:

  • इंस्टेंट वॉइस क्लोनिंग: करीब 1–3 मिनट के ऑडियो से तेज़ नतीजे। ज़्यादातर आवाज़ों के लिए अच्छी तरह काम करती है, लेकिन असामान्य एक्सेंट या खास आवाज़ों के साथ मुश्किल हो सकती है।
  • प्रोफेशनल वॉइस क्लोनिंग: 30 मिनट से करीब 3 घंटे के ऑडियो का इस्तेमाल करके बेहतर गुणवत्ता देती है। फाइन-ट्यूनिंग में आमतौर पर 3–6 घंटे लगते हैं और कतार में बहुत-सी आवाज़ें होने पर अधिक समय लग सकता है।

अगर इंस्टेंट वॉइस क्लोनिंग आपकी आवाज़ या एक्सेंट को अच्छी तरह कैप्चर नहीं करती, तो प्रोफेशनल वॉइस क्लोनिंग आज़माएं।

क्लोन बनने के बाद उसका एक्सेंट या टोन बदला नहीं जा सकता। नतीजा बेहतर करने के लिए इस्तेमाल किए गए ऑडियो सैंपल बदलें। सैंपल में छोटे बदलाव से बड़ा अंतर आ सकता है।

अगर आप अपने प्रोफेशनल वॉइस क्लोन (PVC) को फ़ाइन-ट्यूनिंग प्रक्रिया पूरी होने और इस्तेमाल के लिए उपलब्ध होने से पहले इस्तेमाल करने की कोशिश करते हैं, तो आपको यह त्रुटि दिखाई देगी।

PVC बनाने पर, इस्तेमाल के लिए उपलब्ध होने से पहले उसे कई प्रक्रियाओं से गुज़रना होता है। अपनी वॉइस सत्यापित करने के बाद, उसे प्रोसेस किया जाएगा और फ़ाइन-ट्यूनिंग के लिए कतार में डाल दिया जाएगा। फ़ाइन-ट्यूनिंग के लिए पहले से कतार में मौजूद अन्य वॉइस की संख्या के आधार पर, हमारा अनुमान है कि इस प्रक्रिया में आमतौर पर 3–6 घंटे लगेंगे, लेकिन इसमें 24 घंटे तक लग सकते हैं।

आप My Voices में अपनी वॉइस की सूची से वॉइस ढूँढकर और फिर ज़्यादा जानकारी देखने के लिए View पर क्लिक करके अपने PVC की प्रगति देख सकते हैं। मौजूदा स्टेटस देखने के लिए हर मॉडल पर कर्सर ले जाएँ।  

हर स्टेटस के मतलब की ज़्यादा जानकारी के लिए मेरे प्रोफेशनल वॉइस क्लोन का स्टेटस क्या दर्शाता है? देखें।

आपके PVC की फ़ाइन-ट्यूनिंग पूरी होने और इस्तेमाल के लिए उपलब्ध होने पर, आपको पॉप-अप नोटिफ़िकेशन दिखेगा और ईमेल से भी सूचना मिलेगी।

No results