For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
जानें कि हमारे बेहतरीन मॉडलों से अपनी वॉइस को तुरंत कैसे क्लोन करें।
इंस्टेंट वॉइस क्लोन बनाना
वॉइस क्लोन करते समय यह ध्यान रखना ज़रूरी है कि AI को किन चीज़ों पर ट्रेन किया गया है: कौन-सी भाषाएं और किस तरह का डेटासेट। हर मॉडल और उसकी खूबियों के बारे में मॉडल्स पेज पर और पढ़ें।
गाइड
अगर आपको कानूनी तौर पर अनुमत चीज़ों को लेकर कोई संदेह है, तो अधिक जानकारी के लिए कृपया सेवा की
शर्तें और हमारी AI सुरक्षा
जानकारी देखें।
डैशबोर्ड के वॉइसेस सेक्शन में माय वॉइसेस पर क्लिक करें, फिर इस्तेमाल शुरू करने के लिए यूज़ वॉइस पर क्लिक करें।
सर्वोत्तम तरीके
कम से कम 1 मिनट का ऑडियो रिकॉर्ड करें
कम से कम 1 मिनट का ऑडियो रिकॉर्ड करें
3 मिनट से ज़्यादा रिकॉर्ड करने से बचें। इससे बहुत कम सुधार होगा और कुछ मामलों में क्लोन पर नकारात्मक असर भी पड़ सकता है।
ऑडियो कैसे रिकॉर्ड किया गया है, यह सैंपल की कुल अवधि (कुल रनटाइम) से ज़्यादा महत्वपूर्ण है। आपके इस्तेमाल किए गए सैंपल की संख्या मायने नहीं रखती; उनकी कुल अवधि (कुल रनटाइम) ही महत्वपूर्ण है।
बिना किसी रीवरब, आर्टिफैक्ट या बैकग्राउंड नॉइज़ के लगभग 1-2 मिनट का साफ़ ऑडियो सुझाया जाता है। जब हम “ऑडियो या रिकॉर्डिंग क्वालिटी” कहते हैं, तो हमारा मतलब MP3 या WAV जैसे कोडेक से नहीं है; हमारा मतलब है कि ऑडियो कैसे कैप्चर किया गया। हालांकि, ऑडियो कोडेक के लिए 128 kbps या उससे अधिक का MP3 इस्तेमाल करने की सलाह दी जाती है। ज़्यादा बिटरेट से क्लोन की क्वालिटी पर कोई खास असर नहीं पड़ता।
ऑडियो एक जैसा रखें
ऑडियो एक जैसा रखें
AI ऑडियो में सुनी हर चीज़ की नकल करने की कोशिश करेगा। इसमें व्यक्ति की बोलने की गति, उतार-चढ़ाव, एक्सेंट, टोनैलिटी, सांस लेने का पैटर्न और उसकी तीव्रता, साथ ही नॉइज़ और मुंह से आने वाली क्लिक की आवाज़ें शामिल हैं। भ्रम पैदा करने वाले नॉइज़ और आर्टिफैक्ट भी इसमें शामिल हो जाते हैं।
पक्का करें कि वॉइस का टोन और प्रदर्शन पूरे समय एक जैसा रहे। साथ ही, सभी सैंपल में वॉइस की ऑडियो क्वालिटी भी एक जैसी रखें। भले ही आप सिर्फ़ एक सैंपल इस्तेमाल कर रहे हों, पक्का करें कि वह पूरे सैंपल में एक जैसा रहे। AI को बहुत डायनामिक ऑडियो देने से, यानी पिच और वॉल्यूम में बड़े उतार-चढ़ाव होने पर, नतीजे कम अनुमानित होंगे।
अपने प्रदर्शन को दोहराएं
अपने प्रदर्शन को दोहराएं
एक और ज़रूरी बात यह है कि AI आपकी दी हुई वॉइस के प्रदर्शन को दोहराने की कोशिश करेगा। अगर आप धीरे, एक ही टोन में और कम भावनाओं के साथ बोलते हैं, तो AI भी वैसा ही करेगा। दूसरी ओर, अगर आप बहुत भावनाओं के साथ तेज़ी से बोलते हैं, तो AI उसे दोहराने की कोशिश करेगा।
सभी सैंपल में वॉइस का एक जैसा रहना बेहद ज़रूरी है, सिर्फ़ टोन में ही नहीं बल्कि प्रदर्शन में भी। बहुत ज़्यादा अंतर होने पर AI भ्रमित हो सकता है, जिससे हर जनरेशन का आउटपुट अधिक अलग हो सकता है।
वॉल्यूम का सही संतुलन रखें
वॉल्यूम का सही संतुलन रखें
वॉल्यूम का सही संतुलन रखें, ताकि ऑडियो न बहुत धीमा हो और न बहुत तेज़। आदर्श रूप से यह -23 dB से -18 dB RMS के बीच होना चाहिए और ट्रू पीक -3 dB होनी चाहिए।
अक्सर पूछे जाने वाले सवाल
इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग में क्या अंतर है?
प्रोफेशनल वॉइस क्लोनिंग, इंस्टेंट वॉइस क्लोनिंग से अलग है, जो आपको 2 मिनट से कम ऑडियो के साथ तेज़ी से वॉइस क्लोन करने देती है। प्रोफेशनल वॉइस क्लोनिंग से आप अपनी वॉइस का ज़्यादा वास्तविक मॉडल ट्रेन कर सकते हैं। यह बड़े वॉइस डेटासेट पर एक समर्पित मॉडल को ट्रेन करके हासिल किया जाता है, जिससे ऐसा मॉडल बनता है जो आपकी मूल वॉइस से लगभग अलग नहीं पहचाना जा सकता।
प्रोफेशनल वॉइस क्लोन के लिए फ़ाइन-ट्यूनिंग और ट्रेनिंग ज़रूरी होती है, इसलिए अपने वॉइस क्लोन को इस्तेमाल करने से पहले कुछ समय लगेगा। इसका अनुमान देना मुश्किल है क्योंकि यह आपसे पहले कतार में मौजूद लोगों की संख्या और कुछ अन्य कारकों पर निर्भर करता है, लेकिन आमतौर पर फ़ाइन-ट्यूनिंग में 3–6 घंटे लगते हैं।
आपका प्रोफेशनल वॉइस क्लोन तैयार होने पर आपको ईमेल से सूचना मिलेगी।
इंस्टेंट वॉइस क्लोनिंग के लिए मुझे कितने वॉइस सैंपल अपलोड करने चाहिए?
इंस्टेंट वॉइस क्लोनिंग से क्लोनिंग करना थोड़ा जटिल हो सकता है, और इसके लिए हमारे कुछ सामान्य दिशानिर्देश हैं। हालांकि, ये सिर्फ दिशानिर्देश हैं। सैंपल की संख्या या लंबाई के लिए हमारे कोई तय नियम नहीं हैं। हमने देखा है कि यूज़र्स ने सिर्फ़ 30 सेकंड के सैंपल इस्तेमाल किए और बेहतरीन नतीजे पाए, जबकि कुछ यूज़र्स ने 10 मिनट के ऑडियो का इस्तेमाल किया और उनके नतीजे खराब रहे। लेकिन कुछ बातें हैं जिन पर आपको ध्यान देना चाहिए।
इंस्टेंट वॉइस क्लोनिंग इस्तेमाल करते समय ऑडियो की गुणवत्ता सबसे अहम पहलू है।
सैंपल की संख्या मायने नहीं रखती; कुल अवधि ज़रूरी है। 2–3 मिनट से ज़्यादा ऑडियो रखने से बहुत कम सुधार मिलेगा और कुछ मामलों में क्लोन की स्थिरता पर बुरा असर भी पड़ सकता है।
वॉइस क्लोनिंग के लिए आप कौन-सी फ़ाइलें स्वीकार करते हैं?
इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग के लिए, हम कई तरह की फ़ाइल स्वीकार करते हैं। हम 192kbps या उससे अधिक के MP3 की पुरज़ोर सलाह देते हैं।
सुझाया गया फ़ॉर्मैट
MP3, 192kbps या अधिक
सुझाई गई अवधि
इंस्टेंट वॉइस क्लोनिंग: अच्छी गुणवत्ता का 1–2 मिनट का ऑडियो
प्रोफेशनल वॉइस क्लोनिंग: अच्छी गुणवत्ता का 30–180 मिनट का ऑडियो
WAV जैसे असंपीड़ित फ़ॉर्मैट आमतौर पर क्लोन की गुणवत्ता नहीं बढ़ाते और अपलोड प्रक्रिया में समस्याएँ पैदा कर सकते हैं। इसके बजाय रिकॉर्डिंग की गुणवत्ता पर ध्यान दें: बिना बैकग्राउंड नॉइज़, कमरे की गूँज या कई स्पीकर वाली साफ़ रिकॉर्डिंग इस्तेमाल करें। वॉल्यूम और टोन एक जैसा रखें और लंबे मौन अंतराल न हों।
क्या वॉइस क्लोनिंग के लिए मैं जिन वॉइसेस को अपलोड कर सकता हूं, उन पर कोई पाबंदी है?
ElevenLabs में, हम बौद्धिक संपदा अधिकारों का सम्मान करने और अपनी टेक्नोलॉजी के संभावित दुरुपयोग को रोकने के लिए सुरक्षा उपाय लागू करने, दोनों के लिए पूरी तरह प्रतिबद्ध हैं:
हम सिर्फ़ उन क्लाइंट्स के साथ काम करते हैं जो हमारी सेवा की शर्तों और निषिद्ध उपयोग नीति का पालन करते हैं। ये हमारी टेक्नोलॉजी का किसी भी गैरकानूनी या हानिकारक उद्देश्य के लिए दुर्भावनापूर्ण इस्तेमाल प्रतिबंधित करती हैं;
हम वॉइस मालिकों और उनके लाइसेंसधारकों को अपने अधिकारों का दावा करने में सहयोग देते हैं और सभी ज्ञात उल्लंघनों की समीक्षा करके कार्रवाई करते हैं;
हमारे मॉडल्स से जनरेट किया गया हर ऑडियो तुरंत उस यूज़र तक ट्रेस किया जा सकता है जिसने उसे जनरेट किया है।
हम जो टेक्नोलॉजी विकसित कर रहे हैं वह नई है और इसके लिए स्पष्ट नियम अभी लागू नहीं किए गए हैं। एक AI रिसर्च लैब के रूप में हमारा एक लक्ष्य इस टेक्नोलॉजी के अस्तित्व, इसकी क्षमता और इसकी सीमाओं के बारे में जागरूकता फैलाना भी है।
क्या अच्छी क्वालिटी की क्लोन वॉइसेस पाने के लिए कोई सुझाव हैं?
सीधी बात: अच्छा और एक-जैसा इनपुट = अच्छा और एक-जैसा आउटपुट।
लंबाई
Instant Voice Cloning: अच्छी क्वालिटी के ऑडियो के 1 - 2 मिनट
Professional Voice Cloning: अच्छी क्वालिटी के ऑडियो के 30 - 180 मिनट
जितने अच्छे और स्पष्ट ऑडियो क्लिप्स मिल सकें, उनका इस्तेमाल करें। उनमें सिर्फ़ एक स्पीकर होना चाहिए, बैकग्राउंड नॉइज़ या रुकावट नहीं होनी चाहिए, और उनकी आवाज़ तेज़ व साफ़ होनी चाहिए।
सिर्फ़ लंबाई बढ़ाने के लिए अलग-अलग क्वालिटी के बहुत-से क्लिप्स इस्तेमाल करने के बजाय, ऐसे क्लिप्स को प्राथमिकता दें जिनमें माइक्रोफ़ोन की क्वालिटी साफ़ तौर पर बहुत अच्छी हो और जिनकी क्वालिटी व टोन पूरे क्लिप में एक-जैसी हो। कुल अवधि बढ़ाने पर ध्यान न दें।
पक्का करें कि आपके क्लिप्स में ज़्यादातर डायलॉग स्पीकर की उस बोलने की शैली और इंटोनेशन से मेल खाते हों, जिसे आप सबसे ज़्यादा पसंद करते हैं। ऐसे डायलॉग के बहुत ज़्यादा हिस्से नहीं होने चाहिए जिनमें स्पीकर आपके पसंदीदा स्पीच पैटर्न से अलग बोलता हो।
ज़रूरत हो तो बैकग्राउंड नॉइज़ कम करने के लिए नॉइज़ रिमूवर का इस्तेमाल करें।
आप हमारे डॉक्यूमेंटेशन में यहाँ ज़्यादा जानकारी पा सकते हैं।
क्या मैं अपनी वॉइस को अंग्रेज़ी के अलावा किसी दूसरी भाषा में क्लोन कर सकता हूं?
हां। आप Flash v2.5 और Multilingual v2 द्वारा समर्थित किसी भी भाषा में अपनी वॉइस क्लोन कर सकते हैं। समर्थित भाषाओं की पूरी सूची यहाँ देखें।
आप ऐसी भाषा बोलने वाली वॉइस भी क्लोन कर सकते हैं, जिसे AI सपोर्ट नहीं करता। क्लोन स्पीकर का टोन कैप्चर कर सकता है, लेकिन वह उस भाषा में बोल नहीं पाएगा और नतीजे अनुमान से अलग हो सकते हैं। हम इसकी सलाह नहीं देते।
क्या मैं अपने वॉइस क्लोन एक्सपोर्ट कर सकता हूं?
आप अपने वॉइस क्लोन्स को अलग फ़ाइलों के रूप में डाउनलोड या एक्सपोर्ट नहीं कर सकते। वॉइस क्लोन्स आपके ElevenLabs अकाउंट में ही रहते हैं।
फिर भी आप ElevenLabs वेबसाइट के बाहर अपनी ElevenLabs वॉइसेज़ इस्तेमाल कर सकते हैं। आपकी API key से थर्ड-पार्टी सेवाएं ElevenLabs API को कॉल कर सकती हैं और आपके अकाउंट की वॉइसेज़ से स्पीच जनरेट कर सकती हैं।
अगर आप बाद में किसी क्लोन को दोबारा बनाना चाहते हैं, तो उसे बनाने के लिए इस्तेमाल किए गए मूल ऑडियो सैंपल्स संभालकर रखें। एक ही ऑडियो इस्तेमाल करने पर भी हर क्लोन की आवाज़ थोड़ी अलग होगी।
क्लोनिंग के बाद मेरी वॉइस या एक्सेंट सही क्यों नहीं सुनाई देता?
ElevenLabs दो क्लोनिंग विकल्प देता है:
इंस्टेंट वॉइस क्लोनिंग: करीब 1–3 मिनट के ऑडियो से तेज़ नतीजे। ज़्यादातर आवाज़ों के लिए अच्छी तरह काम करती है, लेकिन असामान्य एक्सेंट या खास आवाज़ों के साथ मुश्किल हो सकती है।
प्रोफेशनल वॉइस क्लोनिंग: 30 मिनट से करीब 3 घंटे के ऑडियो का इस्तेमाल करके बेहतर गुणवत्ता देती है। फाइन-ट्यूनिंग में आमतौर पर 3–6 घंटे लगते हैं और कतार में बहुत-सी आवाज़ें होने पर अधिक समय लग सकता है।
अगर इंस्टेंट वॉइस क्लोनिंग आपकी आवाज़ या एक्सेंट को अच्छी तरह कैप्चर नहीं करती, तो प्रोफेशनल वॉइस क्लोनिंग आज़माएं।
क्लोन बनने के बाद उसका एक्सेंट या टोन बदला नहीं जा सकता। नतीजा बेहतर करने के लिए इस्तेमाल किए गए ऑडियो सैंपल बदलें। सैंपल में छोटे बदलाव से बड़ा अंतर आ सकता है।
'No model found for this voice. Please select another voice' त्रुटि का क्या मतलब है?
अगर आप अपने प्रोफेशनल वॉइस क्लोन (PVC) को फ़ाइन-ट्यूनिंग प्रक्रिया पूरी होने और इस्तेमाल के लिए उपलब्ध होने से पहले इस्तेमाल करने की कोशिश करते हैं, तो आपको यह त्रुटि दिखाई देगी।
PVC बनाने पर, इस्तेमाल के लिए उपलब्ध होने से पहले उसे कई प्रक्रियाओं से गुज़रना होता है। अपनी वॉइस सत्यापित करने के बाद, उसे प्रोसेस किया जाएगा और फ़ाइन-ट्यूनिंग के लिए कतार में डाल दिया जाएगा। फ़ाइन-ट्यूनिंग के लिए पहले से कतार में मौजूद अन्य वॉइस की संख्या के आधार पर, हमारा अनुमान है कि इस प्रक्रिया में आमतौर पर 3–6 घंटे लगेंगे, लेकिन इसमें 24 घंटे तक लग सकते हैं।
आप My Voices में अपनी वॉइस की सूची से वॉइस ढूँढकर और फिर ज़्यादा जानकारी देखने के लिए View पर क्लिक करके अपने PVC की प्रगति देख सकते हैं। मौजूदा स्टेटस देखने के लिए हर मॉडल पर कर्सर ले जाएँ।