For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
जानें कि हमारे बेहतरीन मॉडलों से अपनी वॉइस को प्रोफेशनल तरीके से कैसे क्लोन करें।
प्रोफेशनल वॉइस क्लोन बनाना
वॉइस क्लोन करते समय, यह ध्यान रखना ज़रूरी है कि AI को किस पर प्रशिक्षित किया गया है: कौन-सी भाषाएं और किस तरह का डेटासेट। हर मॉडल और उसकी खूबियों के बारे में मॉडल्स पेज पर और पढ़ें।
गाइड
अगर आपको कानूनी रूप से अनुमत चीज़ों के बारे में संदेह है, तो अधिक जानकारी के लिए कृपया सेवा की
शर्तें और हमारी AI सुरक्षा
जानकारी देखें।
प्रोफेशनल वॉइस क्लोन फिलहाल गायन को सपोर्ट नहीं करते। ऑडियो रिकॉर्डिंग में केवल
बोली गई आवाज़ होनी चाहिए।
अपलोड सैंपल्स पर क्लिक करके अपने ऑडियो सैंपल अपलोड करें।
अगर आपके पास पहले से रिकॉर्ड किया हुआ ट्रेनिंग ऑडियो नहीं है, तो रिकॉर्ड योरसेल्फ चुनकर सीधे इंटरफ़ेस में रिकॉर्ड भी कर सकते हैं। हमने नैरेटिव, बातचीत और विज्ञापन के लिए सैंपल स्क्रिप्ट शामिल की हैं। आप अपनी स्क्रिप्ट भी अपलोड कर सकते हैं।
ऑडियो अपलोड होने के बाद, आपको सैंपल की अवधि के बारे में फ़ीडबैक दिखाई देगा। सबसे अच्छे नतीजों के लिए, हम कम-से-कम एक घंटे का ट्रेनिंग ऑडियो अपलोड करने और संभव हो तो करीब तीन घंटे का ऑडियो अपलोड करने की सलाह देते हैं।
ऑडियो सैंपल अपलोड होने के बाद, आप क्वालिटी बेहतर करने के लिए उन्हें प्रोसेस कर सकते हैं। आप बैकग्राउंड नॉइज़ हटा सकते हैं, और अगर ऑडियो में एक से ज़्यादा स्पीकर हैं, तो अलग-अलग स्पीकर को भी अलग कर सकते हैं। इन विकल्पों के लिए, जिस क्लिप को प्रोसेस करना है उसके पास ऑडियो सेटिंग्स बटन पर क्लिक करें।
सब कुछ रिकॉर्ड और अपलोड हो जाने के बाद, आपको अपनी वॉइस सत्यापित करने के लिए कहा जाएगा। अनुभव को आसान बनाने के लिए, सैंपल रिकॉर्ड करने में इस्तेमाल किए गए उसी या मिलते-जुलते उपकरण से अपनी वॉइस सत्यापित करें। साथ ही, टोन और बोलने का तरीका भी सैंपल जैसा रखें। अगर आपके पास वही उपकरण नहीं है, तो जितना बेहतर हो सके, वैसे सत्यापित करें। अगर सत्यापन विफल हो जाता है, तो दोबारा कोशिश करने के लिए 24 घंटे इंतज़ार करें या मदद के लिए सपोर्ट से संपर्क करें।
अपनी वॉइस की फाइन-ट्यूनिंग पूरी होने का इंतज़ार करें
वॉइस इस्तेमाल करने से पहले उसकी फाइन-ट्यूनिंग प्रक्रिया पूरी होनी चाहिए। प्रोसेसिंग के दौरान आप My Voices में अपनी वॉइस का स्टेटस देख सकते हैं। इस्तेमाल के लिए तैयार होने पर आपको सूचना मिलेगी।
प्रोफेशनल वॉइस क्लोनिंग, अपनी ट्रेनिंग में इस्तेमाल किए गए सैंपल्स को बहुत सटीकता से क्लोन करती है। यह सुनी गई वॉइस की बारीकियों और विशेषताओं के साथ उसका लगभग सटीक क्लोन बनाती है, लेकिन सैंपल में मौजूद आर्टिफ़ैक्ट्स और अनचाहा ऑडियो भी शामिल हो सकता है। इसका मतलब है कि अगर आप बैकग्राउंड नॉइज़, कमरे की रीवर्ब/इको या संगीत अथवा कई लोगों के बोलने जैसी दूसरी अनचाही आवाज़ों वाले कम-गुणवत्ता सैंपल अपलोड करते हैं, तो AI क्लोन में भी इन सभी तत्वों को दोहराने की कोशिश करेगा।
सुनिश्चित करें कि पूरे ऑडियो में सिर्फ़ एक ही बोलने वाली वॉइस हो। एक से ज़्यादा स्पीकर, ज़्यादा नॉइज़ या ऊपर बताई गई कोई भी चीज़ AI को भ्रमित कर सकती है। इस भ्रम के कारण AI यह तय नहीं कर पाता कि किस वॉइस को क्लोन करना है, या दूसरी आवाज़ों से वॉइस ढक जाने पर वह उसकी असली ध्वनि को गलत समझ सकता है। इससे क्लोन की क्वालिटी कम हो सकती है।
सुनिश्चित करें कि वॉइस को ठीक से क्लोन करने के लिए आपके पास पर्याप्त सामग्री हो। हमारी न्यूनतम सलाह 30 मिनट का ऑडियो है, लेकिन सबसे अच्छे और सबसे सटीक क्लोन के लिए हम करीब 2-3 घंटे के ऑडियो की सलाह देते हैं। जितना अधिक ऑडियो देंगे, क्लोन की क्वालिटी उतनी बेहतर होगी।
आपके दिए गए सैंपल्स का बोलने का स्टाइल आउटपुट में दोहराया जाएगा। इसलिए आप जिस डिलीवरी की तलाश में हैं, ट्रेनिंग डेटा उसी स्टाइल के अनुरूप होना चाहिए (उदाहरण के लिए, अगर आप अपनी वॉइस के क्लोन से ऑडियोबुक रिकॉर्ड करना चाहते हैं, तो ट्रेनिंग के लिए दिया गया ऑडियो आपके द्वारा उस टोन में किताब पढ़ने की रिकॉर्डिंग होना चाहिए जिसे आप इस्तेमाल करना चाहते हैं)। एकरूपता के लिए अपलोड किए गए सैंपल्स में सिर्फ़ एक ही स्टाइल शामिल करना बेहतर है।
उस भाषा में बोलने वाले सैंपल इस्तेमाल करें जिसके लिए PVC इस्तेमाल होगा
उन सैंपल्स का इस्तेमाल करना सबसे अच्छा है जिनमें आप उसी भाषा में बोल रहे हों जिसमें PVC का मुख्य रूप से इस्तेमाल किया जाएगा। बेशक, AI हमारी वर्तमान में समर्थित किसी भी भाषा में बोल सकता है। हालांकि, ध्यान रखें कि अगर वॉइस उस भाषा की मूल वॉइस नहीं है जिसमें आप AI से बुलवाना चाहते हैं—यानी आपने किसी दूसरी भाषा बोलने वाली वॉइस को क्लोन किया है—तो उसमें मूल भाषा का एक्सेंट हो सकता है और शब्दों या उतार-चढ़ाव का उच्चारण गलत हो सकता है। उदाहरण के लिए, अगर आप अंग्रेज़ी बोलने वाली वॉइस को क्लोन करते हैं और फिर उससे स्पेनिश बुलवाना चाहते हैं, तो स्पेनिश बोलते समय उसमें बहुत संभव है कि अंग्रेज़ी एक्सेंट हो। हम केवल हमारी समर्थित भाषाओं में से किसी एक में रिकॉर्ड किए गए सैंपल्स की क्लोनिंग सपोर्ट करते हैं। अगर आपका सैंपल असमर्थित भाषा में रिकॉर्ड किया गया है, तो एप्लिकेशन उसे अस्वीकार कर देगा।
अच्छी और खराब रिकॉर्डिंग से क्या उम्मीद करें, इसके लिए नीचे दिए गए उदाहरण देखें।
फिलहाल, हम आपको केवल अपनी वॉइस क्लोन करने की अनुमति देते हैं। फाइन-ट्यूनिंग अनुरोध सबमिट करने से पहले आपको सत्यापन प्रक्रिया पूरी करनी होगी।
सुझाव
प्रोफेशनल रिकॉर्डिंग उपकरण
प्रोफेशनल रिकॉर्डिंग उपकरण
सबसे अच्छे नतीजों के लिए उच्च-गुणवत्ता वाले रिकॉर्डिंग उपकरण इस्तेमाल करें, क्योंकि AI ऑडियो की हर चीज़ क्लोन करेगा। उच्च-गुणवत्ता इनपुट = उच्च-गुणवत्ता आउटपुट। कोई भी माइक्रोफ़ोन काम करेगा, लेकिन हम XLR mic को एक समर्पित ऑडियो इंटरफ़ेस में लगाने की सलाह देते हैं। कम बजट के कुछ सामान्य विकल्पों में Audio Technica AT2020 या Rode NT1 को Focusrite इंटरफ़ेस या इसी तरह के इंटरफ़ेस में लगाना शामिल है।
पॉप-फ़िल्टर इस्तेमाल करें
पॉप-फ़िल्टर इस्तेमाल करें
रिकॉर्डिंग के समय पॉप-फ़िल्टर इस्तेमाल करें। इससे रिकॉर्डिंग में प्लोसिव्स कम होंगे।
माइक्रोफ़ोन से दूरी
माइक्रोफ़ोन से दूरी
माइक्रोफ़ोन से सही दूरी पर रहें—माइक्रोफ़ोन से लगभग दो मुट्ठी की दूरी रखने की सलाह दी जाती है, लेकिन यह इस पर भी निर्भर करता है कि आप किस तरह की रिकॉर्डिंग चाहते हैं।
नॉइज़-फ़्री रिकॉर्डिंग
नॉइज़-फ़्री रिकॉर्डिंग
सुनिश्चित करें कि ऑडियो इनपुट में बैकग्राउंड म्यूज़िक या नॉइज़ जैसी कोई रुकावट न हो। AI क्लोनिंग साफ़-सुथरे, बिना अव्यवस्थित ऑडियो के साथ सबसे अच्छा काम करती है।
कमरे की ध्वनिकी
कमरे की ध्वनिकी
बेहतर होगा कि ध्वनिक रूप से ट्रीट किए गए कमरे में रिकॉर्ड करें। इससे अनचाही इको और बैकग्राउंड नॉइज़ कम होती है, जिससे AI के लिए ऑडियो इनपुट अधिक स्पष्ट होता है। रिकॉर्डिंग स्पेस की ध्वनि कम करने के लिए आप मोटे डुवेट या रज़ाई से अस्थायी व्यवस्था बना सकते हैं।
ऑडियो प्री-प्रोसेसिंग
ऑडियो प्री-प्रोसेसिंग
अगर आप चाहते हैं कि AI किसी खास तरह की ध्वनि आउटपुट करे, तो पहले से ऑडियो एडिट करने पर विचार करें। उदाहरण के लिए, अगर आप पॉलिश्ड पॉडकास्ट जैसा आउटपुट चाहते हैं, तो अपने ऑडियो को उस क्वालिटी के अनुरूप प्री-प्रोसेस करें। साथ ही, लंबे विराम या शब्दों के बीच बहुत सारे “उम्” और “आम्” हों, तो उन्हें भी ध्यान में रखें, क्योंकि AI उन्हें भी दोहराएगा।
वॉल्यूम कंट्रोल
वॉल्यूम कंट्रोल
एक समान वॉल्यूम रखें जो साफ़ सुनने के लिए पर्याप्त तेज़ हो, लेकिन इतना तेज़ न हो कि डिस्टॉर्शन हो। लक्ष्य संतुलित और स्थिर ऑडियो स्तर हासिल करना है। आदर्श स्तर -23dB और -18dB RMS के बीच, और true peak -3dB होना चाहिए।
पर्याप्त ऑडियो अवधि
पर्याप्त ऑडियो अवधि
सबसे अच्छे नतीजों के लिए, ऊपर दिए गए दिशानिर्देशों का पालन करने वाला कम-से-कम 30 मिनट का उच्च-गुणवत्ता ऑडियो दें—बेहतर होगा कि यह 2+ घंटे के करीब हो। आप AI को जितना अधिक क्वालिटी डेटा देंगे, वॉइस क्लोन उतना बेहतर होगा। सैंपल्स की संख्या मायने नहीं रखती; कुल अवधि मायने रखती है। हालांकि, अगर आप कई घंटों का ऑडियो अपलोड करने की योजना बना रहे हैं, तो इसे कई ~30 मिनट के सैंपल्स में बांटना बेहतर है। इससे अपलोड करना आसान होता है।
FAQ
इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग में क्या अंतर है?
प्रोफेशनल वॉइस क्लोनिंग, इंस्टेंट वॉइस क्लोनिंग से अलग है, जो आपको 2 मिनट से कम ऑडियो के साथ तेज़ी से वॉइस क्लोन करने देती है। प्रोफेशनल वॉइस क्लोनिंग से आप अपनी वॉइस का ज़्यादा वास्तविक मॉडल ट्रेन कर सकते हैं। यह बड़े वॉइस डेटासेट पर एक समर्पित मॉडल को ट्रेन करके हासिल किया जाता है, जिससे ऐसा मॉडल बनता है जो आपकी मूल वॉइस से लगभग अलग नहीं पहचाना जा सकता।
प्रोफेशनल वॉइस क्लोन के लिए फ़ाइन-ट्यूनिंग और ट्रेनिंग ज़रूरी होती है, इसलिए अपने वॉइस क्लोन को इस्तेमाल करने से पहले कुछ समय लगेगा। इसका अनुमान देना मुश्किल है क्योंकि यह आपसे पहले कतार में मौजूद लोगों की संख्या और कुछ अन्य कारकों पर निर्भर करता है, लेकिन आमतौर पर फ़ाइन-ट्यूनिंग में 3–6 घंटे लगते हैं।
आपका प्रोफेशनल वॉइस क्लोन तैयार होने पर आपको ईमेल से सूचना मिलेगी।
क्या मैं किसी और की वॉइस का प्रोफेशनल वॉइस क्लोन बना सकता हूं?
नहीं। आप सिर्फ़ अपनी वॉइस का Professional Voice Clone बना सकते हैं। किसी की सहमति होने पर भी आप किसी और की वॉइस क्लोन नहीं कर सकते। सभी Professional Voice Clones में यह पुष्टि करने के लिए वेरिफ़िकेशन प्रक्रिया ज़रूरी है कि वॉइस आपकी है।
अगर कोई व्यक्ति अपनी वॉइस आपके साथ शेयर करना चाहता है, तो वह अपने अकाउंट पर Professional Voice Clone बनाकर उसे वेरिफ़ाई कर सकता है, फिर शेयरिंग लिंक से उसे निजी तौर पर आपके साथ शेयर कर सकता है। हमारे लेख में और जानें: मैं वॉइस कैसे शेयर करूं?
मेरे पास कितने प्रोफेशनल वॉइस क्लोन (PVCs) हो सकते हैं?
Professional Voice Clone (PVC) स्लॉट्स आपकी सब्सक्रिप्शन टियर के हिसाब से अलग-अलग होते हैं:
बेस PVC स्लॉट्स
Free और Starter प्लान: कोई PVC स्लॉट उपलब्ध नहीं
Creator, Pro और पुराने Scale प्लान: 1 PVC स्लॉट
Scale और पुराने Business प्लान: 3 PVC स्लॉट्स
Business प्लान: 10 PVC स्लॉट्स
Enterprise प्लान: PVC स्लॉट्स की कस्टम संख्या
अतिरिक्त PVC स्लॉट्स
जब आपके द्वारा वॉइस लाइब्रेरी में शेयर किए गए Professional Voice Clone को Studio Quality के रूप में मार्क किया जाता है, तो आप अतिरिक्त PVC स्लॉट्स पा सकते हैं।
Studio Quality रिव्यू सिर्फ़ उन वॉइसेज़ पर लागू होता है जिन्हें आपने वॉइस लाइब्रेरी में शेयर किया है
आपकी वॉइस वॉइस लाइब्रेरी में स्वीकार होने के बाद Studio Quality रिव्यू अपने आप होता है। यह तुरंत नहीं होता
अगर आपके शेयर किए गए PVC को Studio Quality के रूप में मार्क किया जाता है, तो आपको अपने आप एक अतिरिक्त PVC स्लॉट मिलता है
अगर कई शेयर की गई वॉइसेज़ को Studio Quality के रूप में मार्क किया जाए, तो यह कई बार हो सकता है
आप ज़्यादा PVCs नहीं बना सकते, जब तक कि आप इनमें से कोई एक काम न करें:
वॉइस लाइब्रेरी में शेयर की गई वॉइसेज़ के Studio Quality रिव्यू से अतिरिक्त स्लॉट्स पाएं
Scale या उससे ऊपर के प्लान में अपग्रेड करें
ज़रूरी नोट्स
Professional Voice Clones का इस्तेमाल सिर्फ़ अपनी वॉइस क्लोन करने के लिए किया जा सकता है
अगर आप Creator टियर से नीचे के प्लान में डाउनग्रेड करते हैं, तो आपका PVC आपके अकाउंट में रहेगा, लेकिन Creator या उससे ऊपर अपग्रेड करने तक आप उसका इस्तेमाल नहीं कर पाएंगे
आपके पास मौजूद कस्टम वॉइसेज़ की कुल संख्या, जिसमें PVCs भी शामिल हैं, आपकी सब्सक्रिप्शन टियर पर निर्भर करती है
मैं अपने प्रोफेशनल वॉइस क्लोन को ट्रेन करने के लिए इस्तेमाल होने वाले मॉडल कैसे जोड़ूं या अपग्रेड करूं?
सभी Professional Voice Clones (PVCs) अपने आप Flash v2.5, Turbo v2.5 और Multilingual v2 मॉडल्स पर ट्रेन होंगे। अंग्रेज़ी ऑडियो पर ट्रेन किए गए PVCs अपने आप Flash v2 और Turbo v2 मॉडल्स पर भी ट्रेन होंगे।
अगर आपके पास पहले से PVC है, तो अब आपके पास उसे अतिरिक्त मॉडल्स पर फ़ाइन-ट्यून करने का विकल्प है। भविष्य में, अगर फ़ाइन-ट्यूनिंग सपोर्ट करने वाले नए मॉडल्स रिलीज़ होते हैं, तो आपको नोटिफ़िकेशन मिलेगा। यह एक एक्सक्लेमेशन आइकन से दिखाया जाता है, जो My Voices. में वॉइस सूची में आपकी वॉइस के दाईं ओर दिखाई देगा। इस आइकन पर होवर करने पर नोटिफ़िकेशन दिखेगा।
फ़ाइन-ट्यूनिंग प्रक्रिया शुरू करने के लिए, My Voices, में सूची में अपनी वॉइस के नाम पर होवर करें। आपको सभी उपलब्ध मॉडल्स दिखेंगे। जिन मॉडल्स पर वॉइस पहले ही फ़ाइन-ट्यून हो चुकी है, वे टिक आइकन के साथ दिखेंगे, और फ़ाइन-ट्यूनिंग के लिए उपलब्ध मॉडल्स प्लस आइकन के साथ दिखेंगे। फ़ाइन-ट्यूनिंग शुरू करने के लिए, बस मॉडल पर क्लिक करें।
जब वॉइस फ़ाइन-ट्यून हो रही हो, तो प्रगति देखने के लिए मॉडल नाम पर होवर कर सकते हैं। ध्यान दें कि वॉइस कैशिंग की वजह से, नवीनतम प्रगति देखने के लिए आपको पेज रिफ़्रेश करना पड़ सकता है। फ़ाइन-ट्रेनिंग पूरी होने के बाद, आपको ऐप में और ईमेल से नोटिफ़िकेशन मिलेगा।
मेरे प्रोफेशनल वॉइस क्लोन का स्टेटस क्या बताता है?
प्रोसेस होने के दौरान आपका प्रोफेशनल वॉइस क्लोन कुछ अलग चरणों से गुज़रेगा। ये चरण My Voices में आपके प्रोफेशनल वॉइस क्लोन के लिए दिखाए गए स्टेटस में दिखाई देते हैं।
मौजूदा स्टेटस देखने के लिए, सूची में अपनी वॉइस ढूँढें और दाईं ओर दिख रहे आइकन देखें।
ड्राफ़्ट: इस स्टेटस का मतलब है कि आपकी वॉइस अधूरी है। आमतौर पर ऐसा तब होता है जब आपने वॉइस बनाना पूरा नहीं किया है या आपने अभी तक वॉइस सत्यापित नहीं की है।
सत्यापन प्रक्रिया शुरू करने के लिए, टिक आइकन पर क्लिक करें।
वॉइस बनाने की प्रक्रिया पर वापस जाने के लिए More actions (तीन डॉट) पर क्लिक करें और Edit voice चुनें।
अपनी वॉइस सत्यापित करने के बाद, उसे इस्तेमाल करने से पहले हमारे मॉडल्स पर फ़ाइन-ट्यूनिंग करनी होगी। आप My Voices में अपनी वॉइस के नाम पर कर्सर ले जाकर इस प्रक्रिया को ट्रैक कर सकते हैं। यहाँ सभी उपलब्ध मॉडल्स की सूची दिखेगी और हर मॉडल का स्टेटस बताने के लिए एक आइकन होगा।
ज़्यादा जानकारी के लिए मॉडल के नाम पर कर्सर ले जाएँ। आपको इनमें से कोई एक स्टेटस दिखेगा:
ट्रेनिंग रन शेड्यूल हो गया है: इसका मतलब है कि आपकी वॉइस ट्रेनिंग के लिए उपलब्ध स्लॉट खुलने का इंतज़ार कर रही है। आपकी वॉइस कितनी देर तक कतार में रहेगी, यह कतार में मौजूद अन्य वॉइस की संख्या पर निर्भर करेगा।
डेटासेट बनाया जा रहा है और फ़ाइन-ट्यूनिंग चल रही है: स्लॉट खुलने के बाद फ़ाइन-ट्यूनिंग शुरू होगी। इसमें 6–24 घंटे लग सकते हैं। प्रतिशत के रूप में दिखेगा कि आपकी वॉइस ट्रेनिंग प्रक्रिया के हर चरण में कितनी आगे बढ़ चुकी है।
हमें खेद है कि ट्रेनिंग रन में समस्या आई और इसे फिर से शुरू किया गया है। आगे कोई कार्रवाई ज़रूरी नहीं है
इसका मतलब है कि कुछ गड़बड़ हुई, लेकिन आपकी वॉइस को फ़ाइन-ट्यूनिंग प्रक्रिया दोबारा शुरू करने के लिए अपने-आप कतार में डाल दिया गया है। आपकी वॉइस को अगली कोशिश में फ़ाइन-ट्यूनिंग प्रक्रिया सफलतापूर्वक पूरी कर लेनी चाहिए, लेकिन अगर कई बार विफलता होती है, तो हमें support@elevenlabs.io पर ईमेल करके सहायता टीम से संपर्क करें।
वॉइस मॉडल के साथ इस्तेमाल के लिए तैयार है: इसका मतलब है कि इस मॉडल के लिए फ़ाइन-ट्यूनिंग प्रक्रिया पूरी हो गई है और अब आप इस मॉडल के साथ अपनी वॉइस इस्तेमाल कर सकते हैं।
फ़ाइन-ट्यूनिंग शुरू करने के लिए क्लिक करें: कुछ मॉडल्स अपने-आप ट्रेन नहीं होते और फ़ाइन-ट्रेनिंग शुरू करने के लिए आपको मॉडल के नाम पर क्लिक करना होगा। अगर आपकी वॉइस के लिए फ़ाइन-ट्यूनिंग के अतिरिक्त मॉडल उपलब्ध हो गए हैं, तो आपकी वॉइस के आगे विस्मयादिबोधक आइकन दिखेगा।
फ़ाइन-ट्यूनिंग प्रक्रिया शुरू करने के लिए, अपनी वॉइस के नाम पर कर्सर ले जाएँ और मॉडल के नाम पर क्लिक करें।
मेरा प्रोफेशनल वॉइस क्लोन (PVC) कब तैयार होगा?
प्रोफेशनल वॉइस क्लोनिंग में किसी खास वक्ता की आवाज़ के बड़े डेटासेट पर मॉडल को ट्रेन (फाइन-ट्यून) करके एक कस्टम मॉडल बनाया जाता है।
सैंपल अपलोड करने और अपनी आवाज़ सत्यापित करने के बाद, आपका प्रोफेशनल वॉइस क्लोन कतार में जोड़ दिया जाएगा। अनुमानित ट्रेनिंग समय करीब 3–6 घंटे है। यह कुछ कारकों पर निर्भर करता है, इसलिए सटीक अनुमान देना मुश्किल है। कभी-कभी इसमें अधिक समय लग सकता है।
आपके PVC की फाइन-ट्यूनिंग प्रक्रिया पूरी होने पर, आपको ऐप में और ईमेल से सूचना मिलेगी कि आपकी वॉइस अब इस्तेमाल के लिए तैयार है।
मेरा प्रोफेशनल वॉइस क्लोन विफल हो गया है या उसमें देरी हो रही है, मैं क्या करूं?
अपनी वॉइस सत्यापित करने के बाद, उसे इस्तेमाल करने से पहले हमारे मॉडल्स पर फ़ाइन-ट्यूनिंग करनी होगी। इस दौरान, आप My Voices में अपनी वॉइस के नाम पर कर्सर ले जाकर उसका स्टेटस देख सकते हैं। यहाँ आपकी वॉइस के लिए उपलब्ध सभी मॉडल दिखेंगे। हर मॉडल का स्टेटस देखने के लिए उसके नाम पर कर्सर ले जाएँ।
अगर कुछ गड़बड़ हुई है, तो आपको यह स्टेटस दिख सकता है:
हमें खेद है कि ट्रेनिंग रन में समस्या आई और इसे फिर से शुरू किया गया है। आगे कोई कार्रवाई ज़रूरी नहीं है। इसका मतलब है कि कुछ गड़बड़ हुई, लेकिन आपकी वॉइस को फ़ाइन-ट्यूनिंग प्रक्रिया दोबारा शुरू करने के लिए अपने-आप कतार में डाल दिया गया है। आपकी वॉइस को अगली कोशिश में फ़ाइन-ट्यूनिंग प्रक्रिया सफलतापूर्वक पूरी कर लेनी चाहिए, लेकिन अगर कई बार विफलता होती है, तो डेटासेट में ऐसी समस्या हो सकती है जिसे AI हल नहीं कर सकता।
इसे ठीक करने के लिए आप वॉइस डिलीट करके शुरुआत से डेटा फिर से अपलोड कर सकते हैं। इससे कुछ यूज़र्स को मदद मिली है।
अगर इससे समस्या हल नहीं होती, तो आपको अपने ट्रेनिंग ऑडियो की समीक्षा करनी पड़ सकती है और संभव है कि अलग ट्रेनिंग ऑडियो इस्तेमाल करना पड़े।
फ़ाइन-ट्यूनिंग प्रक्रिया के दौरान विफलता होने पर आप हमें support@elevenlabs.io पर ईमेल करके सहायता टीम से संपर्क कर सकते हैं।
अगर मैं अपने प्रोफेशनल वॉइस क्लोन (PVC) को सत्यापित नहीं कर पाया, तो मैं क्या कर सकता हूं?
अगर आप अपना प्रोफेशनल वॉइस क्लोन बनाते समय सत्यापन की सभी कोशिशों में विफल हो जाते हैं, तो 24 घंटे इंतज़ार कर सकते हैं, जिसके बाद आप प्रक्रिया फिर से आज़मा पाएँगे।
आप support@elevenlabs.io पर ईमेल करके सहायता टीम से भी संपर्क कर सकते हैं, ताकि वे आपके लिए इसकी जाँच कर सकें। अगर सब कुछ सही लगता है, तो वे आपकी सत्यापन कोशिशें रीसेट कर देंगे, ताकि आप प्रक्रिया फिर से आज़मा सकें।
अपने प्रोफेशनल वॉइस क्लोन को सफलतापूर्वक सत्यापित करने के लिए ये सुझाव अपनाएँ:
पक्का करें कि आपके वेब ब्राउज़र को माइक्रोफ़ोन इस्तेमाल करने की अनुमति है और आपका माइक्रोफ़ोन म्यूट नहीं है।
सुनिश्चित करें कि कंप्यूटर के माइक्रोफ़ोन से रिकॉर्ड किया गया ऑडियो क्लोनिंग के लिए अपलोड किए गए ऑडियो जैसा सुनाई देता है और उसमें बैकग्राउंड नॉइज़ या बाहरी ऑडियो का हस्तक्षेप नहीं है।
जिस ऑडियो से आपने वॉइस को ट्रेन किया था, उसी जैसी शैली में बोलने की कोशिश करें।
सत्यापन की हर लाइन सिर्फ़ एक बार पढ़ें, फिर रिकॉर्डिंग रोकने के लिए Stop दबाएँ। लाइन को एक से ज़्यादा बार पढ़ने पर सत्यापन प्रक्रिया विफल हो सकती है।
मैं अपना असत्यापित प्रोफेशनल वॉइस क्लोन (PVC) कैसे डिलीट कर सकता हूं?
दुर्भाग्य से, यह संभव नहीं है। आपके Professional Voice Clone (PVC) के सेटअप के दौरान बताया गया था कि वेरिफ़िकेशन स्टेज पर जाने के बाद, अपनी वॉइस वेरिफ़ाई करने तक आप इस प्रक्रिया में आगे बढ़ चुके होते हैं और वापस नहीं जा सकते।
अगर आपको अपने Professional Voice Clone के लिए मदद चाहिए, तो support@elevenlabs.io पर ईमेल करके सपोर्ट से संपर्क करें।
प्रोफेशनल वॉइस क्लोनिंग के साथ कौन-सी भाषाएं समर्थित हैं?
हम Flash v2.5 मॉडल द्वारा समर्थित सभी भाषाओं के लिए प्रोफेशनल वॉइस क्लोनिंग का समर्थन करते हैं।
फ़िलहाल, प्रोफेशनल वॉइस क्लोनिंग के साथ हम इन भाषाओं का समर्थन करते हैं:
🇺🇸 अंग्रेज़ी (USA)
🇬🇧 अंग्रेज़ी (UK)
🇦🇺 अंग्रेज़ी (ऑस्ट्रेलिया)
🇨🇦 अंग्रेज़ी (कनाडा)
🇯🇵 जापानी
🇨🇳 चीनी
🇩🇪 जर्मन
🇮🇳 हिंदी
🇫🇷 फ़्रेंच (फ़्रांस)
🇨🇦 फ़्रेंच (कनाडा)
🇰🇷 कोरियाई
🇧🇷 पुर्तगाली (ब्राज़ील)
🇵🇹 पुर्तगाली (पुर्तगाल)
🇮🇹 इतालवी
🇪🇸 स्पेनिश (स्पेन)
🇲🇽 स्पेनिश (मेक्सिको)
🇮🇩 इंडोनेशियाई
🇳🇱 डच
🇹🇷 तुर्की
🇵🇭 फ़िलिपीनो
🇵🇱 पोलिश
🇸🇪 स्वीडिश
🇧🇬 बल्गेरियाई
🇷🇴 रोमानियाई
🇸🇦 अरबी (सऊदी अरब)
🇦🇪 अरबी (UAE)
🇨🇿 चेक
🇬🇷 ग्रीक
🇫🇮 फ़िनिश
🇭🇷 क्रोएशियाई
🇲🇾 मलय
🇸🇰 स्लोवाक
🇩🇰 डेनिश
🇮🇳 तमिल
🇺🇦 यूक्रेनी
🇷🇺 रूसी
🇭🇺 हंगेरियन
🇳🇴 नॉर्वेजियन
🇻🇳 वियतनामी
वॉइस क्लोनिंग के लिए आप कौन-सी फ़ाइलें स्वीकार करते हैं?
इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग के लिए, हम कई तरह की फ़ाइल स्वीकार करते हैं। हम 192kbps या उससे अधिक के MP3 की पुरज़ोर सलाह देते हैं।
सुझाया गया फ़ॉर्मैट
MP3, 192kbps या अधिक
सुझाई गई अवधि
इंस्टेंट वॉइस क्लोनिंग: अच्छी गुणवत्ता का 1–2 मिनट का ऑडियो
प्रोफेशनल वॉइस क्लोनिंग: अच्छी गुणवत्ता का 30–180 मिनट का ऑडियो
WAV जैसे असंपीड़ित फ़ॉर्मैट आमतौर पर क्लोन की गुणवत्ता नहीं बढ़ाते और अपलोड प्रक्रिया में समस्याएँ पैदा कर सकते हैं। इसके बजाय रिकॉर्डिंग की गुणवत्ता पर ध्यान दें: बिना बैकग्राउंड नॉइज़, कमरे की गूँज या कई स्पीकर वाली साफ़ रिकॉर्डिंग इस्तेमाल करें। वॉल्यूम और टोन एक जैसा रखें और लंबे मौन अंतराल न हों।
क्या वॉइस क्लोनिंग के लिए अपलोड की जा सकने वाली वॉइसेस पर कोई पाबंदी है?
ElevenLabs में, हम बौद्धिक संपदा अधिकारों का सम्मान करने और अपनी टेक्नोलॉजी के संभावित दुरुपयोग को रोकने के लिए सुरक्षा उपाय लागू करने, दोनों के लिए पूरी तरह प्रतिबद्ध हैं:
हम सिर्फ़ उन क्लाइंट्स के साथ काम करते हैं जो हमारी सेवा की शर्तों और निषिद्ध उपयोग नीति का पालन करते हैं। ये हमारी टेक्नोलॉजी का किसी भी गैरकानूनी या हानिकारक उद्देश्य के लिए दुर्भावनापूर्ण इस्तेमाल प्रतिबंधित करती हैं;
हम वॉइस मालिकों और उनके लाइसेंसधारकों को अपने अधिकारों का दावा करने में सहयोग देते हैं और सभी ज्ञात उल्लंघनों की समीक्षा करके कार्रवाई करते हैं;
हमारे मॉडल्स से जनरेट किया गया हर ऑडियो तुरंत उस यूज़र तक ट्रेस किया जा सकता है जिसने उसे जनरेट किया है।
हम जो टेक्नोलॉजी विकसित कर रहे हैं वह नई है और इसके लिए स्पष्ट नियम अभी लागू नहीं किए गए हैं। एक AI रिसर्च लैब के रूप में हमारा एक लक्ष्य इस टेक्नोलॉजी के अस्तित्व, इसकी क्षमता और इसकी सीमाओं के बारे में जागरूकता फैलाना भी है।
क्या अच्छी क्वालिटी की क्लोन की गई वॉइसेस पाने के लिए कोई सुझाव हैं?
सीधी बात: अच्छा और एक-जैसा इनपुट = अच्छा और एक-जैसा आउटपुट।
लंबाई
Instant Voice Cloning: अच्छी क्वालिटी के ऑडियो के 1 - 2 मिनट
Professional Voice Cloning: अच्छी क्वालिटी के ऑडियो के 30 - 180 मिनट
जितने अच्छे और स्पष्ट ऑडियो क्लिप्स मिल सकें, उनका इस्तेमाल करें। उनमें सिर्फ़ एक स्पीकर होना चाहिए, बैकग्राउंड नॉइज़ या रुकावट नहीं होनी चाहिए, और उनकी आवाज़ तेज़ व साफ़ होनी चाहिए।
सिर्फ़ लंबाई बढ़ाने के लिए अलग-अलग क्वालिटी के बहुत-से क्लिप्स इस्तेमाल करने के बजाय, ऐसे क्लिप्स को प्राथमिकता दें जिनमें माइक्रोफ़ोन की क्वालिटी साफ़ तौर पर बहुत अच्छी हो और जिनकी क्वालिटी व टोन पूरे क्लिप में एक-जैसी हो। कुल अवधि बढ़ाने पर ध्यान न दें।
पक्का करें कि आपके क्लिप्स में ज़्यादातर डायलॉग स्पीकर की उस बोलने की शैली और इंटोनेशन से मेल खाते हों, जिसे आप सबसे ज़्यादा पसंद करते हैं। ऐसे डायलॉग के बहुत ज़्यादा हिस्से नहीं होने चाहिए जिनमें स्पीकर आपके पसंदीदा स्पीच पैटर्न से अलग बोलता हो।
ज़रूरत हो तो बैकग्राउंड नॉइज़ कम करने के लिए नॉइज़ रिमूवर का इस्तेमाल करें।
आप हमारे डॉक्यूमेंटेशन में यहाँ ज़्यादा जानकारी पा सकते हैं।
क्या मैं अपनी वॉइस को अंग्रेज़ी के अलावा किसी और भाषा में क्लोन कर सकता हूं?
हां। आप Flash v2.5 और Multilingual v2 द्वारा समर्थित किसी भी भाषा में अपनी वॉइस क्लोन कर सकते हैं। समर्थित भाषाओं की पूरी सूची यहाँ देखें।
आप ऐसी भाषा बोलने वाली वॉइस भी क्लोन कर सकते हैं, जिसे AI सपोर्ट नहीं करता। क्लोन स्पीकर का टोन कैप्चर कर सकता है, लेकिन वह उस भाषा में बोल नहीं पाएगा और नतीजे अनुमान से अलग हो सकते हैं। हम इसकी सलाह नहीं देते।
क्या मैं अपने वॉइस क्लोन्स एक्सपोर्ट कर सकता हूं?
आप अपने वॉइस क्लोन्स को अलग फ़ाइलों के रूप में डाउनलोड या एक्सपोर्ट नहीं कर सकते। वॉइस क्लोन्स आपके ElevenLabs अकाउंट में ही रहते हैं।
फिर भी आप ElevenLabs वेबसाइट के बाहर अपनी ElevenLabs वॉइसेज़ इस्तेमाल कर सकते हैं। आपकी API key से थर्ड-पार्टी सेवाएं ElevenLabs API को कॉल कर सकती हैं और आपके अकाउंट की वॉइसेज़ से स्पीच जनरेट कर सकती हैं।
अगर आप बाद में किसी क्लोन को दोबारा बनाना चाहते हैं, तो उसे बनाने के लिए इस्तेमाल किए गए मूल ऑडियो सैंपल्स संभालकर रखें। एक ही ऑडियो इस्तेमाल करने पर भी हर क्लोन की आवाज़ थोड़ी अलग होगी।
क्लोनिंग के बाद मेरी वॉइस या एक्सेंट सही क्यों नहीं सुनाई देता?
ElevenLabs दो क्लोनिंग विकल्प देता है:
इंस्टेंट वॉइस क्लोनिंग: करीब 1–3 मिनट के ऑडियो से तेज़ नतीजे। ज़्यादातर आवाज़ों के लिए अच्छी तरह काम करती है, लेकिन असामान्य एक्सेंट या खास आवाज़ों के साथ मुश्किल हो सकती है।
प्रोफेशनल वॉइस क्लोनिंग: 30 मिनट से करीब 3 घंटे के ऑडियो का इस्तेमाल करके बेहतर गुणवत्ता देती है। फाइन-ट्यूनिंग में आमतौर पर 3–6 घंटे लगते हैं और कतार में बहुत-सी आवाज़ें होने पर अधिक समय लग सकता है।
अगर इंस्टेंट वॉइस क्लोनिंग आपकी आवाज़ या एक्सेंट को अच्छी तरह कैप्चर नहीं करती, तो प्रोफेशनल वॉइस क्लोनिंग आज़माएं।
क्लोन बनने के बाद उसका एक्सेंट या टोन बदला नहीं जा सकता। नतीजा बेहतर करने के लिए इस्तेमाल किए गए ऑडियो सैंपल बदलें। सैंपल में छोटे बदलाव से बड़ा अंतर आ सकता है।
'No model found for this voice. Please select another voice' त्रुटि का क्या मतलब है?
अगर आप अपने प्रोफेशनल वॉइस क्लोन (PVC) को फ़ाइन-ट्यूनिंग प्रक्रिया पूरी होने और इस्तेमाल के लिए उपलब्ध होने से पहले इस्तेमाल करने की कोशिश करते हैं, तो आपको यह त्रुटि दिखाई देगी।
PVC बनाने पर, इस्तेमाल के लिए उपलब्ध होने से पहले उसे कई प्रक्रियाओं से गुज़रना होता है। अपनी वॉइस सत्यापित करने के बाद, उसे प्रोसेस किया जाएगा और फ़ाइन-ट्यूनिंग के लिए कतार में डाल दिया जाएगा। फ़ाइन-ट्यूनिंग के लिए पहले से कतार में मौजूद अन्य वॉइस की संख्या के आधार पर, हमारा अनुमान है कि इस प्रक्रिया में आमतौर पर 3–6 घंटे लगेंगे, लेकिन इसमें 24 घंटे तक लग सकते हैं।
आप My Voices में अपनी वॉइस की सूची से वॉइस ढूँढकर और फिर ज़्यादा जानकारी देखने के लिए View पर क्लिक करके अपने PVC की प्रगति देख सकते हैं। मौजूदा स्टेटस देखने के लिए हर मॉडल पर कर्सर ले जाएँ।