For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
ElevenLabs के साथ टेक्स्ट को स्पीच में बदलने की गाइड
परिचय
ElevenLabs की टेक्स्ट टू स्पीच तकनीक हमारी सेवाओं का अहम हिस्सा है और दुनियाभर में कई तरह के ऐप्लिकेशन्स में उच्च-गुणवत्ता वाली AI-जनरेटेड स्पीच देती है। संभव है कि आपने हमारी वॉइस को पहले ही सुन लिया हो, जो वास्तविक जैसी ऑडियो अनुभव प्रदान करती हैं।
टेक्स्ट टू स्पीच से अपना पहला ऑडियो जनरेट करना बहुत आसान है। हालांकि, इस फ़ीचर का पूरा लाभ लेने के लिए कुछ बातों का ध्यान रखना ज़रूरी है।
अपनी ऑडियो फ़ाइल बनाने के लिए ‘Generate’ बटन पर क्लिक करें।
सेटिंग्स
उच्च-गुणवत्ता वाली स्पीच बनाने के लिए वॉइसेस, मॉडल और सेटिंग्स को समझें।
आपकी चुनी हुई सेटिंग्स, खासकर वॉइस और मॉडल, आउटपुट पर काफ़ी असर डालती हैं। इन्हें समझना और कुछ बेहतरीन तरीकों को जानना बहुत ज़रूरी है। दूसरी सेटिंग्स भी आउटपुट को प्रभावित करती हैं, लेकिन उनका असर आपकी चुनी हुई वॉइस और मॉडल के मुकाबले कम होता है।
महत्व का क्रम यह है: वॉइस चुनना सबसे ज़रूरी है, उसके बाद मॉडल चुनना और फिर मॉडल की सेटिंग्स। ये सभी और इनका संयोजन आउटपुट को प्रभावित करेंगे।
वॉइसेस
वॉइसेस
हम कई तरह की वॉइसेस देते हैं, जिनमें क्यूरेट की गई डिफ़ॉल्ट वॉइसेस, लगभग हर तरह की कल्पनीय वॉइस वाली हमारी विशाल वॉइसेस लाइब्रेरी w और हमारे वॉइस डिज़ाइन टूल से बनाई गई पूरी तरह सिंथेटिक वॉइसेस शामिल हैं। आप हमारी दो तकनीकों, इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग से क्लोन की गई वॉइसेस का अपना कलेक्शन भी बना सकते हैं।
सभी वॉइसेस एक जैसी नहीं होतीं और बहुत कुछ उन्हें बनाने के लिए इस्तेमाल किए गए सोर्स ऑडियो पर निर्भर करता है। कुछ वॉइसेस बेहतर, ज़्यादा मानवीय परफ़ॉर्मेंस और डिलीवरी देती हैं, जबकि कुछ ज़्यादा स्थिर होती हैं।
अपने खास कंटेंट के लिए सही वॉइस चुनना बेहद ज़रूरी है। यह संभवतः सबसे अहम फ़ैसला है, जिसका अंतिम आउटपुट पर सबसे ज़्यादा असर होगा। यह लिंग, टोन, ऐक्सेंट, कैडेंस और डिलीवरी तय करता है। सही वॉइस चुनने और उसे ठीक से टेस्ट करने में अतिरिक्त समय देना फ़ायदेमंद है, ताकि यह सुनिश्चित हो सके कि वह लगातार एक जैसी है और आपकी उम्मीदों पर खरी उतरती है।
किसी खास भाषा में स्पीच जनरेट करने के लिए, वॉइस लाइब्रेरी से उस भाषा की नेटिव वॉइस इस्तेमाल करने या सही ऐक्सेंट के साथ वह भाषा बोलने वाली वॉइस क्लोन करने से सबसे अच्छे नतीजे मिलेंगे। तकनीकी रूप से कोई भी वॉइस किसी भी भाषा में बोल सकती है, लेकिन उसमें उसका मूल ऐक्सेंट बना रहेगा। उदाहरण के लिए, फ़्रेंच स्पीच जनरेट करने के लिए नेटिव अंग्रेज़ी वॉइस का इस्तेमाल करने पर आउटपुट संभवतः फ़्रेंच में होगा, लेकिन अंग्रेज़ी ऐक्सेंट के साथ, क्योंकि AI को यह अनुमान लगाना होता है कि जिस भाषा पर उस वॉइस को ट्रेन नहीं किया गया था उसमें वह कैसी सुनाई देगी।
अगर आपको कोई वॉइस पसंद है, लेकिन आप अलग डिलीवरी चाहते हैं, तो हमारा वॉइस रीमिक्सिंग टूल मदद कर सकता है। इससे आप नेचुरल लैंग्वेज प्रॉम्प्ट्स का इस्तेमाल करके वॉइस की डिलीवरी, कैडेंस, टोन, लिंग और यहां तक कि ऐक्सेंट भी बदल सकते हैं। ऐक्सेंट बदलते समय, बेस वॉइस और टारगेट ऐक्सेंट बहुत महत्वपूर्ण होते हैं। नतीजे अलग-अलग हो सकते हैं; कभी यह बिल्कुल सही काम करता है, तो कभी सही नतीजा पाने के लिए कुछ कोशिशें करनी पड़ सकती हैं।
वॉइस रीमिक्सिंग से आपको बहुत अच्छे नतीजे मिल सकते हैं, लेकिन वे आमतौर पर ठीक से क्लोन की गई प्रोफेशनल वॉइस क्लोन जितने अच्छे नहीं होंगे। वे इंस्टेंट वॉइस क्लोन के ज़्यादा करीब होंगे।
ध्यान रखें, वॉइस रीमिक्सिंग सिर्फ़ कुछ खास वॉइसेस के लिए काम करती है। उदाहरण के लिए, आप वॉइस लाइब्रेरी की वॉइसेस को रीमिक्स नहीं कर सकते; आप सिर्फ़ खुद बनाई गई वॉइसेस या डिफ़ॉल्ट वॉइसेस को रीमिक्स कर सकते हैं।
मॉडल
मॉडल
हम मॉडल के दो परिवार देते हैं: स्टैंडर्ड (उच्च-गुणवत्ता) मॉडल और बेहद कम लेटेंसी के लिए ऑप्टिमाइज़ किए गए Flash मॉडल। ज़्यादातर परिवारों में सिर्फ़ अंग्रेज़ी और बहुभाषी, दोनों वर्ज़न शामिल हैं।
Eleven v3 मॉडल अभी सिर्फ़ एक वर्ज़न में आता है: स्टैंडर्ड बहुभाषी वर्ज़न।
वॉइस चुनने के बाद, आपके अंतिम ऑडियो आउटपुट पर मॉडल चयन का दूसरा सबसे बड़ा असर होता है। सबसे उपयुक्त विकल्प खोजने के लिए हम आपकी चुनी हुई वॉइस के साथ अलग-अलग मॉडल टेस्ट करने की सलाह देते हैं। हमारे सभी मॉडलों की अपनी खूबियां और कमियां हैं और वे कुछ वॉइसेस के साथ दूसरों की तुलना में बेहतर काम करते हैं, इसलिए अच्छा मेल ढूंढना ज़रूरी है।
अगर आपका आउटपुट सिर्फ़ अंग्रेज़ी में होगा, तो हम हमारे सिर्फ़ अंग्रेज़ी वाले मॉडलों में से एक इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इनके साथ काम करना अक्सर आसान होता है, ये ज़्यादा स्थिर होते हैं और आम तौर पर सिर्फ़ अंग्रेज़ी कंटेंट के लिए बेहतर परफ़ॉर्मेंस देते हैं। अगर आपका कंटेंट किसी दूसरी भाषा में होगा या संभवतः बहुभाषी होगा, तो आपको बहुभाषी मॉडलों में से किसी एक का इस्तेमाल करना होगा।
सबसे आम सेटिंग में स्टेबिलिटी लगभग 50, सिमिलैरिटी लगभग 75 और स्टाइल 0 पर रखा जाता है, जिसके बाद बहुत कम बदलाव किए जाते हैं। बेशक, यह सब मूल वॉइस और आपकी चाही गई परफ़ॉर्मेंस शैली पर निर्भर करता है।
ध्यान दें कि AI नॉन-डिटरमिनिस्टिक है; स्लाइडर्स को खास वैल्यू पर सेट करने से हर बार एक जैसे नतीजों की गारंटी नहीं मिलती। इसके बजाय, स्लाइडर्स एक रेंज की तरह काम करते हैं और तय करते हैं कि हर जनरेशन के बीच रैंडमाइज़ेशन कितना व्यापक हो सकता है।
स्पीड
स्पीड सेटिंग आपको जनरेट की गई स्पीच की गति बढ़ाने या घटाने देती है। डिफ़ॉल्ट वैल्यू 1.0 है, यानी गति समायोजित नहीं होती। 1.0 से कम वैल्यू वॉइस को धीमा करेंगी, न्यूनतम 0.7 तक। 1.0 से ज़्यादा वैल्यू वॉइस को तेज़ करेंगी, अधिकतम 1.2 तक। बहुत अधिक या बहुत कम वैल्यू जनरेट की गई स्पीच की गुणवत्ता को प्रभावित कर सकती हैं।
Eleven v3 मॉडल के लिए स्पीड उपलब्ध नहीं है।
स्टेबिलिटी
स्टेबिलिटी स्लाइडर तय करता है कि वॉइस कितनी स्थिर है और हर जनरेशन के बीच रैंडमनेस कितनी है। इस स्लाइडर को कम करने से वॉइस में भावनाओं की रेंज बढ़ जाती है। जैसा कि पहले बताया गया है, यह मूल वॉइस से भी काफ़ी प्रभावित होता है। स्लाइडर को बहुत कम रखने से बहुत ज़्यादा रैंडम और अजीब परफ़ॉर्मेंस हो सकती है, जिससे कैरेक्टर बहुत तेज़ बोल सकता है। वहीं, इसे बहुत ज़्यादा रखने से सीमित भावनाओं वाली एकरस वॉइस हो सकती है।
ज़्यादा जीवंत और नाटकीय परफ़ॉर्मेंस के लिए, स्टेबिलिटी स्लाइडर को कम रखने और अपनी पसंद की परफ़ॉर्मेंस मिलने तक कुछ बार जनरेट करने की सलाह दी जाती है।
दूसरी ओर, अगर आप ज़्यादा गंभीर परफ़ॉर्मेंस चाहते हैं, जो बहुत ऊंची वैल्यू पर लगभग एकरस भी हो सकती है, तो स्टेबिलिटी स्लाइडर को ज़्यादा रखने की सलाह दी जाती है। चूंकि यह ज़्यादा एकरूप और स्थिर होती है, इसलिए मनचाहा नतीजा पाने के लिए आपको आमतौर पर उतने सैंपल जनरेट नहीं करने पड़ते। आपके लिए सबसे अच्छा क्या काम करता है, यह जानने के लिए प्रयोग करें!
सिमिलैरिटी
सिमिलैरिटी स्लाइडर तय करता है कि AI उसे दोहराने की कोशिश करते समय मूल वॉइस का कितनी बारीकी से पालन करे। अगर मूल ऑडियो की गुणवत्ता खराब है और सिमिलैरिटी स्लाइडर बहुत ज़्यादा सेट है, तो मूल रिकॉर्डिंग में मौजूद आर्टिफ़ैक्ट्स या बैकग्राउंड नॉइज़ को दोहराने की कोशिश करते समय AI उन्हें भी आउटपुट में ला सकता है।
Eleven v3 मॉडल के लिए सिमिलैरिटी उपलब्ध नहीं है।
स्टाइल एक्सैजरेशन
नए मॉडलों के साथ हमने स्टाइल एक्सैजरेशन सेटिंग भी जोड़ी है। यह सेटिंग मूल स्पीकर की शैली को बढ़ाने की कोशिश करती है। यह अतिरिक्त कंप्यूटेशनल संसाधनों का इस्तेमाल करती है और अगर इसे 0 के अलावा किसी अन्य वैल्यू पर सेट किया जाए, तो लेटेंसी बढ़ सकती है। यह ध्यान रखना ज़रूरी है कि मूल वॉइस की शैली पर ज़ोर देने और उसकी नकल करने की कोशिश के कारण, इस सेटिंग के इस्तेमाल से मॉडल थोड़ा कम स्थिर हो सकता है।
सामान्य तौर पर, हम इस सेटिंग को हमेशा 0 पर रखने की सलाह देते हैं।
स्पीकर बूस्ट
यह सेटिंग मूल स्पीकर से समानता बढ़ाती है। हालांकि, इस सेटिंग का इस्तेमाल करने के लिए थोड़ा ज़्यादा कंप्यूटेशनल लोड चाहिए, जिससे लेटेंसी बढ़ती है। इस सेटिंग से आने वाले अंतर आमतौर पर काफ़ी सूक्ष्म होते हैं।
Eleven v3 मॉडल के लिए स्पीकर बूस्ट उपलब्ध नहीं है।
जनरेट करें
वॉइस चुनने, मॉडल चुनने और अपनी सेटिंग्स कॉन्फ़िगर करने के बाद जनरेशन प्रक्रिया सीधी है: आप टेक्स्ट डालते हैं, “Generate Speech” दबाते हैं और फिर ऑडियो जनरेट हो जाता है।
हालांकि यह प्रक्रिया ऊपर से बहुत आसान लगती है, लेकिन मनचाहा आउटपुट पाने के लिए आपका टेक्स्ट इनपुट बेहद महत्वपूर्ण है। ऐसे शब्द इस्तेमाल करते समय जो शायद “डिस्ट्रिब्यूशन से बाहर” हों—यानी ऐसी चीज़ें जिनका AI ने ट्रेनिंग के दौरान बहुत कम सामना किया हो—जैसे अजीब नाम, असामान्य संक्षिप्त रूप, प्रतीक या इमोजी, AI भ्रमित हो सकता है और आउटपुट अस्थिर हो सकता है। इमोजी और कुछ प्रतीकों को सही ढंग से समझना AI के लिए खास तौर पर मुश्किल होता है।
UI के ज़रिए टेक्स्ट टू स्पीच इस्तेमाल करते समय, हम टेक्स्ट की पठनीयता बेहतर करने और AI के लिए प्रोसेसिंग आसान बनाने के लिए आपके इनपुट पर एक ऑटोमेटेड नॉर्मलाइज़ेशन स्टेप चलाते हैं। आम तौर पर, यह स्टेप प्रतीकों और संख्याओं को लिखे हुए टेक्स्ट में बदल देता है, जिससे AI को सही उच्चारण के बारे में दिशा मिलती है।
हम जिस सबसे अच्छे तरीके की पुरज़ोर सलाह देते हैं, वह है संख्याओं को अंकों में लिखने या प्रतीकों का इस्तेमाल करने से बचना, खासकर बहुभाषी मॉडल इस्तेमाल करते समय (हालांकि यह सिर्फ़ अंग्रेज़ी वाले मॉडलों पर भी लागू होता है)। चूंकि संख्याएं और प्रतीक कई भाषाओं में एक जैसे लिखे जाते हैं लेकिन उनका उच्चारण अलग-अलग होता है, इसलिए अंकों पर निर्भर रहने से AI के लिए अस्पष्टता पैदा होती है। उदाहरण के लिए, संख्या “1” अंग्रेज़ी और कई अन्य भाषाओं में एक जैसी लिखी जाती है, लेकिन उसका उच्चारण अलग होता है। संख्या को टेक्स्ट में लिखने से, जैसे “one,” AI को यह समझने की ज़रूरत नहीं पड़ती कि उसे क्या करना है।
हम ऐसे और उन्नत वर्कफ़्लो पर काम कर रहे हैं जिनसे आप ऑडियो टैग्स के ज़रिए AI की डिलीवरी और परफ़ॉर्मेंस को प्रभावित कर सकेंगे। यह फ़ीचर हमारे Eleven v3 मॉडल में उपलब्ध है। अगर आप इस फ़ीचर के बारे में और जानना चाहते हैं, तो हम हमारे Eleven v3 दस्तावेज़ पढ़ने की सलाह देते हैं।
अक्सर पूछे जाने वाले सवाल
अच्छा इनपुट, अच्छा आउटपुट
पहला और सबसे महत्वपूर्ण कारक यह है कि अच्छा, उच्च-गुणवत्ता वाला और एकसमान इनपुट, अच्छा, उच्च-गुणवत्ता वाला और एकसमान आउटपुट देगा।
अगर आप AI को आदर्श से कम गुणवत्ता वाला ऑडियो देते हैं—जैसे बहुत शोर वाला ऑडियो, साफ़ आवाज़ पर रिवर्ब, कई स्पीकर, या वॉल्यूम, प्रदर्शन और डिलीवरी में असंगति—तो AI ज़्यादा अस्थिर हो जाएगा और आउटपुट कम अनुमानित होगा।
अगर आप अपनी आवाज़ क्लोन करने की योजना बना रहे हैं, तो हम ज़ोर देकर सलाह देते हैं कि सही वॉइस क्लोन बनाने के लिए दस्तावेज़ में दिए गए हमारे दिशानिर्देश पढ़ें, क्योंकि इससे आपको शुरुआत के लिए सबसे अच्छी बुनियाद मिलेगी। भले ही आप केवल इंस्टेंट वॉइस क्लोन इस्तेमाल करना चाहते हों, प्रोफेशनल वॉइस क्लोनिंग सेक्शन भी पढ़ना बेहतर है। इस सेक्शन में वॉइस क्लोन बनाने की उपयोगी जानकारी है, भले ही इन दोनों तकनीकों की आवश्यकताएं थोड़ी अलग हों।
सही आवाज़ चुनें
ध्यान देने वाला दूसरा कारक यह है कि आपके चुने हुए वॉइस का आउटपुट पर बहुत बड़ा असर होगा। जैसा कि पहले कारक में बताया गया है, उस खास क्लोन को बनाने के लिए इस्तेमाल किए गए सैंपल की गुणवत्ता और एकरूपता बेहद महत्वपूर्ण है, साथ ही आवाज़ की भाषा और टोन भी।
अगर आप खुश और उत्साहपूर्ण सुनाई देने वाली आवाज़ चाहते हैं, तो खुश और उत्साहपूर्ण सैंपल से क्लोन की गई आवाज़ चुनें। इसके उलट, अगर आप आत्मचिंतनशील और गंभीर आवाज़ चाहते हैं, तो ऐसी विशेषताओं वाली आवाज़ चुनें।
हालांकि, सही भाषा में प्रशिक्षित आवाज़ इस्तेमाल करना भी बहुत ज़रूरी है। उदाहरण के लिए, हम डिफ़ॉल्ट वॉइस के रूप में जो सभी प्रोफेशनल वॉइस क्लोन देते हैं, वे अंग्रेज़ी वॉइस हैं और उन्हें अंग्रेज़ी सैंपल पर प्रशिक्षित किया गया है। इसलिए, अगर आप उनसे दूसरी भाषाएं बुलवाते हैं, तो उन भाषाओं में उनका प्रदर्शन अनिश्चित हो सकता है। ऐसी आवाज़ इस्तेमाल करना ज़रूरी है जिसे उन सैंपल से क्लोन किया गया हो, जिनमें वह आवाज़ उस भाषा में बोल रही थी जिसे आप AI से बुलवाना चाहते हैं।
सही फ़ॉर्मैटिंग इस्तेमाल करें
यह थोड़ा मामूली लग सकता है, लेकिन इससे बड़ा फ़र्क पड़ सकता है। AI टेक्स्ट के संदर्भ के आधार पर समझने की कोशिश करता है कि किसी चीज़ को कैसे पढ़ना है। इसका मतलब सिर्फ़ इस्तेमाल किए गए शब्द नहीं, बल्कि उन्हें कैसे जोड़ा गया है, विराम चिह्न कैसे लगाए गए हैं, व्याकरण और टेक्स्ट की सामान्य फ़ॉर्मैटिंग भी है।
इससे AI की डिलीवरी पर छोटा लेकिन असरदार प्रभाव पड़ सकता है। अगर आप किसी शब्द की वर्तनी गलत लिखते हैं, तो AI उसे ठीक नहीं करेगा और उसे लिखे अनुसार पढ़ने की कोशिश करेगा।
अनिश्चित परिणाम
AI की सेटिंग्स अनियत होती हैं, यानी समान शुरुआती स्थितियों (वॉइस, सेटिंग्स, मॉडल) में भी यह आपको थोड़ा अलग आउटपुट देगी। ठीक वैसे ही जैसे कोई वॉइस ऐक्टर हर बार थोड़ा अलग प्रदर्शन करता है।
यह बदलाव कई कारकों की वजह से हो सकता है, जैसे पहले बताए गए विकल्प: वॉइस, सेटिंग्स और मॉडल। आम तौर पर, इस बदलाव की सीमा को स्टेबिलिटी स्लाइडर से नियंत्रित किया जा सकता है। कम स्टेबिलिटी सेटिंग का मतलब है कि जनरेशन के बीच बदलाव की सीमा ज़्यादा होगी, लेकिन इससे अलग-अलग जनरेशन के बीच भी बदलाव आता है, जिससे AI थोड़ा ज़्यादा भावपूर्ण हो सकता है।
ज़्यादा बदलाव अक्सर वांछनीय हो सकता है, क्योंकि स्टेबिलिटी बहुत अधिक रखने से कुछ वॉइस एकरस लग सकती हैं। इससे AI को अधिक विविध कंटेंट बनाने की उतनी स्वतंत्रता नहीं मिलती। हालांकि, स्टेबिलिटी बहुत कम रखने से दूसरी समस्याएं भी आ सकती हैं और जनरेशन अस्थिर हो सकती हैं, खासकर उन वॉइस के साथ जिनकी क्लोनिंग प्रक्रिया में आदर्श से कम गुणवत्ता वाला ऑडियो इस्तेमाल हुआ हो।
अधिकांश उपयोगों के लिए 50 की डिफ़ॉल्ट सेटिंग एक बेहतरीन शुरुआती बिंदु है।
Eleven v3 (Alpha) क्या है?
Eleven v3 हमारा सबसे नया और सबसे अभिव्यक्तिपूर्ण टेक्स्ट टू स्पीच मॉडल है, जो देता है:
कुल मिलाकर बेहतर गुणवत्ता के साथ ज़्यादा इंसानी जनरेशन
कई स्पीकर के साथ प्राकृतिक सुनाई देने वाले ऑडियो के लिए डायलॉग मोड
70+ भाषाओं का समर्थन
यह शानदार आउटपुट दे सकता है, लेकिन इसकी ज़्यादा बदलाव वाली स्थिरता और अधिक लेटेंसी का मतलब है कि यह रियल-टाइम या कन्वर्सेशनल उपयोग के मामलों के लिए उपयुक्त नहीं है। इनके लिए हम Flash v2 (अंग्रेज़ी) या v2.5 (मल्टीलिंगुअल) की सलाह देते हैं। हम Eleven v3 के रियल-टाइम वर्ज़न पर काम कर रहे हैं।
आप मॉडल ID eleven_v3 तय करके हमारे स्पीच बनाएं और स्पीच स्ट्रीम करें एंडपॉइंट का इस्तेमाल करके API के ज़रिए v3 से जनरेट कर सकते हैं।
आप कई स्पीकर के साथ प्राकृतिक सुनाई देने वाला डायलॉग बनाने के लिए हमारे डायलॉग बनाएं और डायलॉग स्ट्रीम करें एंडपॉइंट भी इस्तेमाल कर सकते हैं।
वॉइस की गति नियंत्रित करने की सुविधा स्पीच सिंथेसिस, स्टूडियो, ElevenAgents और हमारे API के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध है।
आप Speed सेटिंग का इस्तेमाल करके वॉइस की गति नियंत्रित कर सकते हैं।
संभावित मान 0.7 से 1.2 तक होते हैं। 1 से कम मान स्पीच को धीमा करेंगे और 1 से ज़्यादा मान उसे तेज़ करेंगे। बहुत ज़्यादा या बहुत कम मान जनरेट की गई स्पीच की क्वालिटी को प्रभावित कर सकते हैं।
यह सेटिंग सभी वॉइस और सभी मॉडल के लिए उपलब्ध है। यह आपको वॉइस सेटिंग्स में मिलेगी।
API का इस्तेमाल करते समय स्पीच को नियंत्रित करने की जानकारी के लिए हमारा API रेफरेंस देखें।
क्या मैं एक ही क्लोन/डिज़ाइन की गई आवाज़ अलग-अलग भाषाओं में इस्तेमाल कर सकता हूँ?
कोई भी वॉइस किसी भी समर्थित भाषा को बोल सकती है।
वर्तमान मॉडल ऐसे काम करता है कि आपको कोई खास भाषा चुनने की ज़रूरत नहीं होती। आप बस उस भाषा में लिखते हैं जिसमें आप AI से बुलवाना चाहते हैं और AI उसे अपने-आप समझ लेता है। हालांकि, अलग-अलग भाषाओं में कुछ समान शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और एक्सेंट काफी अलग हो सकते हैं। इसलिए आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही एक्सेंट वाली भाषा बोलते हुए क्लोन किया गया हो।
भाषा टेक्स्ट से तय होती है, जबकि एक्सेंट और उच्चारण वॉइस से तय होते हैं। बेहतर ढंग से काम करने के लिए इसे दोनों संदर्भों की ज़रूरत होती है।
हम भाषा चुनने को आसान बनाने के लिए नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI के काम करने के तरीके की वजह से यह अभी प्रगति पर है।
मैं टेक्स्ट टू स्पीच से जनरेट की गई फ़ाइलें कैसे डाउनलोड करूं?
आप जनरेट की गई फ़ाइलें दो तरीकों से डाउनलोड कर सकते हैं:
कंटेंट जनरेट करने के बाद, नीचे दाईं ओर मौजूद डाउनलोड बटन पर क्लिक करके आप तुरंत जनरेट की गई फ़ाइल डाउनलोड कर सकते हैं।
पहले जनरेट की गई फ़ाइलें आपकी हिस्ट्री से डाउनलोड की जा सकती हैं।
अपनी हिस्ट्री देखने के लिए अपने अकाउंट में लॉग इन करें और साइडबार में टेक्स्ट टू स्पीच चुनें। फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 (128kbps) या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं।
अतिरिक्त फ़ाइल फ़ॉर्मैट में डाउनलोड करने के लिए आप एडवांस्ड पर भी क्लिक कर सकते हैं:
MP3 (192kbps)
MP3 (256kbps)
M4A
FLAC
क्या आप वॉइस से सांस लेने की आवाज़ निकलवा सकते हैं?
हाँ। Eleven v3 के साथ, आप जनरेट की गई स्पीच में सांस लेने और ऐसी ही प्रतिक्रियाएं जोड़ने के लिए [sighs] या [exhales] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं।
हमारे Flash और Turbo मॉडल खास तौर पर कम लेटेंसी वाले ऐप्लिकेशन के लिए विकसित किए गए हैं।
Flash v2 और Flash v2.5 हमारे बेहद कम लेटेंसी वाले मॉडल हैं, जो 75ms से कम समय में ऑडियो जनरेट करते हैं। Flash v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Flash v2.5 32 भाषाओं को सपोर्ट करता है। सभी समर्थित भाषाओं की पूरी सूची
यहाँ देख सकते हैं।
हमारे Turbo मॉडल भी कम लेटेंसी वाले हैं, लेकिन Flash मॉडल बहुत मिलते-जुलते नतीजे देते हैं, इसलिए हम Turbo के बजाय Flash मॉडल इस्तेमाल करने की सलाह देते हैं। Turbo v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Turbo v2.5 32 भाषाओं को सपोर्ट करता है और Turbo v2 से 25% तेज़ है। यह लगभग 300ms में ऑडियो जनरेट करता है।
Flash और Turbo, दोनों ही बहुत अनुकूलित मॉडल हैं। इन्हें खास तौर पर वॉइस प्रदर्शन से समझौता किए बिना और हमारे मॉडल से लोगों की अपेक्षित क्वालिटी बनाए रखते हुए, कम लेटेंसी वाले ऐप्लिकेशन के लिए तैयार किया गया है।
API के ज़रिए जनरेट करने पर दोनों मॉडल पर छूट मिलती है। जानकारी के लिए हमारी API Pricing देखें।
हम कस्टमाइज़्ड, इंटरैक्टिव वॉइस एजेंट डिप्लॉय करने के लिए अपना प्लेटफ़ॉर्म ElevenAgents भी देते हैं। अधिक जानने के लिए हमारे ElevenAgents दस्तावेज़ देखें।
मैं पॉज़ कैसे जोड़ सकता हूँ?
विराम या ब्रेक जोड़ने और स्पीकर की लय व गति को प्रभावित करने के कुछ तरीके हैं। आप कौन-सा तरीका इस्तेमाल करेंगे, यह मॉडल पर निर्भर करता है।
ऑडियो टैग (सिर्फ़ Eleven v3)
Eleven v3 के साथ, गति और डिलीवरी नियंत्रित करने के लिए ऑडियो टैग और विराम-चिह्नों का इस्तेमाल करें। Eleven v3, SSML ब्रेक टैग को सपोर्ट नहीं करता।
ब्रेक टैग (Multilingual v2, Flash v2 और Flash v2.5)
Multilingual v2, Flash v2 और Flash v2.5 में विराम जोड़ने का सबसे भरोसेमंद तरीका SSML ब्रेक टैग सिंटैक्स <break time="1.5s" /> है। यह स्पीच में सटीक और स्वाभाविक विराम बनाता है। यह सिर्फ़ शब्दों के बीच डाली गई खामोशी नहीं है—मॉडल सिंटैक्स समझता है और स्वाभाविक विराम जोड़ता है।
मॉडल इन विरामों को कैसे संभालता है, यह अलग-अलग हो सकता है। इस्तेमाल की गई वॉइस आउटपुट में अहम भूमिका निभाती है। कुछ वॉइस, जिन्हें कुछ “uh” और “ah” के साथ ट्रेन किया गया है, विराम के दौरान ये बोलने की आदतें जोड़ सकती हैं, जैसा कोई असली वक्ता कर सकता है।
एक उदाहरण ऐसा दिख सकता है:
“मुझे इसके बारे में सोचने के लिए एक सेकंड दीजिए।” <break time="1.0s" /> “हाँ, यह काम करेगा।”
ब्रेक का समय सेकंड में बताया जाना चाहिए। AI 3 सेकंड तक के विराम संभाल सकता है और इसे टेक्स्ट टू स्पीच तथा API के ज़रिए इस्तेमाल किया जा सकता है।
अगर आप अपने टेक्स्ट में बहुत ज़्यादा SSML ब्रेक इस्तेमाल करते हैं, तो समस्याएं हो सकती हैं। स्पीच तेज़ हो सकती है या ऑडियो में ज़्यादा शोर और अन्य आर्टिफैक्ट आ सकते हैं। हम इसे ठीक करने पर काम कर रहे हैं।
विराम-चिह्न
ये विकल्प ब्रेक टैग या ऑडियो टैग जितने भरोसेमंद नहीं हैं, लेकिन फिर भी गति को प्रभावित कर सकते हैं।
साधारण डैश - या एम-डैश — अक्सर अच्छी तरह काम करता है। लंबे विराम के लिए आप कई डैश, जैसे -- --, जोड़ सकते हैं।
“देर - हो - रही है।”
एलिप्सिस ... कभी-कभी शब्दों के बीच विराम जोड़ सकता है, लेकिन आमतौर पर यह वॉइस में कुछ झिझक या घबराहट भी जोड़ता है, जो हर बार उपयुक्त नहीं होती।
“मैं… हाँ, शायद…”
मैं किसी शब्द या नाम का एक खास उच्चारण कैसे लागू करूं?
Eleven v3 में अंतरराष्ट्रीय ध्वन्यात्मक वर्णमाला (IPA) का मूल समर्थन शामिल है। Eleven v3 के साथ IPA में और जानें।
SSML फ़ोनीम टैग (सिर्फ़ Flash v2 और Turbo v2)
Flash v2 और Turbo v2 पर, आप SSML फ़ोनीम टैग के साथ कोई खास उच्चारण तय कर सकते हैं। हम IPA और CMU, दोनों को सपोर्ट करते हैं। मौजूदा इम्प्लीमेंटेशन के साथ CMU थोड़ा ज़्यादा अनुमानित और स्थिर रहता है। अधिक जानकारी के लिए हमारी उच्चारण गाइड देखें।
वैकल्पिक वर्तनी
वैकल्पिक रूप से, आप कोई दूसरी वर्तनी ढूंढकर शब्द को अधिक ध्वन्यात्मक ढंग से लिख सकते हैं। आप बड़े अक्षर, डैश, अपोस्ट्रॉफ़ी या किसी एक अक्षर अथवा अक्षरों के चारों ओर सिंगल कोटेशन मार्क जैसे कई तरीके अपना सकते हैं।
उदाहरण के लिए, “trapezii” जैसे शब्द को “trapezIi” लिखा जा सकता है, ताकि शब्द के “ii” पर ज़्यादा ज़ोर दिया जाए।
Eleven v3 (Alpha) के साथ ऑडियो टैग कैसे काम करते हैं?
Eleven v3 ऑडियो टैग को सपोर्ट करता है, जिससे आपको अपने जनरेट किए गए ऑडियो पर अभूतपूर्व नियंत्रण मिलता है:
टेक्स्ट टू स्पीच या वॉइस चेंजर से जनरेट की गई फ़ाइलें MP3, WAV, M4A या FLAC फ़ाइलों के रूप में डाउनलोड की जा सकती हैं। WAV, M4A और FLAC फ़ाइलें आपकी हिस्ट्री से डाउनलोड करनी होंगी।
WAV फ़ाइलें कैसे डाउनलोड करें
साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं।
FLAC या M4A फ़ाइलें कैसे डाउनलोड करें
साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं। FLAC और M4A समेत अतिरिक्त फ़ाइल फ़ॉर्मैट देखने के लिए एडवांस्ड पर क्लिक करें और अपना पसंदीदा फ़ॉर्मैट चुनें।
मैं भाषा और ऐक्सेंट कैसे चुनूं?
वेबसाइट पर जनरेट करते समय भाषा
जब आप ElevenLabs वेबसाइट पर ऑडियो जनरेट करते हैं, तो हमारा AI आपके प्रॉम्प्ट के टेक्स्ट के संदर्भ के आधार पर भाषा को अपने-आप पहचान लेता है। इसलिए, एक ही प्रॉम्प्ट में कई भाषाओं का इस्तेमाल न करना बेहतर है, क्योंकि इससे यह भ्रम हो सकता है कि किस भाषा का इस्तेमाल किया जाए। फ़िलहाल, वेबसाइट पर जनरेट करते समय भाषा तय करना संभव नहीं है।
API के ज़रिए जनरेट करते समय भाषा
अगर आप API के ज़रिए ऑडियो जनरेट करते हैं, तो language_code पैरामीटर का इस्तेमाल करके अपने प्रॉम्प्ट की भाषा मैन्युअल रूप से तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है जो ISO 639-1 भाषा कोड स्वीकार करता है।
यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ़ संख्याएं हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।
नॉर्मलाइज़ेशन के बारे में ज़्यादा जानकारी के लिए यह लेख देखें।
ऐक्सेंट
आपके जनरेशन में इस्तेमाल होने वाला ऐक्सेंट उस वॉइस से आता है जिसका आप इस्तेमाल कर रहे हैं। अगर आप ऐसी वॉइस इस्तेमाल करते हैं जिसे उस भाषा में प्रशिक्षित नहीं किया गया है जिसमें आप जनरेट कर रहे हैं, तो आपको वॉइस की मूल भाषा का हल्का ऐक्सेंट सुनाई दे सकता है।
सबसे अच्छे नतीजों के लिए, हम ऐसी वॉइस इस्तेमाल करने की सलाह देते हैं जिसे आपकी पसंद के ऐक्सेंट के साथ, उसी भाषा के ऑडियो पर प्रशिक्षित किया गया हो जिसमें आप जनरेट कर रहे हैं। इससे AI को उच्चारण और स्वराघात को ज़्यादा सटीकता से समझने में मदद मिलती है।
यह खास तौर पर उन भाषाओं के लिए ज़रूरी है जो एक जैसी हैं या जिनमें कई सामान्य शब्द हैं। सही भाषा पर प्रशिक्षित वॉइस चुनने से यह सुनिश्चित होता है कि AI सही उच्चारण और ऐक्सेंट का इस्तेमाल करे।
आप:
अपनी पसंद की भाषा और ऐक्सेंट वाले ऑडियो से क्लोन की गई वॉइस बना सकते हैं।
वॉइस लाइब्रेरी देख सकते हैं और अपनी ज़रूरतों के मुताबिक वॉइस ढूंढने के लिए सर्च फ़िल्टर इस्तेमाल कर सकते हैं।
Eleven v3 (Alpha) से जनरेट करने की लागत कितनी है?
वेबसाइट पर Eleven v3 से जनरेट करने की लागत प्रति कैरेक्टर 1 क्रेडिट है। API जनरेशन पर छूट मिलती है — जानकारी के लिए API प्राइसिंग देखें।
Eleven v3 के साथ, आप जनरेट की गई स्पीच में हंसी और अन्य प्रतिक्रियाएं जोड़ने के लिए [laughs] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं। ज़्यादा जानकारी के लिए Eleven v3 प्रॉम्प्टिंग गाइड देखें।
अन्य मॉडल के लिए, भावनात्मक डिलीवरी संदर्भ, विराम चिह्नों और वॉइस सेटिंग्स पर निर्भर करती है। भावनाएं कैसे जनरेट करें? देखें।
भावनाएं कैसे उत्पन्न करें?
मॉडल हर कथन के व्यापक संदर्भ के प्रति संवेदनशील है — यह देखता है कि कोई बात पिछले और अगले टेक्स्ट से कैसे जुड़ती है और क्या वह समझ में आती है। यह व्यापक दृष्टिकोण इसे कई वाक्यों तक फैले विचारों को एक समान भावनात्मक पैटर्न के साथ जोड़कर, लंबे अंशों में सही स्वराघात देने में मदद करता है।
भावनाएं जनरेट करने के सुझाव:
खास भावनाएं जनरेट करने के लिए संदर्भ अहम है। अगर आप हंसने वाला या मज़ेदार टेक्स्ट इनपुट करते हैं, तो आपको खुशमिज़ाज आउटपुट मिल सकता है। यही बात गुस्से, उदासी और अन्य भावनाओं पर भी लागू होती है — सही संदर्भ देना ज़रूरी है।
आउटपुट की डिलीवरी में विराम चिह्न और वॉइस सेटिंग्स की सबसे अहम भूमिका होती है।
संबंधित शब्दों या वाक्यांशों को उद्धरण चिह्नों में रखकर उन पर ज़ोर दें।
क्लोन की गई वॉइस से जनरेट की गई स्पीच में, क्लोनिंग के लिए अपलोड किए गए सैंपल की बोलने की शैली आउटपुट में दोहराई जाती है। अगर अपलोड किए गए सैंपल की स्पीच एकरस है, तो मॉडल के लिए अभिव्यक्तिपूर्ण आउटपुट जनरेट करना मुश्किल होगा।
Eleven v3 के साथ, आप भावनाओं और डिलीवरी को ज़्यादा सीधे नियंत्रित करने के लिए ऑडियो टैग भी इस्तेमाल कर सकते हैं, जैसे [happy], [sad], [angry], [whispers], और [laughs]। ज़्यादा जानकारी के लिए Eleven v3 प्रॉम्प्टिंग गाइड देखें।
ये सुझाव भावनात्मक डिलीवरी को दिशा देते हैं, लेकिन किसी खास नतीजे की गारंटी नहीं देते।
क्या डाउनलोड से पहले कोटा खर्च किए बिना ऑडियो का प्रीव्यू करने का कोई तरीका है?
दुर्भाग्य से, फ़िलहाल हम जनरेशन-आधारित कटौती के विकल्प के तौर पर डाउनलोड-आधारित कटौती नहीं देते। अभी कोटा काटे बिना जनरेशन का प्रीव्यू करने का कोई तरीका नहीं है।
जब आप वेबसाइट पर ‘Generate’ दबाते हैं, तो आपके क्रेडिट काटे जाएंगे क्योंकि सर्वर को शुरू करना होता है और ऑडियो जनरेट करना होता है। क्रेडिट इस्तेमाल किए बिना, अपने टेक्स्ट से किसी वॉइस को टेस्ट या प्रीव्यू करने का कोई तरीका नहीं है।
हम वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में, नीचे दी गई परिस्थितियों में दो मुफ़्त रीजनरेशन की अनुमति देते हैं:
प्रॉम्प्ट (टेक्स्ट टू स्पीच के लिए) या फ़ाइल (वॉइस चेंजर के लिए), वॉइस और मॉडल एक जैसे रहें। आप वॉइस सेटिंग स्लाइडर्स बदल सकते हैं।
पहला जनरेशन दो घंटे से कम समय पहले किया गया था।
मूल ऑडियो जनरेट करने के बाद आपने पेज रिफ़्रेश नहीं किया है।
अगर ऐसा है, तो आपको ‘Regenerate speech’ दिखाई देगा। ‘Regenerate speech’ बटन पर होवर करने पर बचे हुए मुफ़्त रीजनरेशन की संख्या दिखाई जाएगी:
जब आपके मुफ़्त रीजनरेशन इस्तेमाल हो जाएंगे, तो बटन फिर से ‘Generate speech’ हो जाएगा और जनरेशन के लिए इस्तेमाल होने वाले क्रेडिट की संख्या दिखाई जाएगी:
मुफ़्त रीजनरेशन सिर्फ़ वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध हैं। ये API के ज़रिए उपलब्ध नहीं हैं।
हम यह देख रहे हैं कि कीमतें या लागत बढ़ाए बिना, इस गुणवत्ता पर प्रीव्यू की सुविधा कैसे दी जा सकती है। हम AI को ज़्यादा नियंत्रित करने योग्य बनाने के तरीके भी खोज रहे हैं, ताकि आपको प्रीव्यू न करना पड़े और उम्मीद है कि पहली कोशिश में ही मनचाहा नतीजा मिल जाए।
डायलॉग मोड क्या है?
Eleven v3 में डायलॉग मोड है, जिससे आप प्राकृतिक गति वाले डायनामिक मल्टी-स्पीकर संवाद जनरेट कर सकते हैं। ये बातचीत के संदर्भ के आधार पर रुकावटों, टोन में बदलाव और भावनात्मक संकेतों को संभालते हैं।
वेबसाइट पर कई स्पीकर इस्तेमाल करने पर डायलॉग मोड उपलब्ध होता है।
हमने मल्टी-स्पीकर इंटरैक्शन जनरेट करने के लिए नए टेक्स्ट टू डायलॉग API एंडपॉइंट भी बनाए हैं। ज़्यादा जानकारी के लिए हमारे API दस्तावेज़ देखें:
कोई भी वॉइस, AI द्वारा फ़िलहाल समर्थित कोई भी भाषा बोल सकती है; हालांकि, अगर आप ऐसी वॉइस इस्तेमाल नहीं करते जो उस भाषा की मूल वॉइस हो जिसे आप AI से बुलवाना चाहते हैं — उदाहरण के लिए, आप जनरेट की गई वॉइस या अंग्रेज़ी बोलते हुए क्लोन की गई वॉइस का इस्तेमाल करते हैं — तो AI में हल्का अंग्रेज़ी ऐक्सेंट हो सकता है या वह मिलती-जुलती भाषाओं के बीच बदल सकता है।
मौजूदा मॉडल इस तरह काम करता है कि आप कोई खास भाषा नहीं चुनते। इसके बजाय, आप उस भाषा में लिखते हैं जो आप AI से बुलवाना चाहते हैं, और AI अपने-आप समझ जाता है। हालांकि, अलग-अलग भाषाओं में मिलते-जुलते शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और ऐक्सेंट काफी अलग हो सकते हैं। इसलिए, आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही ऐक्सेंट के साथ उसी भाषा में बोलते हुए क्लोन किया गया हो। इससे AI को यह समझने के लिए सबसे ज़्यादा संदर्भ मिलता है कि किसी बात को कैसे और किस भाषा में बोलना है।
भाषा टेक्स्ट से तय होती है, जबकि ऐक्सेंट और उच्चारण वॉइस से तय होते हैं।
हम भाषा चुनने की सुविधा देने वाली नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI जिस तरह बनाया गया है, उसके कारण यह सब अभी प्रगति में है।
मैं अधिकतम कितने कैरेक्टर और कितना टेक्स्ट जनरेट कर सकता हूँ?
वेबसाइट पर टेक्स्ट टू स्पीच का इस्तेमाल करके, आप किसी भी पेड प्लान में एक बार में 5,000 कैरेक्टर तक और सभी मुफ़्त प्लान में 2,500 कैरेक्टर तक जनरेट कर सकते हैं।
हालाँकि, अगर आप कुछ हज़ार कैरेक्टर से ज़्यादा लंबा कंटेंट जनरेट करना चाहते हैं, तो हम Studio इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इससे आप किताबों और उपन्यासों जैसा बेहद लंबा कंटेंट आसानी से जनरेट कर सकते हैं। इसके बारे में और जानकारी यहाँ पढ़ें।
अगर आप API से जनरेट कर रहे हैं, तो इनपुट की अधिकतम लंबाई आपके इस्तेमाल किए जा रहे मॉडल के अनुसार अलग-अलग होती है:
टेक्स्ट टू स्पीच
Flash v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)
Turbo v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)
Flash v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)
Turbo v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)
Multilingual v2 - 10,000 कैरेक्टर तक (~10 मिनट का ऑडियो)
वॉइस चेंजर
Multilingual v2 - 10 मिनट तक का ऑडियो
वॉइस लाइब्रेरी में कौन-सी वॉइस किसी खास भाषा की मूल वॉइस हैं?
सभी पहले से बनी वॉइस और जनरेट की गई वॉइस अंग्रेज़ी की हैं। इसका मतलब है कि दूसरी भाषाएँ बोलते समय उनका उच्चारण या लहजा सही नहीं हो सकता।
वॉइस लाइब्रेरी में प्रोफेशनल कैटेगरी के तहत आपको समुदाय की हमारे साथ साझा की गई वॉइस मिल सकती हैं। ये वॉइस, अपनी वॉइस के Professional Voice Clones हैं। इन वॉइस पर आम तौर पर उस भाषा का टैग होता है जिसमें उन्हें क्लोन किया गया था, इसलिए वे उस भाषा की मूल वॉइस होती हैं। आप खास भाषाओं के लिए फ़िल्टर करने हेतु भाषा खोज फ़िल्टर भी इस्तेमाल कर सकते हैं।
संख्याओं, तारीखों, प्रतीकों और संक्षिप्ताक्षरों का सही उच्चारण या सही भाषा में उच्चारण क्यों नहीं होता?
संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर AI के लिए चुनौती हो सकते हैं, क्योंकि अक्सर उन्हें सही तरीके से कहने के कई तरीके होते हैं। यह इस्तेमाल की जा रही भाषा पर भी निर्भर कर सकता है। उदाहरण के लिए, “11” को “Eleven” पढ़ा जा सकता है, लेकिन स्पैनिश में “Once” या जर्मन में “Elf” भी पढ़ा जा सकता है।
संख्याओं, तारीखों, संक्षिप्ताक्षरों और प्रतीकों का सही उच्चारण सुनिश्चित करने के कई तरीके हैं।
पूरा लिखें, शब्दों में
सबसे अच्छे नतीजों के लिए, हम संख्याओं, संक्षिप्ताक्षरों, तारीखों और प्रतीकों को पूरे शब्दों में, उसी तरह लिखने की सलाह देते हैं जैसा आप चाहते हैं कि AI उन्हें बोले। इससे AI को सबसे ज़्यादा संदर्भ मिलता है, ताकि वह सही आउटपुट दे सके। उदाहरण के लिए, “$100” के लिए हम “a hundred dollars” या “one hundred dollars” लिखने की सलाह देंगे, ताकि आपको मनचाहा नतीजा मिले।
LLM का इस्तेमाल
अगर आप अपने टेक्स्ट प्रॉम्प्ट जनरेट करने के लिए किसी लार्ज लैंग्वेज मॉडल का इस्तेमाल कर रहे हैं, जैसे ElevenAgents इस्तेमाल करते समय, तो आप मॉडल को प्रॉम्प्ट दे सकते हैं कि वह संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर हमेशा शब्दों में लिखे, जिस तरह से आप चाहते हैं कि AI उन्हें बोले।
नॉर्मलाइज़ेशन
अगर आप API के ज़रिए जनरेट कर रहे हैं, तो apply_text_normalization पैरामीटर का इस्तेमाल करके तय कर सकते हैं कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं। बेहतर उच्चारण सुनिश्चित करने के लिए टेक्स्ट नॉर्मलाइज़ेशन संख्याओं और तारीखों को शब्दों में लिखता है। इस विकल्प से लेटेंसी बढ़ती है, क्योंकि नॉर्मलाइज़ेशन प्रक्रिया में अतिरिक्त प्रोसेसिंग समय लगता है।
apply_text_normalization पैरामीटर में तीन मोड हैं:
on, यानी यह हमेशा लागू होता है
off, यानी यह कभी लागू नहीं होता
auto, यानी AI अपने-आप तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है
आप language_code पैरामीटर से अपने प्रॉम्प्ट की भाषा भी तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है, जो ISO 639-1 भाषा कोड स्वीकार करता है।
यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ संख्याएँ या प्रतीक हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।
वेबसाइट पर टेक्स्ट टू स्पीच से जनरेट करते समय नॉर्मलाइज़ेशन डिफ़ॉल्ट रूप से सक्षम होता है।
Studio में, डिफ़ॉल्ट रूप से नॉर्मलाइज़ेशन अपने-आप लागू होता है, यानी AI तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है। आप नॉर्मलाइज़ेशन को हमेशा लागू होने के लिए भी सेट कर सकते हैं - यह विकल्प Project settings में Advanced टैब के तहत है।
मेरी वॉइस कुछ शब्दों का गलत उच्चारण क्यों कर रही है?
गलत उच्चारण कई कारणों से हो सकते हैं। सबसे आम कारण यह है कि शब्द की वर्तनी गलत होती है। AI गलत वर्तनी वाले शब्दों को सुधारने की कोशिश नहीं करेगा और उन्हें ठीक उसी तरह पढ़ने की कोशिश करेगा जैसे वे लिखे गए हैं। इसलिए AI से पढ़वाने से पहले टेक्स्ट को दोबारा जाँचना और प्रूफ़रीड करके पूरा करना ज़रूरी है।
अगर आप कोई खास उच्चारण तय करना चाहते हैं, तो हमारे Flash v2 मॉडल के साथ SSML फ़ोनीम टैग इस्तेमाल कर सकते हैं। इसके बारे में हमारी उच्चारण गाइड में और जानें।
कभी-कभी AI शब्दों का गलत उच्चारण कर सकता है या उसका लहजा अजीब हो सकता है, जो आपकी अपेक्षा वाला नहीं होता। ऐसा कई कारणों से हो सकता है और ज़्यादातर मामलों में यह वॉइस और भाषा पर बहुत निर्भर करता है। सही लहजा और उच्चारण सुनिश्चित करने का सबसे अच्छा तरीका है कि सही लहजे और उच्चारण वाली वॉइस क्लोन की जाए। इससे ऑडियो जनरेट करते समय AI को सबसे ज़्यादा संदर्भ मिलता है।
भाषा टेक्स्ट से तय होती है और लहजा वॉइस से तय होता है। इसलिए, अगर आप ऐसी भाषा में लिख रहे हैं जिसमें दूसरी भाषा के साथ बहुत से शब्द समान हों या जो किसी दूसरी भाषा से काफ़ी मिलती-जुलती हो, तो AI को कुछ शब्दों का उच्चारण समझने या लहजों के बीच बदलने में मुश्किल हो सकती है।
हालाँकि, कुछ परिस्थितियों में AI अंग्रेज़ी में भी सही लिखे शब्दों का गलत उच्चारण कर सकता है। यह इस्तेमाल की गई वॉइस और टेक्स्ट पर बहुत निर्भर लगता है, लेकिन ऐसा बहुत कम होना चाहिए।