टेक्स्ट टू डायलॉग
टेक्स्ट टू डायलॉग
जानें कि ElevenLabs के साथ इमर्सिव, प्राकृतिक लगने वाले संवाद कैसे बनाएं।
परिचय
Eleven v3 मॉडल का इस्तेमाल करने वाला ElevenLabs टेक्स्ट टू डायलॉग API, टेक्स्ट से प्राकृतिक लगने वाले और अभिव्यक्तिपूर्ण संवाद बनाता है। इसके लोकप्रिय उपयोगों में शामिल हैं:
- वीडियो गेम्स के लिए एकदम सटीक बातचीत जनरेट करना
- पॉडकास्ट और अन्य ऑडियो कॉन्टेंट के लिए इमर्सिव संवाद बनाना
- अभिव्यक्तिपूर्ण नैरेशन के साथ ऑडियोबुक्स को जीवंत बनाना
मनचाहे नतीजे पाने के लिए कई बार जनरेशन की ज़रूरत पड़ सकती है। अपने ऐप्लिकेशन में टेक्स्ट टू डायलॉग इंटीग्रेट करते समय, कई जनरेशन करने और यूज़र को उनमें से सबसे अच्छा चुनने का विकल्प देने पर विचार करें।
एक नमूना सुनें:
वॉइस विकल्प
ElevenLabs कई तरीके से वॉइस बनाने की सुविधा के साथ 70+ भाषाओं में हज़ारों वॉइस देता है:
- 3,000+ कम्युनिटी द्वारा शेयर की गई वॉइस के साथ वॉइस लाइब्रेरी
- सबसे उच्च गुणवत्ता वाली प्रतिकृतियों के लिए प्रोफेशनल वॉइस क्लोनिंग
- तेज़ी से वॉइस प्रतिकृति बनाने के लिए इंस्टेंट वॉइस क्लोनिंग
- टेक्स्ट विवरण से कस्टम वॉइस जनरेट करने के लिए वॉइस डिज़ाइन
हमारे वॉइस विकल्पों के बारे में और जानें।
प्रॉम्प्टिंग
मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “she said excitedly” जैसा वर्णनात्मक टेक्स्ट जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने का भाव प्रभावित होगा। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।
ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।
ऑडियो टैग के साथ भावनात्मक डिलीवरी
Eleven v3 मॉडल आपको संवाद की डिलीवरी को प्रभावित करने के लिए गैर-वाक् ऑडियो इवेंट्स इस्तेमाल करने देता है। इसके लिए टेक्स्ट इनपुट में ऑडियो इवेंट्स को वर्गाकार कोष्ठकों में डालें।
टेक्स्ट टू डायलॉग में, हर संवाद टर्न का अपना टेक्स्ट और वॉइस होता है। जिन टर्न पर ऑडियो टैग का असर होना चाहिए, उनके टेक्स्ट में टैग जोड़ें। voice_id अब भी उस टर्न के स्पीकर की वॉइस चुनता है, जबकि टैग डिलीवरी को निर्देशित करते हैं।
उदाहरण के लिए, एक स्पीकर एक वॉइस का इस्तेमाल कर सकता है, जबकि उसका टेक्स्ट [giggling] से शुरू होता है। अगला स्पीकर दूसरी वॉइस का इस्तेमाल कर सकता है, जबकि उसका टेक्स्ट [whispering] से शुरू होता है। टैग और voice_id को मिलाने वाले API उदाहरण के लिए टेक्स्ट टू डायलॉग क्विकस्टार्ट देखें।
ऑडियो टैग enum पैरामीटर नहीं, बल्कि प्राकृतिक भाषा के निर्देश हैं। निर्देश को वर्गाकार कोष्ठकों में रखें और टेक्स्ट में वहां डालें जहां डिलीवरी बदलनी चाहिए। नीचे दिए उदाहरण पूरी सूची नहीं हैं; प्रभावी टैग के बारे में ज़्यादा मार्गदर्शन के लिए Eleven v3 प्रॉम्प्टिंग गाइड देखें।
ऑडियो टैग कुछ अलग-अलग रूपों में आते हैं:
भावनाएं और डिलीवरी
उदाहरण के लिए, [sad], [laughing] और [whispering]
ऑडियो इवेंट्स
उदाहरण के लिए, [leaves rustling], [gentle footsteps] और [applause]।
समग्र निर्देश
उदाहरण के लिए, [football], [wrestling match] और [auctioneer]।
कुछ उदाहरण:
आप रुकावटों जैसे संवाद के प्रवाह को दिखाने के लिए विराम चिह्नों का भी इस्तेमाल कर सकते हैं:
अधूरे वाक्य दिखाने के लिए एलिप्सिस का इस्तेमाल किया जा सकता है:
समर्थित आउटपुट फ़ॉर्मैट
डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।
- MP3
- सैंपल रेट: 22.05kHz - 44.1kHz
- बिटरेट: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- सैंपल रेट: 16kHz - 44.1kHz
- बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16-बिट डेप्थ
- μ-law
- 8kHz सैंपल रेट
- टेलीफोनी ऐप्लिकेशन के लिए ऑप्टिमाइज़्ड
- A-law
- 8kHz सैंपल रेट
- टेलीफोनी ऐप्लिकेशन के लिए ऑप्टिमाइज़्ड
- Opus
- सैंपल रेट: 48kHz
- बिटरेट: 32kbps - 192kbps
उच्च गुणवत्ता वाले ऑडियो विकल्प केवल पेड टियर्स में उपलब्ध हैं - जानकारी के लिए हमारा प्राइसिंग पेज देखें।
समर्थित भाषाएं
Eleven v3 मॉडल 70+ भाषाओं को support करता है, जिनमें शामिल हैं:
अफ़्रीकान्स (afr), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), कन्नड़ (kan), कज़ाख़ (kaz), किर्गिज़ (kir), कोरियाई (kor), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), मंदारिन चीनी (cmn), मराठी (mar), नेपाली (nep), नॉर्वेजियन (nor), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), सिंधी (snd), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उर्दू (urd), वियतनामी (vie), वेल्श (cym)।
FAQ
मैं कौन-से मॉडल इस्तेमाल कर सकता हूं?
टेक्स्ट टू डायलॉग केवल Eleven v3 मॉडल पर उपलब्ध है।
क्या ऑडियो आउटपुट का मालिक मैं हूं?
हां। आपके जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, अगर आपके पास इनपुट कॉन्टेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और आउटपुट से कमाई कर सकते हैं।
मुफ़्त रीजनरेशन के लिए क्या शर्तें हैं?
मुफ़्त रीजनरेशन आपको बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कॉन्टेंट को फिर से जनरेट करने देता है, बशर्ते ये शर्तें पूरी हों:
- केवल ElevenLabs डैशबोर्ड में उपलब्ध है।
- आप हर कॉन्टेंट को मुफ़्त में 2 बार तक फिर से जनरेट कर सकते हैं।
- कॉन्टेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में किसी भी बदलाव के लिए नई, पेड जनरेशन की ज़रूरत होगी।
अगर ऑडियो आउटपुट में हल्का विरूपण हो, तो मुफ़्त रीजनरेशन उपयोगी है। ElevenLabs के आंतरिक बेंचमार्क के अनुसार, रीजनरेशन गुणवत्ता संबंधी लगभग आधी समस्याएं हल कर देता है। बाकी समस्याएं आमतौर पर खराब ट्रेनिंग डेटा की वजह से होती हैं।
मेरे संवाद में कितने स्पीकर हो सकते हैं?
संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं है।
मेरा आउटपुट कभी-कभी असंगत क्यों होता है?
मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर का इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।
बड़े टेक्स्ट कन्वर्ज़न के लिए सबसे अच्छा तरीका क्या है?
भरोसेमंद जनरेशन के लिए, हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 वर्णों तक या उससे कम रखें। लंबे टेक्स्ट को हिस्सों में बांटें और अपने ऐप्लिकेशन में बने हुए ऑडियो को जोड़ें।
मुख्य बातें
- मॉडल: केवल Eleven v3 के साथ उपलब्ध
- स्पीकर्स: हर संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं
- रिक्वेस्ट आकार: हर रिक्वेस्ट में सभी
inputs[].textवैल्यू की कुल लंबाई 2,000 वर्णों तक या उससे कम रखें - नियतात्मकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप नतीजों के लिए
seedपैरामीटर इस्तेमाल करें - मुफ़्त रीजनरेशन: हर जनरेशन के लिए 2 तक मुफ़्त रीजनरेशन (वही कॉन्टेंट, वही पैरामीटर्स, केवल डैशबोर्ड में)
- स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान चाहिए