टेक्स्ट टू डायलॉग

जानें कि ElevenLabs के साथ इमर्सिव, प्राकृतिक लगने वाले संवाद कैसे बनाएं।

परिचय

Eleven v3 मॉडल का इस्तेमाल करने वाला ElevenLabs टेक्स्ट टू डायलॉग API, टेक्स्ट से प्राकृतिक लगने वाले और अभिव्यक्तिपूर्ण संवाद बनाता है। इसके लोकप्रिय उपयोगों में शामिल हैं:

  • वीडियो गेम्स के लिए एकदम सटीक बातचीत जनरेट करना
  • पॉडकास्ट और अन्य ऑडियो कॉन्टेंट के लिए इमर्सिव संवाद बनाना
  • अभिव्यक्तिपूर्ण नैरेशन के साथ ऑडियोबुक्स को जीवंत बनाना

मनचाहे नतीजे पाने के लिए कई बार जनरेशन की ज़रूरत पड़ सकती है। अपने ऐप्लिकेशन में टेक्स्ट टू डायलॉग इंटीग्रेट करते समय, कई जनरेशन करने और यूज़र को उनमें से सबसे अच्छा चुनने का विकल्प देने पर विचार करें।

एक नमूना सुनें:

वॉइस विकल्प

ElevenLabs कई तरीके से वॉइस बनाने की सुविधा के साथ 70+ भाषाओं में हज़ारों वॉइस देता है:

हमारे वॉइस विकल्पों के बारे में और जानें।

प्रॉम्प्टिंग

मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “she said excitedly” जैसा वर्णनात्मक टेक्स्ट जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने का भाव प्रभावित होगा। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।

ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।

ऑडियो टैग के साथ भावनात्मक डिलीवरी

यह सुविधा अभी सक्रिय विकास में है, इसलिए वास्तविक नतीजे अलग हो सकते हैं।

Eleven v3 मॉडल आपको संवाद की डिलीवरी को प्रभावित करने के लिए गैर-वाक् ऑडियो इवेंट्स इस्तेमाल करने देता है। इसके लिए टेक्स्ट इनपुट में ऑडियो इवेंट्स को वर्गाकार कोष्ठकों में डालें।

टेक्स्ट टू डायलॉग में, हर संवाद टर्न का अपना टेक्स्ट और वॉइस होता है। जिन टर्न पर ऑडियो टैग का असर होना चाहिए, उनके टेक्स्ट में टैग जोड़ें। voice_id अब भी उस टर्न के स्पीकर की वॉइस चुनता है, जबकि टैग डिलीवरी को निर्देशित करते हैं।

उदाहरण के लिए, एक स्पीकर एक वॉइस का इस्तेमाल कर सकता है, जबकि उसका टेक्स्ट [giggling] से शुरू होता है। अगला स्पीकर दूसरी वॉइस का इस्तेमाल कर सकता है, जबकि उसका टेक्स्ट [whispering] से शुरू होता है। टैग और voice_id को मिलाने वाले API उदाहरण के लिए टेक्स्ट टू डायलॉग क्विकस्टार्ट देखें।

ऑडियो टैग enum पैरामीटर नहीं, बल्कि प्राकृतिक भाषा के निर्देश हैं। निर्देश को वर्गाकार कोष्ठकों में रखें और टेक्स्ट में वहां डालें जहां डिलीवरी बदलनी चाहिए। नीचे दिए उदाहरण पूरी सूची नहीं हैं; प्रभावी टैग के बारे में ज़्यादा मार्गदर्शन के लिए Eleven v3 प्रॉम्प्टिंग गाइड देखें।

ऑडियो टैग कुछ अलग-अलग रूपों में आते हैं:

भावनाएं और डिलीवरी

उदाहरण के लिए, [sad], [laughing] और [whispering]

ऑडियो इवेंट्स

उदाहरण के लिए, [leaves rustling], [gentle footsteps] और [applause]।

समग्र निर्देश

उदाहरण के लिए, [football], [wrestling match] और [auctioneer]।

कुछ उदाहरण:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

आप रुकावटों जैसे संवाद के प्रवाह को दिखाने के लिए विराम चिह्नों का भी इस्तेमाल कर सकते हैं:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

अधूरे वाक्य दिखाने के लिए एलिप्सिस का इस्तेमाल किया जा सकता है:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।

  • MP3
    • सैंपल रेट: 22.05kHz - 44.1kHz
    • बिटरेट: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • सैंपल रेट: 16kHz - 44.1kHz
    • बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-बिट डेप्थ
  • μ-law
    • 8kHz सैंपल रेट
    • टेलीफोनी ऐप्लिकेशन के लिए ऑप्टिमाइज़्ड
  • A-law
    • 8kHz सैंपल रेट
    • टेलीफोनी ऐप्लिकेशन के लिए ऑप्टिमाइज़्ड
  • Opus
    • सैंपल रेट: 48kHz
    • बिटरेट: 32kbps - 192kbps

उच्च गुणवत्ता वाले ऑडियो विकल्प केवल पेड टियर्स में उपलब्ध हैं - जानकारी के लिए हमारा प्राइसिंग पेज देखें।

समर्थित भाषाएं

Eleven v3 मॉडल 70+ भाषाओं को support करता है, जिनमें शामिल हैं:

अफ़्रीकान्स (afr), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), कन्नड़ (kan), कज़ाख़ (kaz), किर्गिज़ (kir), कोरियाई (kor), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), मंदारिन चीनी (cmn), मराठी (mar), नेपाली (nep), नॉर्वेजियन (nor), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), सिंधी (snd), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उर्दू (urd), वियतनामी (vie), वेल्श (cym)।

FAQ

टेक्स्ट टू डायलॉग केवल Eleven v3 मॉडल पर उपलब्ध है।

हां। आपके जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, अगर आपके पास इनपुट कॉन्टेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और आउटपुट से कमाई कर सकते हैं।

मुफ़्त रीजनरेशन आपको बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कॉन्टेंट को फिर से जनरेट करने देता है, बशर्ते ये शर्तें पूरी हों:

  • केवल ElevenLabs डैशबोर्ड में उपलब्ध है।
  • आप हर कॉन्टेंट को मुफ़्त में 2 बार तक फिर से जनरेट कर सकते हैं।
  • कॉन्टेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में किसी भी बदलाव के लिए नई, पेड जनरेशन की ज़रूरत होगी।

अगर ऑडियो आउटपुट में हल्का विरूपण हो, तो मुफ़्त रीजनरेशन उपयोगी है। ElevenLabs के आंतरिक बेंचमार्क के अनुसार, रीजनरेशन गुणवत्ता संबंधी लगभग आधी समस्याएं हल कर देता है। बाकी समस्याएं आमतौर पर खराब ट्रेनिंग डेटा की वजह से होती हैं।

संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं है।

मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर का इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।

भरोसेमंद जनरेशन के लिए, हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 वर्णों तक या उससे कम रखें। लंबे टेक्स्ट को हिस्सों में बांटें और अपने ऐप्लिकेशन में बने हुए ऑडियो को जोड़ें।

मुख्य बातें

  • मॉडल: केवल Eleven v3 के साथ उपलब्ध
  • स्पीकर्स: हर संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं
  • रिक्वेस्ट आकार: हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 वर्णों तक या उससे कम रखें
  • नियतात्मकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप नतीजों के लिए seed पैरामीटर इस्तेमाल करें
  • मुफ़्त रीजनरेशन: हर जनरेशन के लिए 2 तक मुफ़्त रीजनरेशन (वही कॉन्टेंट, वही पैरामीटर्स, केवल डैशबोर्ड में)
  • स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान चाहिए