टेक्स्ट टू स्पीच

जानें कि ElevenLabs के साथ टेक्स्ट को जीवंत बोले गए ऑडियो में कैसे बदलें।

परिचय

ElevenLabs टेक्स्ट टू स्पीच (TTS) API टेक्स्ट को बारीक उतार-चढ़ाव, गति और भावनात्मक समझ के साथ जीवंत ऑडियो में बदलता है। हमारे मॉडल 32 भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढलते हैं और इनका इस्तेमाल इन कामों के लिए किया जा सकता है:

  • वैश्विक मीडिया कैंपेन्स और विज्ञापनों को नैरेट करना
  • जटिल भावपूर्ण डिलीवरी के साथ कई भाषाओं में ऑडियोबुक्स बनाना
  • टेक्स्ट से रीयल-टाइम ऑडियो स्ट्रीम करना

एक सैंपल सुनें:

अपने प्रोजेक्ट के लिए सही वॉइस ढूंढने हेतु हमारी वॉइस लाइब्रेरी देखें।

वॉइस लाइब्रेरी API के ज़रिए फ़्री टियर यूज़र्स के लिए उपलब्ध नहीं है।

वॉइस क्वालिटी

रीयल-टाइम ऐप्लिकेशन्स के लिए Flash v2.5 बेहद कम 75ms लेटेंसी देता है, जबकि Multilingual v2 अधिक बारीक अभिव्यक्ति के साथ सबसे उच्च गुणवत्ता वाला ऑडियो देता है।

वॉइस विकल्प

ElevenLabs कई तरीकों से 32 भाषाओं में हज़ारों वॉइस उपलब्ध कराता है:

हमारे वॉइस विकल्पों के बारे में और जानें।

डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।

  • MP3
    • सैंपल रेट्स: 22.05kHz - 44.1kHz
    • बिटरेट्स: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • सैंपल रेट्स: 16kHz - 44.1kHz
    • बिटरेट्स: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-बिट डेप्थ
  • μ-law
    • 8kHz सैंपल रेट
    • टेलीफोनी ऐप्लिकेशन्स के लिए ऑप्टिमाइज़्ड
  • A-law
    • 8kHz सैंपल रेट
    • टेलीफोनी ऐप्लिकेशन्स के लिए ऑप्टिमाइज़्ड
  • Opus
    • सैंपल रेट: 48kHz
    • बिटरेट्स: 32kbps - 192kbps

उच्च गुणवत्ता वाले ऑडियो विकल्प केवल पेड टियर्स पर उपलब्ध हैं - विवरण के लिए हमारा प्राइसिंग पेज देखें।

समर्थित भाषाएं

हमारे multilingual v2 मॉडल्स 29 भाषाओं को support करते हैं:

अंग्रेज़ी (USA, UK, ऑस्ट्रेलिया, कनाडा), जापानी, चीनी, जर्मन, हिंदी, फ़्रेंच (फ़्रांस, कनाडा), कोरियाई, पुर्तगाली (ब्राज़ील, पुर्तगाल), इतालवी, स्पेनिश (स्पेन, मेक्सिको), इंडोनेशियाई, डच, तुर्की, फ़िलिपीनो, पोलिश, स्वीडिश, बल्गेरियाई, रोमानियाई, अरबी (सऊदी अरब, UAE), चेक, यूनानी, फ़िनिश, क्रोएशियाई, मलय, स्लोवाक, डेनिश, तमिल, यूक्रेनी और रूसी।

Flash v2.5, v2 मॉडल्स की सभी भाषाओं के साथ-साथ 32 भाषाओं को support करता है:

हंगेरियन, नॉर्वेजियन और वियतनामी

बस हमारी किसी भी समर्थित भाषा में टेक्स्ट डालें और हमारी वॉइस लाइब्रेरी से मिलती-जुलती वॉइस चुनें। सबसे स्वाभाविक परिणामों के लिए, ऐसी वॉइस चुनें जिसका एक्सेंट आपकी लक्षित भाषा और क्षेत्र से मेल खाता हो।

प्रॉम्प्टिंग

मॉडल टेक्स्ट इनपुट से सीधे भावनात्मक संदर्भ समझते हैं। उदाहरण के लिए, “उसने उत्साहित होकर कहा” जैसा विवरण जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने की भावना प्रभावित होगी। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।

ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।

विवरणात्मक टेक्स्ट मॉडल बोलकर सुनाएगा और चाहें तो इसे ऑडियो से मैन्युअल रूप से ट्रिम या हटाना होगा।

FAQ

हाँ, आप छोटी ऑडियो क्लिप्स से अपनी वॉइस के इंस्टेंट वॉइस क्लोन्स बना सकते हैं। उच्च-गुणवत्ता वाले क्लोन्स के लिए, हमारी प्रोफेशनल वॉइस क्लोनिंग सुविधा देखें।

हाँ। आपके द्वारा जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और यदि आपके पास इनपुट कंटेंट के IP अधिकार हैं, तो आउटपुट से कमाई कर सकते हैं।

मुफ़्त रीजनरेशन से आप इन शर्तों के अधीन, बिना अतिरिक्त लागत के वही टेक्स्ट टू स्पीच कंटेंट फिर से जनरेट कर सकते हैं:

  • आप हर कंटेंट को 2 बार तक मुफ़्त में फिर से जनरेट कर सकते हैं
  • कंटेंट पिछली जनरेशन के बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव करने पर नई, पेड जनरेशन की ज़रूरत होगी

अगर ऑडियो आउटपुट में हल्का डिस्टॉर्शन हो, तो मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन गुणवत्ता संबंधी लगभग आधी समस्याएं हल कर देंगे, जबकि बाकी समस्याएं आम तौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।

लगभग रीयल-टाइम कन्वर्सेशनल या इंटरैक्टिव स्थितियों के लिए ऑप्टिमाइज़्ड कम-लेटेंसी Flash मॉडल्स (Flash v2 या v2.5) का इस्तेमाल करें। अधिक जानकारी के लिए हमारी लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें।

मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर का इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।

लंबे टेक्स्ट को सेगमेंट्स में बांटें और रीयल-टाइम प्लेबैक व कुशल प्रोसेसिंग के लिए स्ट्रीमिंग का इस्तेमाल करें। चंक्स के बीच स्वाभाविक प्रोसोडी फ्लो बनाए रखने के लिए previous/next text या previous/next request id पैरामीटर्स शामिल करें।

मुख्य तथ्य

  • नियतात्मकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप परिणामों के लिए seed पैरामीटर का इस्तेमाल करें
  • मुफ़्त रीजनरेशन: हर जनरेशन पर 2 तक मुफ़्त रीजनरेशन (केवल समान कंटेंट और पैरामीटर्स)
  • स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान ज़रूरी है
  • कम-लेटेंसी उपयोग के मामले: Flash मॉडल्स (eleven_flash_v2 या eleven_flash_v2_5) इस्तेमाल करें — लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें
  • बड़ा टेक्स्ट: लंबे टेक्स्ट को सेगमेंट्स में बांटें; चंक्स में स्वाभाविक प्रोसोडी बनाए रखने के लिए previous_text / next_text पैरामीटर्स का इस्तेमाल करें