टेक्स्ट टू स्पीच
टेक्स्ट टू स्पीच
जानें कि ElevenLabs के साथ टेक्स्ट को जीवंत बोले गए ऑडियो में कैसे बदलें।
परिचय
ElevenLabs टेक्स्ट टू स्पीच (TTS) API टेक्स्ट को बारीक उतार-चढ़ाव, गति और भावनात्मक समझ के साथ जीवंत ऑडियो में बदलता है। हमारे मॉडल 32 भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढलते हैं और इनका इस्तेमाल इन कामों के लिए किया जा सकता है:
- वैश्विक मीडिया कैंपेन्स और विज्ञापनों को नैरेट करना
- जटिल भावपूर्ण डिलीवरी के साथ कई भाषाओं में ऑडियोबुक्स बनाना
- टेक्स्ट से रीयल-टाइम ऑडियो स्ट्रीम करना
एक सैंपल सुनें:
अपने प्रोजेक्ट के लिए सही वॉइस ढूंढने हेतु हमारी वॉइस लाइब्रेरी देखें।
वॉइस क्वालिटी
रीयल-टाइम ऐप्लिकेशन्स के लिए Flash v2.5 बेहद कम 75ms लेटेंसी देता है, जबकि Multilingual v2 अधिक बारीक अभिव्यक्ति के साथ सबसे उच्च गुणवत्ता वाला ऑडियो देता है।
वॉइस विकल्प
ElevenLabs कई तरीकों से 32 भाषाओं में हज़ारों वॉइस उपलब्ध कराता है:
- समुदाय द्वारा साझा की गई 3,000+ वॉइस वाली वॉइस लाइब्रेरी
- सबसे सटीक प्रतिकृतियों के लिए प्रोफेशनल वॉइस क्लोनिंग
- तेज़ी से वॉइस प्रतिकृति बनाने के लिए इंस्टेंट वॉइस क्लोनिंग
- टेक्स्ट विवरण से कस्टम वॉइस बनाने के लिए वॉइस डिज़ाइन
हमारे वॉइस विकल्पों के बारे में और जानें।
समर्थित आउटपुट फ़ॉर्मैट
डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।
- MP3
- सैंपल रेट्स: 22.05kHz - 44.1kHz
- बिटरेट्स: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- सैंपल रेट्स: 16kHz - 44.1kHz
- बिटरेट्स: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16-बिट डेप्थ
- μ-law
- 8kHz सैंपल रेट
- टेलीफोनी ऐप्लिकेशन्स के लिए ऑप्टिमाइज़्ड
- A-law
- 8kHz सैंपल रेट
- टेलीफोनी ऐप्लिकेशन्स के लिए ऑप्टिमाइज़्ड
- Opus
- सैंपल रेट: 48kHz
- बिटरेट्स: 32kbps - 192kbps
उच्च गुणवत्ता वाले ऑडियो विकल्प केवल पेड टियर्स पर उपलब्ध हैं - विवरण के लिए हमारा प्राइसिंग पेज देखें।
समर्थित भाषाएं
हमारे multilingual v2 मॉडल्स 29 भाषाओं को support करते हैं:
अंग्रेज़ी (USA, UK, ऑस्ट्रेलिया, कनाडा), जापानी, चीनी, जर्मन, हिंदी, फ़्रेंच (फ़्रांस, कनाडा), कोरियाई, पुर्तगाली (ब्राज़ील, पुर्तगाल), इतालवी, स्पेनिश (स्पेन, मेक्सिको), इंडोनेशियाई, डच, तुर्की, फ़िलिपीनो, पोलिश, स्वीडिश, बल्गेरियाई, रोमानियाई, अरबी (सऊदी अरब, UAE), चेक, यूनानी, फ़िनिश, क्रोएशियाई, मलय, स्लोवाक, डेनिश, तमिल, यूक्रेनी और रूसी।
Flash v2.5, v2 मॉडल्स की सभी भाषाओं के साथ-साथ 32 भाषाओं को support करता है:
हंगेरियन, नॉर्वेजियन और वियतनामी
बस हमारी किसी भी समर्थित भाषा में टेक्स्ट डालें और हमारी वॉइस लाइब्रेरी से मिलती-जुलती वॉइस चुनें। सबसे स्वाभाविक परिणामों के लिए, ऐसी वॉइस चुनें जिसका एक्सेंट आपकी लक्षित भाषा और क्षेत्र से मेल खाता हो।
प्रॉम्प्टिंग
मॉडल टेक्स्ट इनपुट से सीधे भावनात्मक संदर्भ समझते हैं। उदाहरण के लिए, “उसने उत्साहित होकर कहा” जैसा विवरण जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने की भावना प्रभावित होगी। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।
ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।
विवरणात्मक टेक्स्ट मॉडल बोलकर सुनाएगा और चाहें तो इसे ऑडियो से मैन्युअल रूप से ट्रिम या हटाना होगा।
FAQ
क्या मैं अपनी वॉइस क्लोन कर सकता हूं?
हाँ, आप छोटी ऑडियो क्लिप्स से अपनी वॉइस के इंस्टेंट वॉइस क्लोन्स बना सकते हैं। उच्च-गुणवत्ता वाले क्लोन्स के लिए, हमारी प्रोफेशनल वॉइस क्लोनिंग सुविधा देखें।
क्या ऑडियो आउटपुट का मालिक मैं हूं?
हाँ। आपके द्वारा जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और यदि आपके पास इनपुट कंटेंट के IP अधिकार हैं, तो आउटपुट से कमाई कर सकते हैं।
मुफ़्त रीजनरेशन के लिए क्या योग्य है?
मुफ़्त रीजनरेशन से आप इन शर्तों के अधीन, बिना अतिरिक्त लागत के वही टेक्स्ट टू स्पीच कंटेंट फिर से जनरेट कर सकते हैं:
- आप हर कंटेंट को 2 बार तक मुफ़्त में फिर से जनरेट कर सकते हैं
- कंटेंट पिछली जनरेशन के बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव करने पर नई, पेड जनरेशन की ज़रूरत होगी
अगर ऑडियो आउटपुट में हल्का डिस्टॉर्शन हो, तो मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन गुणवत्ता संबंधी लगभग आधी समस्याएं हल कर देंगे, जबकि बाकी समस्याएं आम तौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।
रीयल-टाइम मामलों में लेटेंसी कैसे कम करूं?
लगभग रीयल-टाइम कन्वर्सेशनल या इंटरैक्टिव स्थितियों के लिए ऑप्टिमाइज़्ड कम-लेटेंसी Flash मॉडल्स (Flash v2 या v2.5) का इस्तेमाल करें। अधिक जानकारी के लिए हमारी लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें।
मेरा आउटपुट कभी-कभी असंगत क्यों होता है?
मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर का इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।
बड़े टेक्स्ट कन्वर्ज़न के लिए सबसे अच्छा तरीका क्या है?
लंबे टेक्स्ट को सेगमेंट्स में बांटें और रीयल-टाइम प्लेबैक व कुशल प्रोसेसिंग के लिए स्ट्रीमिंग का इस्तेमाल करें। चंक्स के बीच स्वाभाविक प्रोसोडी फ्लो बनाए रखने के लिए previous/next text या previous/next request id पैरामीटर्स शामिल करें।
मुख्य तथ्य
- नियतात्मकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप परिणामों के लिए
seedपैरामीटर का इस्तेमाल करें - मुफ़्त रीजनरेशन: हर जनरेशन पर 2 तक मुफ़्त रीजनरेशन (केवल समान कंटेंट और पैरामीटर्स)
- स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान ज़रूरी है
- कम-लेटेंसी उपयोग के मामले: Flash मॉडल्स (
eleven_flash_v2याeleven_flash_v2_5) इस्तेमाल करें — लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें - बड़ा टेक्स्ट: लंबे टेक्स्ट को सेगमेंट्स में बांटें; चंक्स में स्वाभाविक प्रोसोडी बनाए रखने के लिए
previous_text/next_textपैरामीटर्स का इस्तेमाल करें