कंटेंट पर जाएं

ElevenLabs बीटा से बाहर आ गया है और Eleven Multilingual v2 जारी किया है - लगभग 30 भाषाओं के लिए एक आधारभूत AI स्पीच मॉडल

प्रकाशित

सुनेंइस आर्टिकल को सुनें

  • वॉइस AI प्लेटफ़ॉर्म ElevenLabs ने 28 भाषाओं में - इस Eleven Multilingual v2
  • यह प्रगति दुनिया भर की मीडिया कंपनियों, गेम डेवलपर्स, प्रकाशकों और स्वतंत्र क्रिएटर्स को अपने कंटेंट की सुलभता में बड़ा सुधार करने में सक्षम बनाएगी
  • जनवरी में प्लेटफ़ॉर्म लॉन्च होने के बाद से कई नए फीचर्स और सुधारों के बाद आई ये नई क्षमताएं कंपनी के बीटा चरण के आधिकारिक अंत का भी संकेत हैं
  • ElevenLabs का मिशन हर भाषा और हर वॉइस में सभी कंटेंट को सभी के लिए सुलभ बनाना है

ElevenLabs, वॉइस AI सॉफ़्टवेयर में दुनिया की अग्रणी कंपनी, ने आज एक नया बहुभाषी वॉइस जनरेशन मॉडल लॉन्च किया है जो लगभग 30 भाषाओं में सटीक, ‘भावनाओं से भरपूर’ AI ऑडियो बना सकता है।

पूरी तरह हमारे अपने शोध पर आधारित यह प्रगति क्रिएटर्स को यूरोप, एशिया और मध्य पूर्व के अंतरराष्ट्रीय बाज़ारों के लिए स्थानीय ऑडियो कंटेंट बनाने देगी। ElevenLabs ने पिछले 18 महीने मानवीय बोलचाल के संकेतों का विश्लेषण करने, संदर्भ समझने और स्पीच जनरेशन में भावनाएं व्यक्त करने के नए तरीके विकसित करने के साथ-साथ नई, अनोखी वॉइसेज़ बनाने में लगाए हैं।

Eleven Multilingual v2 के साथ, जब ElevenLabs के टेक्स्ट टू स्पीच प्लेटफ़ॉर्म में टेक्स्ट डाला जाता है, तो नया मॉडल लगभग 30 लिखित भाषाओं को अपने आप पहचान सकता है और उनमें अभूतपूर्व प्रामाणिकता के साथ स्पीच बना सकता है।

साथ ही, सिंथेटिक वॉइस इस्तेमाल हो या क्लोन की गई वॉइस, स्पीकर की अनोखी वॉइस विशेषताएं—उनके मूल उच्चारण समेत—सभी भाषाओं में बरकरार रहती हैं। यानी एक ही वॉइस से 28 अलग-अलग भाषाओं में कंटेंट को जीवंत बनाया जा सकता है।

यह रोल-आउट प्लेटफ़ॉर्म के सभी क्रिएटर्स के लिए Professional वॉइस क्लोनिंग के सार्वजनिक रिलीज़ के बाद आया है। अतिरिक्त सुरक्षा और सेफ़्टी फीचर्स के साथ उपलब्ध कराया गया यह प्रोडक्ट अपडेट यूज़र्स को अपनी वॉइस की एकदम सटीक डिजिटल कॉपी बनाने देता है, जो मूल वॉइस से लगभग अलग नहीं लगती। आज के रिलीज़ का मतलब है कि आपकी वॉइस बहुभाषी मॉडल में उपलब्ध लगभग 30 भाषाओं में बोल सकेगी।

अब समर्थित भाषाओं में शामिल हैं; चीनी, कोरियाई, डच, तुर्की, स्वीडिश, इंडोनेशियाई, फ़िलिपीनो, जापानी, यूक्रेनी, यूनानी, चेक, फ़िनिश, रोमानियाई, डेनिश, बुल्गारियाई, मलय, स्लोवाक, क्रोएशियाई, शास्त्रीय अरबी और तमिल

ये पहले से उपलब्ध भाषाओं में शामिल हो गई हैं, जिनमें अंग्रेज़ी, पोलिश, जर्मन, स्पेनिश, फ़्रेंच, इतालवी, हिंदी और पुर्तगाली शामिल हैं।

हाल के फीचर लॉन्च और प्लेटफ़ॉर्म में लगातार सुधारों के बाद, ElevenLabs ने आज यह भी पुष्टि की कि प्लेटफ़ॉर्म आधिकारिक रूप से बीटा से बाहर आ रहा है। यह बदलाव अपने 10 लाख से अधिक वैश्विक यूज़र्स को भरोसेमंद और अत्याधुनिक टूल्स देने के कंपनी के संकल्प में एक अहम पड़ाव है।

आगे चलकर, ElevenLabs एक ऐसा तरीका लाने की योजना बना रहा है जिससे यूज़र्स प्लेटफ़ॉर्म पर वॉइसेज़ साझा कर सकें और नए ऑडियो के विकास का लाभ उठा सकें। इससे इंसान और AI के सहयोग के अवसर बढ़ेंगे।

ElevenLabs के सीईओ और सह-संस्थापक Mati Staniszewski कहते हैं:

ElevenLabs की शुरुआत इस सपने के साथ हुई थी कि हर भाषा और हर वॉइस में सभी कंटेंट को सभी के लिए सुलभ बनाया जाए। Eleven Multilingual v2 के रिलीज़ के साथ, हम इस सपने को सच करने और हर बोली में इंसानी गुणवत्ता वाली AI वॉइसेज़ उपलब्ध कराने के एक कदम और करीब आ गए हैं।

“हमारे टेक्स्ट टू स्पीच जनरेशन टूल्स बराबरी का मौका देने में मदद करते हैं और सभी क्रिएटर्स तक बेहतरीन स्पोकन ऑडियो क्षमताएं पहुंचाते हैं। अब ये फायदे लगभग 30 भाषाओं में बहुभाषी ऐप्लिकेशन्स तक भी पहुंचते हैं। आखिरकार, हम AI की मदद से और भी भाषाओं और वॉइसेज़ को कवर करने और कंटेंट की भाषाई बाधाएं खत्म करने की उम्मीद करते हैं। ElevenLabs में हमारा मानना है कि सुलभता में ये प्रगति आखिरकार अधिक रचनात्मकता, नवाचार और विविधता को बढ़ावा देगी।

कई भाषाओं में उच्च-गुणवत्ता वाला ऑडियो कंटेंट बनाने की लागत और संसाधनों को कम करके, ElevenLabs कंपनियों और क्रिएटर्स को ऐसा अधिक कल्पनाशील और सुलभ कंटेंट बनाने में सक्षम बना रहा है जो संस्कृतियों और भाषाओं के पार लोगों से जुड़ता है।

स्वतंत्र गेम डेवलपर्स और प्रकाशकों के लिए बहुभाषी स्पीच जनरेशन टूल अंतरराष्ट्रीय दर्शकों के लिए गेम अनुभवों और ऑडियो कंटेंट का अनुवाद करने के नए अवसर देता है। इससे वे स्पोकन ऑडियो की गुणवत्ता या सटीकता से समझौता किए बिना खिलाड़ियों और श्रोताओं से उनकी अपनी भाषाओं में जुड़ सकते हैं।

इसी तरह, शैक्षणिक संस्थानों के पास अब शिक्षार्थियों को तुरंत लक्षित भाषाओं में सटीक ऑडियो कंटेंट देने का साधन है। इससे भाषा समझने और उच्चारण कौशल बेहतर होते हैं, साथ ही अंतरराष्ट्रीय छात्रों के लिए अलग-अलग शिक्षण शैलियों और सीखने की ज़रूरतों को भी पूरा किया जा सकता है।

हर तरह के क्रिएटर्स ElevenLabs के टूल से अपने कंटेंट की सुलभता बढ़ा सकते हैं। इसके लिए वे दृश्य कंटेंट के साथ कई भाषाओं में उपलब्ध स्पीच जोड़ सकते हैं, जिससे दृष्टिबाधित लोगों या अतिरिक्त सीखने की ज़रूरतों वाले लोगों को मदद मिलेगी।

जनवरी 2023 में पेश किए गए AI वॉइस टूल्स के हमारे शुरुआती सेट में पहले से डिज़ाइन की गई सिंथेटिक वॉइसेज़ में से चुनकर किसी भी टेक्स्ट को स्पीच में बदलने और अपनी वॉइस का क्लोन बनाने की सुविधा शामिल थी। बहुभाषी स्पीच सिंथेसिस टूल, हर भाषा और हर वॉइस में सभी कंटेंट को सभी के लिए सुलभ बनाने के ElevenLabs के मिशन में एक और कदम है।

इस तकनीक को कई रचनात्मक क्षेत्रों और सेक्टर्स में पहले ही अपनाया जा चुका है। इनमें इंडी लेखकों को ऑडियोबुक बनाने देना, वीडियो गेम्स में सहायक किरदारों को वॉइस देना, दृष्टिबाधित लोगों को ऑनलाइन लिखित कंटेंट तक पहुंचने में मदद करना और दुनिया के पहले AI रेडियो चैनल को चलाना शामिल है। ElevenLabs ने कई प्रमुख कंटेंट क्रिएटर्स और स्टूडियोज़ के साथ भी साझेदारी की है, जिनमें AI वीडियो जनरेटर D-ID, दुनिया के सबसे बड़े ऑडियोबुक प्रकाशकों में से एक Storytel, ओपन-ऐक्सेस विज्ञान वीडियो प्लेटफ़ॉर्म ScienceCast शामिल हैं, जिसका वीडियो जनरेशन टूल arXiv पर प्रकाशित वैज्ञानिक शोध पत्रों को संक्षिप्त करता है, अग्रणी वैश्विक कंटेंट क्रिएटर प्लेटफ़ॉर्म TheSoul Publishing, शानदार गेम डेवलपर्स जैसे Embark Studios और Paradox Interactive, और मीडिया प्लेटफ़ॉर्म MNTN।

संपर्क करें
press@elevenlabs.io

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं