Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

कंटेंट पर जाएं

पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल

प्रकाशित

सुनेंइस आर्टिकल को सुनें

टेक्स्ट की एक पंक्ति बोलने के तरीके के आधार पर काफी बदल सकती है। “I need you to stay calm” किसने कहा है, इसके हिसाब से यह अलग सुनाई देना चाहिए—चाहे कोई डॉक्टर डरे हुए मरीज़ से यह बात नर्मी से कह रहा हो या किसी गेम का किरदार युद्ध में उतरने से पहले अपनी टीम पर चिल्ला रहा हो।

आज हम लॉन्च कर रहे हैं Eleven v4, हमारा अब तक का सबसे भावपूर्ण टेक्स्ट टू स्पीच मॉडल, और इसका लो-लेटेंसी वेरिएंट Eleven v4 Turbo।

elevenv4 video cover

Artificial Analysis द्वारा #1 रैंक प्राप्त1, और ब्लाइंड हेड-टू-हेड टेस्ट में प्रतिस्पर्धी मॉडलों के मुकाबले ~75% श्रोताओं की पसंद2, Eleven v4 को टोन, गति, भावना, किरदार और संदर्भ समझने के लिए डिज़ाइन किया गया है। यह स्पीकर की पहचान बनाए रखते हुए नाटकीय, कोमल, तात्कालिक, हास्यपूर्ण या बातचीत जैसा लगने वाला भाषण बना सकता है। कई स्पीकर्स के बीच अधिक स्वाभाविक तालमेल से बातचीत अलग-अलग जोड़ी गई पंक्तियों के बजाय तुरंत प्रतिक्रिया देने वाली लगती है। स्पीकर्स बातचीत के संदर्भ के अनुसार प्रतिक्रिया देते हैं, जिससे संवाद और किरदारों के बीच की बातचीत अधिक स्वाभाविक बनती है।

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

परफॉर्मेंस के लिए बना नया आर्किटेक्चर

पूरी तरह नए आर्किटेक्चर पर बना, Eleven v4 हमारा सबसे भावपूर्ण टेक्स्ट टू स्पीच मॉडल है, जिसे Artificial Analysis ने #1 रैंक दिया है1। Eleven v4 Turbo इसी तकनीक को एजेंट्स जैसे लो-लेटेंसी इस्तेमाल के लिए लाता है। ~100ms की औसत इन्फ़रेंस लेटेंसी के साथ, यह दो लोगों की बातचीत के बीच के औसत विराम से भी तेज़ जवाब दे सकता है।

दोनों मॉडल ऐसा भाषण बना सकते हैं जो मशीनी नहीं, भावपूर्ण लगे। ऑडियो की मूल गुणवत्ता भी हर मामले में बेहतर है, जिससे आउटपुट अधिक साफ़ और स्वाभाविक सुनाई देता है। 

टेक्स्ट टू स्पीच मॉडलों की पिछली पीढ़ियां टेक्स्ट को पढ़कर सुना सकती हैं, लेकिन Eleven v4 भाषण में ऐसी भावनात्मक गहराई लाता है जो कहीं ज़्यादा स्वाभाविक लगती है। मॉडल इच्छित टोन, भाषण की गति, लेखन के चरित्र और टेक्स्ट के संदर्भ को समझकर भावनात्मक रूप से असरदार भाषण दे सकता है।

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

यूज़र्स को आउटपुट पर बारीकी से नियंत्रण भी मिलता है और वे सामान्य भाषा में बता सकते हैं कि किसी पंक्ति को कैसे बोला जाना चाहिए। वे यह भी तय कर सकते हैं कि कुछ वाक्यांश कैसे कहने हैं, उनमें कौन-सी भावना दिखानी है, और साउंड इफेक्ट्स भी जोड़ सकते हैं—जैसे [laughs], [said angrily in French accent], [light rain], या [phone buzzing] जैसे इनलाइन टैग्स के ज़रिए। Eleven v4 इन ऑडियो टैग्स और निर्देशों का पिछले मॉडलों की तुलना में अधिक सटीकता से पालन करता है, इसलिए जैसा डिलीवरी आप बताते हैं, वैसा ही आपको मिलता है। इससे नैरेशन निर्देशित करना, किरदारों या उनके संवाद को विस्तार देना और ऐसे अन्य काम आसान हो जाते हैं जहां डिलीवरी मायने रखती है। 

ElevenLabs डेवलपर डॉक्यूमेंटेशन में टैग का पूरा सिंटैक्स और API के ज़रिए इन टैग्स को लागू करने का तरीका बताया गया है। International Phonetic Alphabet (IPA) फोनीम्स के लिए सपोर्ट में भी काफी सुधार हुआ है, इसलिए कस्टम उच्चारण अब ज़्यादा भरोसेमंद तरीके से काम करते हैं।

Eleven v4 कई स्पीकर्स के बीच एकरूपता और गतिशील बातचीत में भी सुधार लाता है। स्पीकर्स की पहचान कैप्चर करने के नए तरीके से Eleven v4 हर वॉइस की खासियतों को बनाए रखता है। यह एजेंट बातचीत, ऑडियोबुक्स या विज्ञापनों में भाषण को एकरूप रख सकता है। चूंकि मॉडल पूरे दृश्य का संदर्भ समझता है, इसलिए यह ऐसा स्वाभाविक संवाद बनाता है जिसमें स्पीकर्स अभी कही गई बात पर प्रतिक्रिया देते हैं, न कि अलग-अलग पंक्तियों को जोड़कर बोलते हैं।

लो-लेटेंसी इस्तेमाल के लिए Turbo मॉडल

उच्च-गुणवत्ता वाले वॉइस मॉडल आमतौर पर भाषण बनाने में धीमे रहे हैं, इसलिए यूज़र्स को तेज़ या भावपूर्ण वॉइस एजेंट्स में से चुनना पड़ता था। कई लोगों ने सक्षम लेकिन एकरस एजेंट्स चुने हैं, जो अपनी समस्या हल करने की कोशिश कर रहे परेशान ग्राहक को रोबोट जैसे लग सकते हैं। 

Eleven v4 Turbo ~150ms के पहले भाषण तक के औसत समय के साथ गति और भावना को जोड़ता है3, जिससे अनगिनत इंडस्ट्रीज़ में शक्तिशाली एजेंट्स तैनात करना संभव हो जाता है—हेल्थकेयर में मेडिकल शब्दों का सटीक उच्चारण करने वाले गर्मजोशी भरे, भरोसा दिलाने वाले एजेंट्स से लेकर गेमिंग में खिलाड़ियों का मनोरंजन करने वाले तेज़ बोलने वाले, स्लैंग इस्तेमाल करने वाले एजेंट्स तक।

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Eleven v4 Turbo मॉडल को ElevenLabs के कन्वर्सेशनल एजेंट्स प्लेटफ़ॉर्म, ElevenAgents, के साथ काम करने के लिए बनाया गया है। दूसरे एजेंट बिल्डर्स अलग-अलग वेंडर्स के मॉडल और सॉफ़्टवेयर को जोड़ते हैं, जिससे यूज़र्स के पास अपने खास इस्तेमाल के लिए मॉडल आउटपुट को बेहतर बनाने का कोई तरीका नहीं रहता। ElevenLabs की रिसर्च और इंजीनियरिंग टीम्स ने Eleven v4 Turbo और ElevenAgents को एक सिस्टम की तरह साथ में ऑप्टिमाइज़ किया है, जिससे अधिक भावपूर्ण, भरोसेमंद और लो-लेटेंसी एजेंट्स मिलते हैं।  

एक वॉइस, अनगिनत भाषाएं 

हमारे संवाद करने का तरीका संदर्भ, जगह और यहां तक कि दिन के समय के हिसाब से बदलता है। कई भाषाओं में इसे प्रतिबिंबित करने वाला भावपूर्ण भाषण बनाना, ऑडियो AI की सबसे कठिन चुनौतियों में से एक है। 

Eleven v4 इन सभी क्षेत्रों में एक बड़ा कदम आगे है, और सुधार सिर्फ मॉडल के वाक्यांशों का उच्चारण करने तक सीमित नहीं हैं। Eleven v4 अलग-अलग भाषाओं में लय, भावना और डिलीवरी को बेहतर ढंग से कैप्चर करता है, जिससे क्रिएटर्स ऐसा भाषण बना सकते हैं जो भाषा और संदर्भ के अनुरूप स्वाभाविक लगे। उदाहरण के लिए, जापान में किसी बुज़ुर्ग अजनबी से आप जिस तरह बात करेंगे, वह इटली में उनसे बात करने के तरीके से काफी अलग होगा। 

Eleven v4 और Eleven v4 Turbo, दोनों 90 से अधिक भाषाओं को सपोर्ट करते हैं। अब, एक भाषा में रिकॉर्ड की गई वॉइस किसी भी दूसरी भाषा को भी धाराप्रवाह बोल सकती है, मूल पहचान बरकरार रखते हुए मूल वक्ता का एक्सेंट अपना लेती है। एक्सेंट को बनाए रखने की क्षमता पहले से कहीं बेहतर है, इसलिए वॉइस जनरेशन के दौरान फिर से अपने मूल एक्सेंट की ओर नहीं लौटती।

कैटलन

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

स्पैनिश

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

डबिंग और लोकलाइज़ेशन के लिए इसका मतलब है कि आपने अपने ब्रांड के लिए जो वॉइस चुनी है—चाहे वह आपके साथ काम कर रहे किसी सेलिब्रिटी ऐक्टर की हो या आपकी कंपनी की शैली के लिए सबसे उपयुक्त टोन—वह Eleven v4 द्वारा समर्थित हर भाषा में शानदार लगेगी।

ज़्यादा प्रामाणिक, एकरूप वॉइस क्लोनिंग

Eleven v4 और Eleven v4 Turbo में वॉइस क्लोनिंग ज़्यादा प्रामाणिक, शक्तिशाली और एकरूप है, और मूल स्रोत वॉइस के साथ स्पीकर की समानता भी काफी बेहतर है। Instant Voice Clones अब केवल 10 सेकंड के ऑडियो से हाई-फिडेलिटी में वॉइस कैप्चर कर सकते हैं। 

असली वॉइस

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 जनरेशन, संवाद, नैरेशन और दोबारा जनरेट की गई पंक्तियों के दौरान भी स्पीकर की पहचान को ज़्यादा भरोसेमंद तरीके से बनाए रखता है। इसका मतलब है कि लंबे प्रोजेक्ट्स में किरदार, नैरेटर और क्लोन की गई वॉइसेज़ पूरी प्रोडक्शन के दौरान एकरूप रहती हैं। Eleven v4 सबसे उच्च-फिडेलिटी क्लोनिंग इस्तेमाल के लिए Professional Voice Clones (PVC) का सपोर्ट भी जोड़ता है।

रिक्वेस्ट स्टिचिंग—लंबे कंटेंट के लिए जनरेशंस को एक साथ जोड़ना—भी Eleven v4 में काफी ज़्यादा भरोसेमंद है, जिससे ElevenLabs Studio और ElevenLabs रीडर ऐप में काम करने का अनुभव बेहतर होता है।

खुद अंतर सुनें  

Eleven v4 और Eleven v4 Turbo भावपूर्ण स्पीच जनरेशन में हमारी नवीनतम रिसर्च का परिणाम हैं। इन्हें उस कंटेंट के लिए बनाया गया है जहां डिलीवरी शब्दों जितनी ही अहम हो—चाहे वह ऑडियोबुक्स, किरदारों की परफॉर्मेंस, वॉइसओवर, डबिंग या कन्वर्सेशनल एजेंट्स का लोकलाइज़ेशन हो।

दोनों मॉडल अब ElevenAgents, ElevenCreative और ElevenAPI के ज़रिए उपलब्ध हैं। मुफ़्त अकाउंट बनाएं और आज ही Eleven v4 या Eleven v4 Turbo से जनरेट करना शुरू करें।

  1. Artificial Analysis, Provider Voice Arena Leaderboard, सितंबर 2026
  2. सितंबर 2026 में Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS और Google Gemini 3.8 Flash TTS के विरुद्ध ब्लाइंड हेड-टू-हेड यूज़र प्रेफरेंस टेस्टिंग पर आधारित। हर जोड़ी में मूल्यांकनकर्ताओं ने Eleven v4 और एक प्रतिस्पर्धी की एक ही पंक्ति सुनी, जिन्हें बिना पहचान बताए प्रस्तुत किया गया था, और तय किया कि कौन ज़्यादा भावपूर्ण और कौन ज़्यादा स्वाभाविक लगा; टाई को आधा माना गया।
  3. रिक्वेस्ट से सुनाई देने वाले भाषण तक का औसत समय। सितंबर 2026 में समान स्क्रिप्ट्स और डिफ़ॉल्ट सेटिंग्स के साथ Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS और OpenAI GPT-4o mini TTS के विरुद्ध मापा गया; सभी सिस्टम्स के लिए नेटवर्क लेटेंसी मापकर हटा दी गई। WebSocket स्ट्रीमिंग पर Eleven v4 Turbo।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं