पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
टेक्स्ट की एक पंक्ति बोलने के तरीके के आधार पर काफी बदल सकती है। “I need you to stay calm” किसने कहा है, इसके हिसाब से यह अलग सुनाई देना चाहिए—चाहे कोई डॉक्टर डरे हुए मरीज़ से यह बात नर्मी से कह रहा हो या किसी गेम का किरदार युद्ध में उतरने से पहले अपनी टीम पर चिल्ला रहा हो।
आज हम लॉन्च कर रहे हैं Eleven v4, हमारा अब तक का सबसे भावपूर्ण टेक्स्ट टू स्पीच मॉडल, और इसका लो-लेटेंसी वेरिएंट Eleven v4 Turbo।

Artificial Analysis द्वारा #1 रैंक प्राप्त1, और ब्लाइंड हेड-टू-हेड टेस्ट में प्रतिस्पर्धी मॉडलों के मुकाबले ~75% श्रोताओं की पसंद2, Eleven v4 को टोन, गति, भावना, किरदार और संदर्भ समझने के लिए डिज़ाइन किया गया है। यह स्पीकर की पहचान बनाए रखते हुए नाटकीय, कोमल, तात्कालिक, हास्यपूर्ण या बातचीत जैसा लगने वाला भाषण बना सकता है। कई स्पीकर्स के बीच अधिक स्वाभाविक तालमेल से बातचीत अलग-अलग जोड़ी गई पंक्तियों के बजाय तुरंत प्रतिक्रिया देने वाली लगती है। स्पीकर्स बातचीत के संदर्भ के अनुसार प्रतिक्रिया देते हैं, जिससे संवाद और किरदारों के बीच की बातचीत अधिक स्वाभाविक बनती है।

परफॉर्मेंस के लिए बना नया आर्किटेक्चर
पूरी तरह नए आर्किटेक्चर पर बना, Eleven v4 हमारा सबसे भावपूर्ण टेक्स्ट टू स्पीच मॉडल है, जिसे Artificial Analysis ने #1 रैंक दिया है1। Eleven v4 Turbo इसी तकनीक को एजेंट्स जैसे लो-लेटेंसी इस्तेमाल के लिए लाता है। ~100ms की औसत इन्फ़रेंस लेटेंसी के साथ, यह दो लोगों की बातचीत के बीच के औसत विराम से भी तेज़ जवाब दे सकता है।
दोनों मॉडल ऐसा भाषण बना सकते हैं जो मशीनी नहीं, भावपूर्ण लगे। ऑडियो की मूल गुणवत्ता भी हर मामले में बेहतर है, जिससे आउटपुट अधिक साफ़ और स्वाभाविक सुनाई देता है।
टेक्स्ट टू स्पीच मॉडलों की पिछली पीढ़ियां टेक्स्ट को पढ़कर सुना सकती हैं, लेकिन Eleven v4 भाषण में ऐसी भावनात्मक गहराई लाता है जो कहीं ज़्यादा स्वाभाविक लगती है। मॉडल इच्छित टोन, भाषण की गति, लेखन के चरित्र और टेक्स्ट के संदर्भ को समझकर भावनात्मक रूप से असरदार भाषण दे सकता है।
यूज़र्स को आउटपुट पर बारीकी से नियंत्रण भी मिलता है और वे सामान्य भाषा में बता सकते हैं कि किसी पंक्ति को कैसे बोला जाना चाहिए। वे यह भी तय कर सकते हैं कि कुछ वाक्यांश कैसे कहने हैं, उनमें कौन-सी भावना दिखानी है, और साउंड इफेक्ट्स भी जोड़ सकते हैं—जैसे [laughs], [said angrily in French accent], [light rain], या [phone buzzing] जैसे इनलाइन टैग्स के ज़रिए। Eleven v4 इन ऑडियो टैग्स और निर्देशों का पिछले मॉडलों की तुलना में अधिक सटीकता से पालन करता है, इसलिए जैसा डिलीवरी आप बताते हैं, वैसा ही आपको मिलता है। इससे नैरेशन निर्देशित करना, किरदारों या उनके संवाद को विस्तार देना और ऐसे अन्य काम आसान हो जाते हैं जहां डिलीवरी मायने रखती है।
ElevenLabs डेवलपर डॉक्यूमेंटेशन में टैग का पूरा सिंटैक्स और API के ज़रिए इन टैग्स को लागू करने का तरीका बताया गया है। International Phonetic Alphabet (IPA) फोनीम्स के लिए सपोर्ट में भी काफी सुधार हुआ है, इसलिए कस्टम उच्चारण अब ज़्यादा भरोसेमंद तरीके से काम करते हैं।
Eleven v4 कई स्पीकर्स के बीच एकरूपता और गतिशील बातचीत में भी सुधार लाता है। स्पीकर्स की पहचान कैप्चर करने के नए तरीके से Eleven v4 हर वॉइस की खासियतों को बनाए रखता है। यह एजेंट बातचीत, ऑडियोबुक्स या विज्ञापनों में भाषण को एकरूप रख सकता है। चूंकि मॉडल पूरे दृश्य का संदर्भ समझता है, इसलिए यह ऐसा स्वाभाविक संवाद बनाता है जिसमें स्पीकर्स अभी कही गई बात पर प्रतिक्रिया देते हैं, न कि अलग-अलग पंक्तियों को जोड़कर बोलते हैं।
लो-लेटेंसी इस्तेमाल के लिए Turbo मॉडल
उच्च-गुणवत्ता वाले वॉइस मॉडल आमतौर पर भाषण बनाने में धीमे रहे हैं, इसलिए यूज़र्स को तेज़ या भावपूर्ण वॉइस एजेंट्स में से चुनना पड़ता था। कई लोगों ने सक्षम लेकिन एकरस एजेंट्स चुने हैं, जो अपनी समस्या हल करने की कोशिश कर रहे परेशान ग्राहक को रोबोट जैसे लग सकते हैं।
Eleven v4 Turbo ~150ms के पहले भाषण तक के औसत समय के साथ गति और भावना को जोड़ता है3, जिससे अनगिनत इंडस्ट्रीज़ में शक्तिशाली एजेंट्स तैनात करना संभव हो जाता है—हेल्थकेयर में मेडिकल शब्दों का सटीक उच्चारण करने वाले गर्मजोशी भरे, भरोसा दिलाने वाले एजेंट्स से लेकर गेमिंग में खिलाड़ियों का मनोरंजन करने वाले तेज़ बोलने वाले, स्लैंग इस्तेमाल करने वाले एजेंट्स तक।

Eleven v4 Turbo मॉडल को ElevenLabs के कन्वर्सेशनल एजेंट्स प्लेटफ़ॉर्म, ElevenAgents, के साथ काम करने के लिए बनाया गया है। दूसरे एजेंट बिल्डर्स अलग-अलग वेंडर्स के मॉडल और सॉफ़्टवेयर को जोड़ते हैं, जिससे यूज़र्स के पास अपने खास इस्तेमाल के लिए मॉडल आउटपुट को बेहतर बनाने का कोई तरीका नहीं रहता। ElevenLabs की रिसर्च और इंजीनियरिंग टीम्स ने Eleven v4 Turbo और ElevenAgents को एक सिस्टम की तरह साथ में ऑप्टिमाइज़ किया है, जिससे अधिक भावपूर्ण, भरोसेमंद और लो-लेटेंसी एजेंट्स मिलते हैं।
एक वॉइस, अनगिनत भाषाएं
हमारे संवाद करने का तरीका संदर्भ, जगह और यहां तक कि दिन के समय के हिसाब से बदलता है। कई भाषाओं में इसे प्रतिबिंबित करने वाला भावपूर्ण भाषण बनाना, ऑडियो AI की सबसे कठिन चुनौतियों में से एक है।
Eleven v4 इन सभी क्षेत्रों में एक बड़ा कदम आगे है, और सुधार सिर्फ मॉडल के वाक्यांशों का उच्चारण करने तक सीमित नहीं हैं। Eleven v4 अलग-अलग भाषाओं में लय, भावना और डिलीवरी को बेहतर ढंग से कैप्चर करता है, जिससे क्रिएटर्स ऐसा भाषण बना सकते हैं जो भाषा और संदर्भ के अनुरूप स्वाभाविक लगे। उदाहरण के लिए, जापान में किसी बुज़ुर्ग अजनबी से आप जिस तरह बात करेंगे, वह इटली में उनसे बात करने के तरीके से काफी अलग होगा।
Eleven v4 और Eleven v4 Turbo, दोनों 90 से अधिक भाषाओं को सपोर्ट करते हैं। अब, एक भाषा में रिकॉर्ड की गई वॉइस किसी भी दूसरी भाषा को भी धाराप्रवाह बोल सकती है, मूल पहचान बरकरार रखते हुए मूल वक्ता का एक्सेंट अपना लेती है। एक्सेंट को बनाए रखने की क्षमता पहले से कहीं बेहतर है, इसलिए वॉइस जनरेशन के दौरान फिर से अपने मूल एक्सेंट की ओर नहीं लौटती।
कैटलन
स्पैनिश
डबिंग और लोकलाइज़ेशन के लिए इसका मतलब है कि आपने अपने ब्रांड के लिए जो वॉइस चुनी है—चाहे वह आपके साथ काम कर रहे किसी सेलिब्रिटी ऐक्टर की हो या आपकी कंपनी की शैली के लिए सबसे उपयुक्त टोन—वह Eleven v4 द्वारा समर्थित हर भाषा में शानदार लगेगी।
ज़्यादा प्रामाणिक, एकरूप वॉइस क्लोनिंग
Eleven v4 और Eleven v4 Turbo में वॉइस क्लोनिंग ज़्यादा प्रामाणिक, शक्तिशाली और एकरूप है, और मूल स्रोत वॉइस के साथ स्पीकर की समानता भी काफी बेहतर है। Instant Voice Clones अब केवल 10 सेकंड के ऑडियो से हाई-फिडेलिटी में वॉइस कैप्चर कर सकते हैं।
असली वॉइस
Eleven v4
Eleven v4 जनरेशन, संवाद, नैरेशन और दोबारा जनरेट की गई पंक्तियों के दौरान भी स्पीकर की पहचान को ज़्यादा भरोसेमंद तरीके से बनाए रखता है। इसका मतलब है कि लंबे प्रोजेक्ट्स में किरदार, नैरेटर और क्लोन की गई वॉइसेज़ पूरी प्रोडक्शन के दौरान एकरूप रहती हैं। Eleven v4 सबसे उच्च-फिडेलिटी क्लोनिंग इस्तेमाल के लिए Professional Voice Clones (PVC) का सपोर्ट भी जोड़ता है।
रिक्वेस्ट स्टिचिंग—लंबे कंटेंट के लिए जनरेशंस को एक साथ जोड़ना—भी Eleven v4 में काफी ज़्यादा भरोसेमंद है, जिससे ElevenLabs Studio और ElevenLabs रीडर ऐप में काम करने का अनुभव बेहतर होता है।
खुद अंतर सुनें
Eleven v4 और Eleven v4 Turbo भावपूर्ण स्पीच जनरेशन में हमारी नवीनतम रिसर्च का परिणाम हैं। इन्हें उस कंटेंट के लिए बनाया गया है जहां डिलीवरी शब्दों जितनी ही अहम हो—चाहे वह ऑडियोबुक्स, किरदारों की परफॉर्मेंस, वॉइसओवर, डबिंग या कन्वर्सेशनल एजेंट्स का लोकलाइज़ेशन हो।
दोनों मॉडल अब ElevenAgents, ElevenCreative और ElevenAPI के ज़रिए उपलब्ध हैं। मुफ़्त अकाउंट बनाएं और आज ही Eleven v4 या Eleven v4 Turbo से जनरेट करना शुरू करें।
- Artificial Analysis, Provider Voice Arena Leaderboard, सितंबर 2026
- सितंबर 2026 में Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS और Google Gemini 3.8 Flash TTS के विरुद्ध ब्लाइंड हेड-टू-हेड यूज़र प्रेफरेंस टेस्टिंग पर आधारित। हर जोड़ी में मूल्यांकनकर्ताओं ने Eleven v4 और एक प्रतिस्पर्धी की एक ही पंक्ति सुनी, जिन्हें बिना पहचान बताए प्रस्तुत किया गया था, और तय किया कि कौन ज़्यादा भावपूर्ण और कौन ज़्यादा स्वाभाविक लगा; टाई को आधा माना गया।
- रिक्वेस्ट से सुनाई देने वाले भाषण तक का औसत समय। सितंबर 2026 में समान स्क्रिप्ट्स और डिफ़ॉल्ट सेटिंग्स के साथ Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS और OpenAI GPT-4o mini TTS के विरुद्ध मापा गया; सभी सिस्टम्स के लिए नेटवर्क लेटेंसी मापकर हटा दी गई। WebSocket स्ट्रीमिंग पर Eleven v4 Turbo।




