Eleven v3 (alpha) पेश कर रहे हैं
- प्रकाशित
सुनेंइस आर्टिकल को सुनें
हमें Eleven v3 (alpha) पेश करते हुए खुशी हो रही है — सबसे अभिव्यंजक टेक्स्ट टू स्पीच मॉडल।
यह रिसर्च प्रीव्यू स्पीच जनरेशन में बेजोड़ नियंत्रण और यथार्थवाद देता है, जिसमें शामिल हैं:
- 70+ भाषाएं
- मल्टी-स्पीकर डायलॉग
- ऑडियो टैग जैसे [excited], [whispers], और [sighs]
Eleven v3 (alpha) में प्रॉम्प्ट इंजीनियरिंग की ज़रूरत पिछले मॉडल्स से ज़्यादा है — लेकिन इसके नतीजे शानदार हैं।
अगर आप वीडियो, ऑडियोबुक या मीडिया टूल्स पर काम कर रहे हैं, तो यह अभिव्यक्ति का एक नया स्तर खोलता है। फ़िलहाल रियल-टाइम और कन्वर्सेशनल इस्तेमाल के लिए हम v2.5 Turbo या Flash के साथ बने रहने की सलाह देते हैं। v3 का रियल-टाइम वर्ज़न विकसित किया जा रहा है।
Eleven v3 आज हमारी वेबसाइट और API में उपलब्ध है।
हमने v3 क्यों बनाया
Multilingual v2 लॉन्च करने के बाद से हमने देखा है कि वॉइस AI को प्रोफेशनल फ़िल्म, गेम डेवलपमेंट, शिक्षा और एक्सेसिबिलिटी में अपनाया गया है। लेकिन लगातार बनी रहने वाली सीमा साउंड क्वालिटी नहीं, बल्कि अभिव्यक्ति थी। ज़्यादा गहरे भाव, बातचीत में रुकावटें और विश्वसनीय संवाद हासिल करना मुश्किल था।
Eleven v3 इस कमी को दूर करता है। इसे शुरुआत से ही ऐसी आवाज़ें देने के लिए बनाया गया है जो आह भरें, फुसफुसाएं, हंसें और प्रतिक्रिया दें — ऐसी स्पीच बनाएं जो सचमुच जीवंत और प्रतिक्रियाशील लगे।
Eleven v3 (alpha) में नया क्या है
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
ऑडियो टैग का इस्तेमाल
ऑडियो टैग आपकी स्क्रिप्ट में इनलाइन होते हैं और लोअरकेस स्क्वेयर ब्रैकेट्स में लिखे जाते हैं। ऑडियो टैग के बारे में ज़्यादा जानकारी हमारे डॉक्स में v3 के लिए प्रॉम्प्टिंग गाइड में देखें।
Professional Voice Clones (PVCs) फ़िलहाल Eleven v3 के लिए पूरी तरह ऑप्टिमाइज़ नहीं हैं, इसलिए पहले के मॉडल्स की तुलना में क्लोन की क्वालिटी कम हो सकती है। इस रिसर्च प्रीव्यू चरण में, अगर आपको v3 फीचर्स इस्तेमाल करने हैं, तो अपने प्रोजेक्ट के लिए Instant वॉइस क्लोन (IVC) या डिज़ाइन की गई वॉइस चुनना बेहतर रहेगा। v3 के लिए PVC ऑप्टिमाइज़ेशन जल्द आ रहा है।
उदाहरण के लिए, आप यह प्रॉम्प्ट दे सकते हैं: “[whispers] कुछ आ रहा है… [sighs] मुझे इसका एहसास हो रहा है।” या ज़्यादा अभिव्यंजक नियंत्रण के लिए, कई टैग मिलाकर इस्तेमाल कर सकते हैं:
मल्टी-स्पीकर डायलॉग तैयार करना
Eleven v3 हमारे मौजूदा टेक्स्ट टू स्पीच एंडपॉइंट में समर्थित है। इसके अलावा, हम एक नया टेक्स्ट टू डायलॉग API एंडपॉइंट पेश कर रहे हैं। JSON ऑब्जेक्ट्स की एक स्ट्रक्चर्ड ऐरे दें — जिसमें हर ऑब्जेक्ट एक स्पीकर टर्न दर्शाता है — और मॉडल एक सुसंगत, ओवरलैपिंग ऑडियो फ़ाइल जनरेट करता है:
यह एंडपॉइंट स्पीकर ट्रांज़िशन, भावनात्मक बदलाव और रुकावटों को अपने-आप मैनेज करता है।
और जानें यहां।
कीमत और उपलब्धता
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
v3 को चालू करने के लिए:
- मॉडल पिकर इस्तेमाल करें और Eleven v3 (alpha)
चुनें। API एक्सेस और Studio में सपोर्ट जल्द आ रहे हैं। जल्दी एक्सेस के लिए, सेल्स से संपर्क करें।
v3 का इस्तेमाल कब न करें
Eleven v3 (alpha) में हमारे पिछले मॉडल्स की तुलना में ज़्यादा प्रॉम्प्ट इंजीनियरिंग की ज़रूरत होती है। जब यह अच्छा काम करता है, तो आउटपुट शानदार होता है, लेकिन इसकी विश्वसनीयता और ज़्यादा लेटेंसी के कारण यह रियल-टाइम और कन्वर्सेशनल इस्तेमाल के लिए उपयुक्त नहीं है। इनके लिए हम Eleven v2.5 Turbo/Flash की सलाह देते हैं।
ज़्यादा जानकारी के लिए पूरा v3 डॉक्यूमेंटेशन और FAQ देखें।
- में लॉग इन करें ElevenLabs UI
- मॉडल ड्रॉपडाउन में v3 (alpha) चुनें
- अपनी स्क्रिप्ट पेस्ट करें — टैग या डायलॉग इस्तेमाल करें
- ऑडियो जनरेट करें
हम यह देखने के लिए उत्साहित हैं कि आप नए इस्तेमालों में v3 को कैसे जीवंत बनाते हैं — इमर्सिव स्टोरीटेलिंग से लेकर सिनेमैटिक प्रोडक्शन पाइपलाइनों तक।






.jpg&w=3840&q=80)
.png&w=3840&q=80)


