मॉडल्स
मॉडल्स
फ्लैगशिप मॉडल्स
टेक्स्ट टू स्पीच
स्पीच टू टेक्स्ट
म्यूज़िक
मॉडल्स की जानकारी
ElevenLabs API अलग-अलग इस्तेमाल, क्वालिटी स्तरों और परफ़ॉर्मेंस की ज़रूरतों के लिए ऑप्टिमाइज़ किए गए कई ऑडियो मॉडल्स देता है।
बंद किए गए मॉडल्स
eleven_turbo_v2_5 और eleven_turbo_v2 मॉडल क्रमशः eleven_flash_v2_5 और eleven_flash_v2
मॉडल्स के कार्यात्मक रूप से समान हैं, बस Flash मॉडल्स की लेटेंसी औसतन कम है। हम सभी इस्तेमाल के
मामलों में Turbo मॉडल्स के बजाय Flash मॉडल्स इस्तेमाल करने की सलाह देते हैं।
Eleven v3
Eleven v3 हमारा सबसे नया और उन्नत स्पीच सिंथेसिस मॉडल है। यह अत्याधुनिक मॉडल कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, इंसानों जैसी आवाज़ बनाता है।
यह मॉडल इन स्थितियों में अच्छा काम करता है:
- किरदारों की बातचीत: एक-दूसरे से बातचीत करने वाले कई किरदारों के ऑडियो अनुभवों के लिए बेहतरीन।
- ऑडियोबुक प्रोडक्शन: जटिल भावनात्मक प्रस्तुति वाले लंबे नैरेशन के लिए एकदम सही।
- भावनात्मक संवाद: व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत संवाद जनरेट करें।
Eleven v3 के साथ नया टेक्स्ट टू डायलॉग API आता है, जिससे आप कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत संवाद जनरेट कर सकते हैं। Eleven v3 का इस्तेमाल टेक्स्ट टू स्पीच API के साथ भी किया जा सकता है, ताकि कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत आवाज़ जनरेट की जा सके।
टेक्स्ट टू डायलॉग API के बारे में यहां और पढ़ें।
समर्थित भाषाएं
Eleven v3 मॉडल 70+ भाषाओं को support करता है, जिनमें शामिल हैं:
अफ़्रीकान्स (afr), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), कन्नड़ (kan), कज़ाख़ (kaz), किर्गिज़ (kir), कोरियाई (kor), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), मंदारिन चीनी (cmn), मराठी (mar), नेपाली (nep), नॉर्वेजियन (nor), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), सिंधी (snd), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उर्दू (urd), वियतनामी (vie), वेल्श (cym)।
Eleven v3 Conversational
Eleven v3 Conversational रीयलटाइम स्पीच सिंथेसिस के लिए हमारा सबसे भावपूर्ण मॉडल है। यह अत्याधुनिक मॉडल कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, इंसानों जैसी आवाज़ बनाता है।
यह मॉडल इन स्थितियों में अच्छा काम करता है:
- सपोर्ट एजेंट्स: ऐसे वॉइस एजेंट्स तैयार करें जो रीयलटाइम में ग्राहकों के सवाल हल करें।
- AI असिस्टेंट्स: व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत संवाद जनरेट करें।
- इंटरैक्टिव किरदार: भावपूर्ण किरदारों वाले ऑडियो अनुभवों के लिए बेहतरीन।
Eleven v3 Conversational के साथ नया टेक्स्ट टू डायलॉग WebSocket आता है, जिससे आप कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत संवाद जनरेट कर सकते हैं।
टेक्स्ट टू डायलॉग WebSocket के बारे में यहां और पढ़ें।
समर्थित भाषाएं
Eleven v3 मॉडल 70+ भाषाओं को support करता है, जिनमें शामिल हैं:
अफ़्रीकान्स (afr), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), कन्नड़ (kan), कज़ाख़ (kaz), किर्गिज़ (kir), कोरियाई (kor), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), मंदारिन चीनी (cmn), मराठी (mar), नेपाली (nep), नॉर्वेजियन (nor), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), सिंधी (snd), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उर्दू (urd), वियतनामी (vie), वेल्श (cym)।
Multilingual v2
Eleven Multilingual v2 हमारा सबसे उन्नत, भावनाओं को समझने वाला स्पीच सिंथेसिस मॉडल है। यह कई भाषाओं में व्यापक भावनात्मक अभिव्यक्ति और संदर्भ की समझ के साथ प्राकृतिक, जीवंत आवाज़ बनाता है।
यह मॉडल स्पीकर की अनोखी विशेषताएं और एक्सेंट बनाए रखते हुए, सभी समर्थित भाषाओं में एक जैसी वॉइस क्वालिटी और पर्सनैलिटी देता है।
यह मॉडल उन स्थितियों में बेहतरीन है जिनमें उच्च-क्वालिटी, भावनात्मक रूप से बारीक आवाज़ चाहिए:
- किरदारों के वॉइसओवर: अपनी भावनात्मक अभिव्यक्ति की रेंज के कारण गेमिंग और ऐनिमेशन के लिए आदर्श।
- प्रोफेशनल कंटेंट: कॉर्पोरेट वीडियो और ई-लर्निंग सामग्री के लिए उपयुक्त।
- मल्टीलिंगुअल प्रोजेक्ट्स: भाषा बदलने पर भी वॉइस क्वालिटी एक जैसी रखता है।
- स्थिर क्वालिटी: लगातार उच्च-क्वालिटी ऑडियो आउटपुट देता है।
Flash मॉडल्स की तुलना में इसकी लेटेंसी और प्रति कैरेक्टर लागत ज़्यादा है, लेकिन जिन प्रोजेक्ट्स में जीवंत आवाज़ ज़रूरी है, उनके लिए यह बेहतर क्वालिटी देता है।
हमारे multilingual v2 मॉडल्स 29 भाषाओं को support करते हैं:
अंग्रेज़ी (USA, UK, ऑस्ट्रेलिया, कनाडा), जापानी, चीनी, जर्मन, हिंदी, फ़्रेंच (फ़्रांस, कनाडा), कोरियाई, पुर्तगाली (ब्राज़ील, पुर्तगाल), इतालवी, स्पेनिश (स्पेन, मेक्सिको), इंडोनेशियाई, डच, तुर्की, फ़िलिपीनो, पोलिश, स्वीडिश, बल्गेरियाई, रोमानियाई, अरबी (सऊदी अरब, UAE), चेक, यूनानी, फ़िनिश, क्रोएशियाई, मलय, स्लोवाक, डेनिश, तमिल, यूक्रेनी और रूसी।
Flash v2.5
Eleven Flash v2.5 हमारा सबसे तेज़ स्पीच सिंथेसिस मॉडल है, जिसे रीयल-टाइम ऐप्लिकेशंस और Agents Platform के लिए डिज़ाइन किया गया है। यह 32 भाषाओं में बेहद कम लेटेंसी (~75ms†) के साथ उच्च-क्वालिटी आवाज़ देता है।
यह मॉडल स्पीड और क्वालिटी के बीच संतुलन बनाता है, इसलिए यह इंटरैक्टिव ऐप्लिकेशंस के लिए आदर्श है। साथ ही, भाषाओं के बीच प्राकृतिक सुनाई देने वाला आउटपुट और एक जैसी वॉइस विशेषताएं बनाए रखता है।
यह मॉडल खास तौर पर इनके लिए उपयुक्त है:
- Agents Platform: रीयल-टाइम वॉइस एजेंट्स और चैटबॉट्स के लिए एकदम सही।
- इंटरैक्टिव ऐप्लिकेशंस: गेम्स और तुरंत जवाब देने वाली ऐप्लिकेशंस के लिए आदर्श।
- बड़े पैमाने पर प्रोसेसिंग: बड़ी मात्रा में टेक्स्ट-टू-स्पीच कन्वर्ज़न के लिए प्रभावी।
API जनरेशन के लिए कम कीमत और 75ms लेटेंसी के साथ, Flash v2.5 कई भाषाओं में तेज़ और भरोसेमंद स्पीच सिंथेसिस चाहने वाले हर व्यक्ति के लिए किफ़ायती विकल्प है।
Flash v2.5, v2 मॉडल्स की सभी भाषाओं के साथ-साथ 32 भाषाओं को support करता है:
हंगेरियन, नॉर्वेजियन और वियतनामी
† ऐप्लिकेशन और नेटवर्क लेटेंसी शामिल नहीं हैध्यान देने वाली बातें
नंबरों के साथ टेक्स्ट नॉर्मलाइज़ेशन
Flash v2.5 इस्तेमाल करते समय, नंबर डिफ़ॉल्ट रूप से उस तरह नॉर्मलाइज़ नहीं होते जैसा आप उम्मीद करते हैं। उदाहरण के लिए, फ़ोन नंबर इस तरह पढ़े जा सकते हैं कि यूज़र को वे साफ़ समझ न आएं। तारीखों और मुद्राओं पर भी इसी तरह असर पड़ता है।
कम लेटेंसी बनाए रखने के लिए Flash v2.5 में डिफ़ॉल्ट रूप से नॉर्मलाइज़ेशन बंद है। हालांकि, Enterprise ग्राहक अब अपने अनुरोध में apply_text_normalization पैरामीटर को “on” पर सेट करके v2.5 मॉडल्स के लिए टेक्स्ट नॉर्मलाइज़ेशन चालू कर सकते हैं।
Multilingual v2 मॉडल नंबरों को नॉर्मलाइज़ करने में बेहतर है, इसलिए हम फ़ोन नंबरों और ऐसे अन्य मामलों के लिए इसका इस्तेमाल करने की सलाह देते हैं जहां नंबर नॉर्मलाइज़ेशन ज़रूरी है।
कम-लेटेंसी या Agents Platform ऐप्लिकेशंस के लिए, सबसे अच्छा तरीका है कि TTS मॉडल को भेजने से पहले आपका LLM टेक्स्ट को नॉर्मलाइज़ करे, या apply_text_normalization पैरामीटर इस्तेमाल करें (v2.5 मॉडल्स के लिए सिर्फ़ Enterprise प्लान में)।
मॉडल चुनने की गाइड
आपकी ज़रूरतों और इस्तेमाल के मामले के लिए कौन-सा मॉडल सबसे सही है, इसके लिए मॉडल चुनने की गाइड देखें।
ज़रूरतें
इस्तेमाल का मामला
कैरेक्टर सीमाएं
एक टेक्स्ट-टू-स्पीच रिक्वेस्ट में समर्थित कैरेक्टर की अधिकतम संख्या मॉडल के अनुसार अलग-अलग होती है।
Scribe v2
Scribe v2 हमारा अत्याधुनिक स्पीच रिकग्निशन मॉडल है, जिसे 90+ भाषाओं में सटीक ट्रांसक्रिप्शन के लिए बनाया गया है। यह शब्द-स्तर के सटीक टाइमस्टैंप और स्पीकर डायराइजेशन व डायनामिक ऑडियो टैगिंग जैसी उन्नत सुविधाएं देता है।
यह मॉडल उन स्थितियों में बेहतरीन है जहां सटीक स्पीच-टू-टेक्स्ट कन्वर्ज़न चाहिए:
- ट्रांसक्रिप्शन सेवाएं: ऑडियो/वीडियो कंटेंट को टेक्स्ट में बदलने के लिए बेहतरीन
- मीटिंग डॉक्यूमेंटेशन: बातचीत को कैप्चर और डॉक्यूमेंट करने के लिए आदर्श
- कंटेंट विश्लेषण: ऑडियो कंटेंट प्रोसेसिंग और विश्लेषण के लिए उपयुक्त
- मल्टीलिंगुअल रिकग्निशन: 90+ भाषाओं में सटीक ट्रांसक्रिप्शन का समर्थन
मुख्य सुविधाएं:
- शब्द-स्तर के टाइमस्टैंप के साथ सटीक ट्रांसक्रिप्शन
- कई स्पीकर्स वाले ऑडियो के लिए स्पीकर डायराइजेशन
- बेहतर संदर्भ के लिए डायनामिक ऑडियो टैगिंग
- 90+ भाषाओं का समर्थन
- एंटिटी डिटेक्शन
- कीटर्म प्रॉम्प्टिंग
- ट्रांसक्रिप्ट एडिटिंग
Scribe v2 के बारे में और पढ़ें यहां।
Scribe v2 Realtime
Scribe v2 Realtime, हमारा सबसे तेज़ और सटीक लाइव स्पीच रिकग्निशन मॉडल, बेहद कम 150ms लेटेंसी के साथ 90 से अधिक भाषाओं में अत्याधुनिक सटीकता देता है।
यह मॉडल कन्वर्सेशनल उपयोग के मामलों में बेहतरीन है:
- लाइव मीटिंग ट्रांसक्रिप्शन: रियलटाइम ट्रांसक्रिप्शन के लिए बेहतरीन
- AI एजेंट्स: लाइव बातचीत के लिए आदर्श
- मल्टीलिंगुअल रिकग्निशन: ऑटोमैटिक भाषा पहचान के साथ 90+ भाषाओं में सटीक ट्रांसक्रिप्शन का समर्थन
मुख्य सुविधाएं:
- बेहद कम लेटेंसी: ~150 मिलीसेकंड में आंशिक ट्रांसक्रिप्शन पाएं
- स्ट्रीमिंग सपोर्ट: रियल-टाइम में ट्रांसक्रिप्ट पाते हुए ऑडियो को हिस्सों में भेजें
- कई ऑडियो फॉर्मैट: PCM (8kHz से 48kHz) और μ-law एन्कोडिंग का समर्थन
- वॉइस एक्टिविटी डिटेक्शन (VAD): साइलेंस डिटेक्शन के आधार पर ऑटोमैटिक स्पीच सेगमेंटेशन
- मैन्युअल कमिट कंट्रोल: ट्रांसक्रिप्ट सेगमेंट को फाइनल करने के समय पर पूरा नियंत्रण
- एंटिटी डिटेक्शन
- ट्रांसक्रिप्ट एडिटिंग
Scribe v2 Realtime के बारे में और पढ़ें यहां।
Scribe v2 Medical
Scribe v2 Medical मेडिकल और क्लिनिकल ऑडियो के लिए विशेष रूप से बनाया गया बैच स्पीच रिकग्निशन मॉडल है। यह Scribe v2 का एक फाइन-ट्यून है, जो रोज़मर्रा की बोलचाल में Scribe v2 जैसी सटीकता बनाए रखते हुए दवाओं के नाम, एनाटॉमी, पैथोलॉजी और क्लिनिकल डिक्टेशन की पहचान को बेहतर बनाता है। यह Scribe v2 के समान स्पीच टू टेक्स्ट API का इस्तेमाल करता है और इसकी बिलिंग भी उसी दर पर होती है। model_id के रूप में scribe_v2_medical पास करें।
निर्धारित उद्देश्य
Scribe v2 Medical एक बैच स्पीच-टू-टेक्स्ट API मॉडल है, जिसे डेवलपर और संगठन अपने ऐसे ऐप्लिकेशन में इंटीग्रेट कर सकते हैं जो क्लिनिकल ऑडियो—जिसमें क्लिनिशियन-पेशेंट बातचीत, डिक्टेशन, इंटेक और केयर-कोऑर्डिनेशन कॉल शामिल हैं—को डॉक्यूमेंटेशन और संबंधित प्रशासनिक वर्कफ़्लो के लिए ड्राफ्ट ट्रांसक्रिप्ट में बदलते हैं। तैयार टेक्स्ट को इस्तेमाल से पहले किसी हेल्थकेयर प्रोफेशनल या अन्य अधिकृत यूज़र द्वारा रिव्यू और सुधारने के लिए बनाया गया है। Scribe v2 Medical का उद्देश्य क्लिनिकल जानकारी की व्याख्या करना या डायग्नोसिस, इलाज की सिफारिशें, क्लिनिकल निर्णय या अन्य क्लिनिकल मार्गदर्शन देना नहीं है।
यह मॉडल इनके लिए उपयुक्त है:
- क्लिनिकल डॉक्यूमेंटेशन: एम्बिएंट एनकाउंटर्स और नोट्स, जहां बातचीत के दौरान मेडिकल शब्द आते हैं
- डिक्टेशन: दवाओं, डोज़ और निष्कर्षों के सघन क्रम
- इंटेक और कोऑर्डिनेशन कॉल: मरीज़ अपनी स्थितियों का वर्णन करते हैं, अक्सर फोन पर
- कंप्लायंस वर्कफ़्लो: PHI कैटेगरी के लिए एंटिटी डिटेक्शन के साथ जोड़ें
मुख्य सुविधाएं:
- Scribe v2 जैसी ही रिक्वेस्ट संरचना (
keyterms,entity_detection,no_verbatim, डायराइजेशन, टाइमस्टैंप) - दवाओं के नाम, एनाटॉमी और पैथोलॉजी शब्दों की बेहतर पहचान
- Scribe v2 की तुलना में रोज़मर्रा की बोलचाल पर कोई गिरावट नहीं
- 90+ भाषाओं का समर्थन
- कई स्पीकर्स वाले ऑडियो के लिए स्पीकर डायराइजेशन
- डायनामिक ऑडियो टैगिंग
- PHI कैटेगरी सहित एंटिटी डिटेक्शन
Scribe v2 Medical एक बैच मॉडल है। लाइव ट्रांसक्रिप्शन के लिए Scribe v2 Realtime इस्तेमाल करें।
Scribe v2 Medical HIPAA के लिए योग्य है। Enterprise ग्राहकों के लिए बिज़नेस एसोसिएट एग्रीमेंट और ज़ीरो रिटेंशन मोड (ZRM) उपलब्ध हैं। ZRM चालू होने पर, हर रिक्वेस्ट पूरी होते ही ऑडियो इनपुट और टेक्स्ट आउटपुट डिलीट हो जाते हैं। ElevenLabs कुछ भी रिटेन नहीं करता, और आपके ऐप्लिकेशन को पूरा API रिस्पॉन्स मिलता है तथा ट्रांसक्रिप्ट आपके अपने नियंत्रण में रहते हैं।
HIPAA अनुपालन चाहने वाली कंपनियों को संरक्षित स्वास्थ्य जानकारी भेजने से पहले बिज़नेस एसोसिएट एग्रीमेंट (BAA) पर हस्ताक्षर करने के लिए ElevenLabs सेल्स से संपर्क करना चाहिए।
स्पीच टू टेक्स्ट के बारे में और पढ़ें यहां।
Eleven Music
Eleven Music हमारा स्टूडियो-ग्रेड म्यूज़िक जेनरेशन मॉडल है। यह आपको किसी भी स्टाइल में नेचुरल लैंग्वेज प्रॉम्प्ट के साथ म्यूज़िक जेनरेट करने देता है।
यह मॉडल इन स्थितियों के लिए बेहतरीन है:
- गेम साउंडट्रैक: गेम्स के लिए इमर्सिव साउंडट्रैक बनाएं
- पॉडकास्ट बैकग्राउंड: प्रोफेशनल म्यूज़िक से पॉडकास्ट को बेहतर बनाएं
- मार्केटिंग: ऐड रील्स में बैकग्राउंड म्यूज़िक जोड़ें
मुख्य सुविधाएं:
- जॉनर, स्टाइल और स्ट्रक्चर पर पूरा नियंत्रण
- वोकल्स या सिर्फ इंस्ट्रूमेंटल
- अंग्रेज़ी, स्पैनिश, जर्मन, जापानी और अन्य भाषाओं सहित मल्टीलिंगुअल
- अलग-अलग सेक्शन या पूरे गाने की साउंड और लिरिक्स एडिट करें
Eleven Music के बारे में और पढ़ें यहां।
समकालिकता और प्राथमिकता
आपका सब्सक्रिप्शन प्लान तय करता है कि एक साथ कितने अनुरोध प्रोसेस किए जा सकते हैं और क्यू में आपके अनुरोधों की प्राथमिकता का स्तर क्या होगा। स्पीच टू टेक्स्ट की समकालिकता सीमा अधिक होती है। समकालिकता सीमा पूरी हो जाने पर, अगले अनुरोध कम-प्राथमिकता वाले अनुरोधों के साथ क्यू में प्रोसेस किए जाते हैं। व्यवहार में, इससे आम तौर पर केवल ~50ms की लेटेंसी बढ़ती है।
रिस्पॉन्स हेडर में current-concurrent-requests और maximum-concurrent-requests शामिल होते हैं, जिनका इस्तेमाल आप अपनी समकालिकता मॉनिटर करने के लिए कर सकते हैं।
प्रति मिनट API अनुरोध बनाम समकालिक अनुरोध
यह समझना ज़रूरी है कि प्रति मिनट API अनुरोध और समकालिक अनुरोध अलग-अलग मेट्रिक हैं, जो आपके उपयोग पैटर्न पर निर्भर करते हैं।
प्रति मिनट API अनुरोधों की संख्या समकालिक अनुरोधों से अलग हो सकती है, क्योंकि यह हर अनुरोध में लगने वाले समय और अनुरोधों को बैच करने के तरीके पर निर्भर करती है।
उदाहरण 1: अंतराल वाले अनुरोध अगर आपके पास प्रति मिनट 180 अनुरोध हों, जिनमें से हर एक को पूरा होने में 1 सेकंड लगता हो और आप उन्हें 0.33 सेकंड के अंतराल पर भेजें, तो अधिकतम समकालिक अनुरोध 3 होंगे और औसत भी 3 होगा, क्योंकि हमेशा 3 अनुरोध प्रगति पर होंगे।
उदाहरण 2: बैच किए गए अनुरोध वहीं, अगर आपका उपयोग पैटर्न अलग हो, जैसे प्रति मिनट 180 अनुरोध, जिनमें से हर एक को पूरा होने में 3 सेकंड लगते हों लेकिन वे सभी एक साथ भेजे जाते हों, तो अधिकतम समकालिक अनुरोध 180 होंगे और औसत 9 होगा (मिनट के पहले 3 सेकंड में एक साथ 180 अनुरोध होंगे और आखिरी 57 सेकंड में 0 अनुरोध)।
क्योंकि हमारा सिस्टम समकालिकता पर ध्यान देता है, इसलिए प्रति मिनट अनुरोधों की संख्या से ज़्यादा अहम यह है कि हर अनुरोध को कितना समय लगता है और उन्हें किस पैटर्न में भेजा जाता है।
एंडपॉइंट अनुरोध करने का तरीका समकालिकता सीमाओं को प्रभावित करता है:
- HTTP के साथ, हर अनुरोध आपकी समकालिकता सीमा में अलग-अलग गिना जाता है।
- टेक्स्ट टू स्पीच WebSocket के साथ, केवल वह समय आपकी समकालिकता सीमा में गिना जाता है जब हमारा मॉडल ऑडियो जनरेट कर रहा होता है। इसका मतलब है कि ज़्यादातर समय, एक खुला websocket आपकी समकालिकता सीमा में बिल्कुल नहीं गिना जाता।
- टेक्स्ट टू डायलॉग WebSockets अलग तरह से काम करते हैं: हर खुला कनेक्शन, खुले रहने तक अलग पूल से एक डायलॉग सेशन आरक्षित रखता है और कनेक्शन पर जनरेट किया गया ऑडियो आपकी सामान्य समकालिकता सीमा में नहीं गिना जाता। इसे समझना आसान बनाने के लिए डिज़ाइन किया गया है: एक कनेक्शन एक सेशन है और आपकी डायलॉग सेशन सीमाएं इस नई समकालिकता पद्धति के अनुसार तय की जाती हैं। टेक्स्ट टू डायलॉग समकालिकता देखें।
समकालिकता सीमाएं समझें
आपके प्लान से जुड़ी समकालिकता सीमा को एक साथ संभाली जा सकने वाली बातचीतों, फोन कॉल, कैरेक्टर वॉइसओवर आदि की अधिकतम संख्या नहीं मानना चाहिए। वास्तविक संख्या कई कारकों पर निर्भर करती है, जिनमें इस्तेमाल की जाने वाली खास AI वॉइस और उपयोग के मामले की विशेषताएं शामिल हैं।
सामान्य तौर पर, 5 की समकालिकता सीमा आमतौर पर लगभग 100 एक साथ ऑडियो ब्रॉडकास्ट को सपोर्ट कर सकती है।
ऐसा इसलिए है क्योंकि ऑडियो जनरेट होने की गति, TTS अनुरोध प्रोसेस होने में लगने वाले समय की तुलना में तेज़ होती है। नीचे दिया गया डायग्राम दिखाता है कि अलग-अलग यूज़र्स के साथ 4 समकालिक कॉल कैसे केवल 2 समकालिक अनुरोधों के साथ संचालित की जा सकती हैं।

AI वॉइस एजेंट बनाना
जहां TTS का इस्तेमाल डायलॉग को संचालित करने के लिए किया जाता है, वहां 5 की समकालिकता सीमा AI एजेंट और मानवीय प्रतिभागियों के बीच संतुलित बातचीत के लिए लगभग 100 ब्रॉडकास्ट को सपोर्ट कर सकती है।
ऐसे उपयोग मामलों में जहां AI एजेंट इंसान की तुलना में कम बार बोलता है, जैसे कस्टमर सपोर्ट इंटरैक्शन, 100 से अधिक एक साथ बातचीतों को सपोर्ट किया जा सकता है।
कैरेक्टर वॉइसओवर
आम तौर पर, 5 की समकालिकता सीमा के लिए 100 से अधिक एक साथ कैरेक्टर वॉइसओवर को सपोर्ट किया जा सकता है।
यह संख्या कैरेक्टर के डायलॉग की आवृत्ति, विराम की अवधि और लाइनों के बीच इन-गेम गतिविधियों के आधार पर अलग हो सकती है।
लाइव डबिंग
समकालिक डबिंग स्ट्रीम आमतौर पर दिए गए अनुमान का पालन करती हैं।
अगर ब्रॉडकास्ट में बातचीत के बीच विराम होते हैं (जैसे साउंडट्रैक, विज़ुअल सीन आदि के कारण), तो सुझाई गई संख्या से अधिक एक साथ डबिंग स्ट्रीम संभव हो सकती हैं।
अगर आप किसी भी समय अपने प्लान की समकालिकता सीमा पार कर देते हैं और Enterprise प्लान पर हैं, तो उपलब्ध क्षमता के आधार पर सर्वोत्तम प्रयास के आधार पर मॉडल अनुरोध धीमे होने पर भी सफल हो सकते हैं।
अपनी समकालिकता सीमा और क्यू प्राथमिकता बढ़ाने के लिए, अपना सब्सक्रिप्शन प्लान अपग्रेड करें।
Enterprise ग्राहक अपने अकाउंट मैनेजर से संपर्क करके अधिक समकालिकता सीमा का अनुरोध कर सकते हैं।
टेक्स्ट टू डायलॉग समकालिकता
टेक्स्ट टू डायलॉग अनुरोधों को API कॉल करने के तरीके के आधार पर दो अलग-अलग तरीकों से मापा जाता है:
- HTTP एंडपॉइंट (डायलॉग बनाएं और डायलॉग स्ट्रीम करें) ऑडियो जनरेट होने के दौरान, किसी भी अन्य टेक्स्ट टू स्पीच अनुरोध की तरह, आपके प्लान की मानक समकालिकता सीमा में गिने जाते हैं।
- टेक्स्ट टू डायलॉग WebSocket जैसे WebSocket एंडपॉइंट को डायलॉग सेशन के रूप में मापा जाता है। एक खुला कनेक्शन, ऑडियो जनरेट हो रहा हो या नहीं, खुले रहने तक एक डायलॉग सेशन रखता है।
सेशन-आधारित मापन क्षमता की योजना बनाना आसान रखता है: एक कनेक्शन एक सेशन है, इसलिए आपका उपयोग जनरेशन गतिविधि के साथ बदलता नहीं है। चूंकि सेशन केवल ऑडियो जनरेट होने के दौरान नहीं, बल्कि पूरे कनेक्शन के लिए रखा जाता है, इसलिए आपकी डायलॉग सेशन सीमाएं इस नई समकालिकता पद्धति के अनुसार तय की जाती हैं।
अगर आप कनेक्शन तब खोलते हैं, जब आपके वर्कस्पेस के सभी डायलॉग सेशन उपयोग में हों, तो नए कनेक्शन को too_many_concurrent_requests त्रुटि के साथ अस्वीकार कर दिया जाता है। सेशन खाली करने के लिए, जिन कनेक्शन की अब ज़रूरत नहीं है उन्हें बंद करें — अगर आप keep_alive मैसेज नहीं भेजते हैं, तो निष्क्रियता के 20 सेकंड बाद कनेक्शन अपने आप भी बंद हो जाता है।
डायलॉग सेशन मॉनिटर करने के लिए, डैशबोर्ड साइडबार के नीचे डेवलपर्स खोलें, एनालिटिक्स टैब चुनें और उपयोग व्यू में समकालिक अनुरोध मेट्रिक देखें। डायलॉग सेशन आपके अन्य समकालिक अनुरोधों से अलग, अपनी अलग सीरीज़ TTD Websocket Sessions के रूप में रिपोर्ट होते हैं।
स्केल टेस्टिंग समकालिकता सीमाएं
स्केल टेस्टिंग क्लाइंट-साइड स्केलिंग समस्याओं की पहचान करने और यह जांचने के लिए उपयोगी हो सकती है कि आपके उपयोग मामले के लिए समकालिकता सीमाएं सही तरीके से सेट हैं या नहीं।
वास्तविक उपयोग के जितना संभव हो उतना करीब एंड-टू-एंड वर्कफ़्लो टेस्ट करने की पुरज़ोर सलाह दी जाती है। कितने यूज़र्स को सपोर्ट किया जा सकता है, इसका सिमुलेशन और मापन करना इसके लिए सुझाई गई पद्धति है। यह ज़रूरी है कि आप:
- रॉ अनुरोधों का नहीं, यूज़र्स का सिमुलेशन करें
- अनुरोध करने से पहले ऑडियो प्लेबैक, यूज़र का बोलना या ट्रांसक्रिप्शन पूरा होने का इंतज़ार करने जैसे सामान्य यूज़र व्यवहार का सिमुलेशन करें
- कुछ मिनटों की अवधि में यूज़र्स की संख्या धीरे-धीरे बढ़ाएं
- अनुरोध के समय और अनुरोधों के आकार में रैंडमनेस जोड़ें
- लेटेंसी मेट्रिक और API से मिलने वाले सभी त्रुटि कोड कैप्चर करें
उदाहरण के लिए, 100 एक साथ बातचीतों को सपोर्ट करने के लिए बनाए गए एजेंट सिस्टम का परीक्षण करने के लिए, आप बातचीत का सिमुलेशन करने वाले अधिकतम 100 अलग-अलग “यूज़र” बनाएंगे। बातचीत में आमतौर पर ~10 सेकंड यूज़र के बोलने का दोहराव वाला चक्र होता है, उसके बाद ~150 कैरेक्टर के लिए TTS API कॉल और फिर यूज़र के लिए ~10 सेकंड ऑडियो प्लेबैक होता है। इसलिए, हर यूज़र को हर 20 सेकंड में 150 कैरेक्टर के टेक्स्ट के लिए websocket टेक्स्ट-टू-स्पीच API कॉल करने के पैटर्न का पालन करना चाहिए, जिसमें इंतज़ार की अवधि और मांगे गए कैरेक्टर की संख्या में थोड़ी रैंडमनेस हो। टेस्ट में 100 यूज़र होने तक हर सेकंड एक यूज़र शुरू करना और फिर कुल स्थिरता जांचने के लिए 10 मिनट तक टेस्ट करना शामिल होगा।
स्केल टेस्टिंग स्क्रिप्ट का उदाहरण
इस उदाहरण में ElevenLabs API के लिए सीधे API कॉल के साथ टेस्टिंग फ्रेमवर्क के रूप में locust का इस्तेमाल किया गया है।
यह ऊपर दिए गए उदाहरण का पालन करता है और एक कन्वर्सेशनल एजेंट सिस्टम का परीक्षण करता है, जिसमें हर यूज़र हर 20 सेकंड में 1 अनुरोध भेजता है।