लेटेंसी ऑप्टिमाइज़ेशन
लेटेंसी ऑप्टिमाइज़ेशन
यह गाइड आपको अपने एप्लिकेशन में टेक्स्ट-टू-स्पीच लेटेंसी कम करने का तरीका बताती है।
इस गाइड में टेक्स्ट टू स्पीच की लेटेंसी बेहतर करने के मुख्य सिद्धांत बताए गए हैं। लेटेंसी क्या है और उसमें किन चीज़ों का योगदान होता है, इसकी वैचारिक व्याख्या के लिए लेटेंसी को समझें देखें।
हालाँकि कई अलग-अलग तकनीकें हैं, हम उन्हें चार सिद्धांतों में बाँटेंगे।
चार सिद्धांत
Enterprise ग्राहकों को ज़्यादा concurrency limits और हमारी rendering queue का प्राथमिक एक्सेस मिलता है। हमारे enterprise plans के बारे में ज़्यादा जानने के लिए सेल्स से संपर्क करें।
Flash मॉडल इस्तेमाल करें
Flash मॉडल ~75ms की inference speed देते हैं, जिससे वे रियल-टाइम ऐप्लिकेशन के लिए आदर्श हैं। इसका समझौता Multilingual v2 की तुलना में ऑडियो क्वालिटी में हल्की कमी है।
75ms केवल मॉडल inference समय को दर्शाता है। वास्तविक end-to-end लेटेंसी आपके स्थान और इस्तेमाल किए गए endpoint type जैसे कारकों के अनुसार अलग हो सकती है।
स्ट्रीमिंग का लाभ लें
हमारे API रेफरेंस में तीन तरह के टेक्स्ट टू स्पीच endpoints उपलब्ध हैं:
- रेगुलर endpoint: एक ही response में पूरी ऑडियो फ़ाइल लौटाता है।
- स्ट्रीमिंग endpoint: Server-sent events का उपयोग करके ऑडियो chunks को क्रमशः लौटाता है।
- Websockets endpoint: रियल-टाइम ऑडियो जनरेशन के लिए द्विदिश स्ट्रीमिंग सक्षम करता है।
स्ट्रीमिंग
स्ट्रीमिंग endpoints, रियल-टाइम में ऑडियो जनरेट होते ही उसे क्रमशः लौटाते हैं, जिससे time-to-first-byte कम होता है। यह endpoint उन मामलों के लिए सुझाया जाता है जहाँ इनपुट टेक्स्ट पहले से उपलब्ध हो।
स्ट्रीमिंग टेक्स्ट टू स्पीच API, वॉइस चेंजर API और ऑडियो आइसोलेशन API के लिए समर्थित है।
Websockets
text-to-speech websocket endpoint द्विदिश स्ट्रीमिंग का समर्थन करता है, इसलिए यह रियल-टाइम टेक्स्ट इनपुट वाले ऐप्लिकेशन (जैसे LLM outputs) के लिए बिल्कुल उपयुक्त है।
auto_mode को true पर सेट करने से generation triggers अपने-आप संभाले जाते हैं और chunk strategies को
मैन्युअली प्रबंधित करने की ज़रूरत नहीं रहती।
अगर auto_mode बंद है, तो मॉडल ऑडियो जनरेट करना शुरू करने से पहले chunk schedule से मेल खाने लायक टेक्स्ट का इंतज़ार करेगा।
उदाहरण के लिए, अगर आप 125 characters का chunk schedule सेट करते हैं लेकिन केवल 50 आते हैं, तो मॉडल अतिरिक्त characters आने तक रुक जाएगा—जिससे लेटेंसी बढ़ सकती है।
implementation की जानकारी के लिए text-to-speech websocket गाइड देखें।
उपयुक्त वॉइस चुनें
हमने देखा है कि कुछ मामलों में वॉइस का चयन लेटेंसी को प्रभावित कर सकता है। सबसे तेज़ से सबसे धीमे तक का क्रम यह है:
- डिफ़ॉल्ट वॉइस (पहले premade), Synthetic वॉइस और Instant Voice Clones (IVC)
- Professional Voice Clones (PVC)
ज़्यादा ऑडियो क्वालिटी वाले output formats लेटेंसी बढ़ा सकते हैं। अपनी लेटेंसी आवश्यकताओं और ऑडियो fidelity की ज़रूरतों के बीच संतुलन ज़रूर रखें।
भौगोलिक निकटता पर विचार करें
हम आपके भौगोलिक स्थान के आधार पर लेटेंसी ऑप्टिमाइज़ करने के लिए अपने मॉडल कई regions से उपलब्ध कराते हैं।
उदाहरण के लिए, Websockets के साथ Flash मॉडल इस्तेमाल करने पर, अपने स्थान के आधार पर आप निम्न TTFB लेटेंसी की उम्मीद कर सकते हैं:
API response में x-region header की जाँच करके आप पता कर सकते हैं कि कौन-सा backend region आपके request को serve कर रहा है।
फ़िलहाल इस्तेमाल किए जाने वाले regions में शामिल हैं: USA, Netherlands और Singapore।
Enterprise ग्राहक server location की गारंटी और कम लेटेंसी के लिए हमारे dedicated EU और India data residency environments का उपयोग कर सकते हैं। हमारी data residency infrastructure पर onboard होने के लिए अपने sales representative से संपर्क करें।
global routing से opt-out करने और हमेशा USA servers इस्तेमाल करने के लिए, अपने API requests में api.us.elevenlabs.io base URL इस्तेमाल करें:
global servers पहले api-global-preview.elevenlabs.io base URL का उपयोग करके opt-in किए जाते थे।
अब इसकी ज़रूरत नहीं है, क्योंकि यह अब डिफ़ॉल्ट व्यवहार है। कृपया अपने ऐप्लिकेशन को अपडेट करके
इसके बजाय केवल api.elevenlabs.io इस्तेमाल करें।