टेक्स्ट टू स्पीच बनाम टेक्स्ट टू डायलॉग WebSockets
टेक्स्ट टू स्पीच बनाम टेक्स्ट टू डायलॉग WebSockets
यह गाइड आपको स्ट्रीमिंग स्पीच के लिए सही WebSocket चुनने और दोनों प्रोटोकॉल में अंतर समझने में मदद करती है।
ElevenLabs सिंथेसाइज़ किए गए स्पीच को स्ट्रीम करने के लिए दो अलग-अलग WebSocket प्रोडक्ट देता है। ये अलग-अलग समस्याएं हल करते हैं, अलग-अलग मैसेज फ़ॉर्मैट स्वीकार करते हैं और अलग-अलग मॉडल्स के लिए हैं।
मुझे कौन-सा WebSocket इस्तेमाल करना चाहिए?
Text to Speech (TTS) WebSocket का इस्तेमाल करें, जब आप हर कनेक्शन पर एक वॉइस के लिए प्लेन टेक्स्ट स्ट्रीम करते हैं (वॉइस URL में तय होती है) और आपको Flash या Multilingual v2 जैसे non-v3 मॉडल्स, वैकल्पिक SSML, चंक शेड्यूल या एजेंट-स्टाइल इंटरप्शन हैंडलिंग के लिए multi-context वेरिएंट चाहिए।
Text to Dialogue (TTD) WebSocket का इस्तेमाल करें, जब आपको Eleven v3 डायलॉग व्यवहार चाहिए: एक्सप्रेसिव डिलीवरी, हर चंक के लिए voice_id, टर्न बाउंड्रीज़ (new_turn), और सर्वर पर v3 के लिए इस्तेमाल होने वाली वही डायलॉग-आधारित बफ़रिंग।
बैच या HTTP स्ट्रीमिंग डायलॉग के लिए (एक कॉल में पूरा अनुरोध), WebSocket के बजाय Create dialogue या Stream dialogue इस्तेमाल करें।
तुलना
TTS WebSocket कब बेहतर विकल्प है
- आपने लेटेंसी या भाषा कवरेज के लिए पहले से Flash या Multilingual v2 इंटीग्रेट किया हुआ है।
- आपको हर कनेक्शन पर एक नैरेटर वॉइस और आसान टेक्स्ट-पर-फ़्रेम प्रोटोकॉल चाहिए।
- आपको बार्ज-इन और समानांतर कथनों के लिए multi-context ऑर्केस्ट्रेशन चाहिए (multi-context गाइड)।
TTS WebSocket की पूरी जानकारी के लिए रियल-टाइम में ऑडियो जनरेट करें देखें।
TTD WebSocket कब बेहतर विकल्प है
- आप Eleven v3 डायलॉग को टारगेट कर रहे हैं (एक्सप्रेसिव टैग्स, बातचीत की गति, मल्टी-स्पीकर लाइनें)।
- आप स्क्रिप्टेड या LLM-जनरेटेड डायलॉग स्ट्रीम करते हैं, जिसमें बोलने वाली वॉइस हर लाइन में बदल सकती है, बिना नया कनेक्शन खोले।
- आपको सर्वर पर केवल v3 डायलॉग जनरेशन के साथ WebSocket-आकार का इंक्रीमेंटल इनपुट चाहिए।
व्यावहारिक जानकारी के लिए रियलटाइम टेक्स्ट टू डायलॉग देखें। प्रोटोकॉल की जानकारी API रेफरेंस में है।