Eleven v3 क्या है?

Eleven v3 हमारा सबसे नया और सबसे अभिव्यक्तिपूर्ण टेक्स्ट टू स्पीच मॉडल है, जो देता है:

  • कुल मिलाकर बेहतर गुणवत्ता के साथ ज़्यादा इंसानी जनरेशन
  • ऑडियो टैग का समर्थन
    • भावनाएं: [sad] [angry] [happily]
    • डिलीवरी निर्देश: [whispers] [shouts]
    • गैर-मौखिक प्रतिक्रियाएं: [laughs] [clears throat] [sighs]
  • कई स्पीकर के साथ प्राकृतिक सुनाई देने वाले ऑडियो के लिए डायलॉग मोड
  • 70+ भाषाओं का समर्थन

यह शानदार आउटपुट दे सकता है, लेकिन इसकी ज़्यादा बदलाव वाली स्थिरता और अधिक लेटेंसी का मतलब है कि यह रियल-टाइम या कन्वर्सेशनल उपयोग के मामलों के लिए उपयुक्त नहीं है। इनके लिए हम Flash v2 (अंग्रेज़ी) या v2.5 (मल्टीलिंगुअल) की सलाह देते हैं। हम Eleven v3 के रियल-टाइम वर्ज़न पर काम कर रहे हैं।

आप मॉडल ID eleven_v3 तय करके हमारे स्पीच बनाएं और स्पीच स्ट्रीम करें एंडपॉइंट का इस्तेमाल करके API के ज़रिए v3 से जनरेट कर सकते हैं।

आप कई स्पीकर के साथ प्राकृतिक सुनाई देने वाला डायलॉग बनाने के लिए हमारे डायलॉग बनाएं और डायलॉग स्ट्रीम करें एंडपॉइंट भी इस्तेमाल कर सकते हैं।

ज़्यादा जानकारी के लिए ये संसाधन देखें: