डायलॉग बनाएं
डायलॉग बनाएं
टेक्स्ट और वॉइस ID जोड़ों की सूची को स्पीच (डायलॉग) में बदलता है और ऑडियो लौटाता है।
Headers
Query parameters
Request
डायलॉग इनपुट की सूची, जिनमें से हर एक में टेक्स्ट और एक वॉइस ID होती है जिसे स्पीच में बदला जाएगा। अद्वितीय वॉइस IDs की अधिकतम संख्या 10 है। भरोसेमंद जनरेशन के लिए, सभी inputs[].text मानों में कुल वर्ण संख्या प्रति अनुरोध 2,000 वर्ण या उससे कम रखें। लंबे अनुरोध streaming responses में जल्दी समाप्त हो सकते हैं या validation error दे सकते हैं।
इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में टेक्स्ट टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_text_to_speech प्रॉपर्टी से जांच सकते हैं।
मॉडल और टेक्स्ट नॉर्मलाइज़ेशन के लिए भाषा लागू करने में इस्तेमाल होने वाला भाषा कोड (ISO 639-1)। अगर मॉडल दिए गए भाषा कोड को सपोर्ट नहीं करता, तो उसे अनदेखा कर दिया जाएगा। यह पैरामीटर multilingual_v2 मॉडल के लिए समर्थित नहीं है।
dialogue generation को नियंत्रित करने वाली settings।
वह टेक्स्ट जो इस जनरेशन से तुरंत पहले आता है और मॉडल को प्रोसोडिक निरंतरता के लिए कंडीशन करने में इस्तेमाल होता है। अधिकतम 100 कैरेक्टर भेजे जा सकते हैं। हर मॉडल में समर्थित नहीं है।
वह टेक्स्ट जो इस जनरेशन के तुरंत बाद आता है और मॉडल को प्रोसोडिक निरंतरता के लिए कंडीशन करने में इस्तेमाल होता है। अधिकतम 100 कैरेक्टर भेजे जा सकते हैं। हर मॉडल में समर्थित नहीं है।
टेक्स्ट पर लागू किए जाने वाले उच्चारण शब्दकोश लोकेटर्स (id, version_id) की सूची। इन्हें क्रम से लागू किया जाएगा। हर अनुरोध में अधिकतम 3 लोकेटर्स हो सकते हैं।
निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।
यह पैरामीटर तीन मोड के साथ टेक्स्ट नॉर्मलाइज़ेशन नियंत्रित करता है: ‘auto’, ‘on’ और ‘off’। ‘auto’ पर सेट होने पर, सिस्टम अपने-आप तय करेगा कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं, जैसे संख्याओं को शब्दों में लिखना। ‘on’ के साथ टेक्स्ट नॉर्मलाइज़ेशन हमेशा लागू होगा, जबकि ‘off’ के साथ इसे छोड़ दिया जाएगा।
प्रोफेशनल वॉइस का IVC वर्शन इस्तेमाल करना है या नहीं। इससे अभिव्यक्तिशीलता बेहतर हो सकती है और लेटेंसी कम हो सकती है।
इससे पहले हुई डायलॉग जनरेशन्स के request_ids की सूची। किसी बड़े कार्य को कई अनुरोधों में बाँटते समय निरंतरता के लिए मॉडल को कंडीशन करने में उपयोग होती है। अधिकतम 3 request_ids भेजे जा सकते हैं। आखिरी request_id उस ऑडियो का है जो वर्तमान अनुरोध के सबसे निकट है। हर मॉडल इसका समर्थन नहीं करता।
इसके बाद होने वाली डायलॉग जनरेशन्स के request_ids की सूची। किसी सीक्वेंस के बीच में क्लिप को फिर से जनरेट करते समय निरंतरता बनाए रखने के लिए उपयोगी है। अधिकतम 3 request_ids भेजे जा सकते हैं। पहला request_id उस ऑडियो का है जो वर्तमान अनुरोध के सबसे निकट है। हर मॉडल इसका समर्थन नहीं करता।
Response
जनरेट की गई ऑडियो फ़ाइल