टाइमस्टैम्प के साथ टेक्स्ट टू डायलॉग

ऑडियो-टेक्स्ट सिंक्रोनाइज़ेशन के लिए सटीक कैरेक्टर-स्तर टाइमिंग जानकारी के साथ टेक्स्ट से डायलॉग जनरेट करें।

Headers

xi-api-keystringOptional

Query parameters

output_formatenumOptionalDefaults to mp3_44100_128
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM और WAV formats के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।
enable_loggingbooleanOptionalDefaults to true
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए history सुविधाएं, जिनमें request stitching भी शामिल है, उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।

Request

This endpoint expects an object.
inputslist of objectsRequired

डायलॉग इनपुट की सूची, जिनमें से हर एक में टेक्स्ट और एक वॉइस ID होती है जिसे स्पीच में बदला जाएगा। अद्वितीय वॉइस IDs की अधिकतम संख्या 10 है। भरोसेमंद जनरेशन के लिए, सभी inputs[].text मानों में कुल वर्ण संख्या प्रति अनुरोध 2,000 वर्ण या उससे कम रखें। लंबे अनुरोध streaming responses में जल्दी समाप्त हो सकते हैं या validation error दे सकते हैं।

model_idstringOptionalDefaults to eleven_v3

इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में टेक्स्ट टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_text_to_speech प्रॉपर्टी से जांच सकते हैं।

language_codestring or nullOptional

मॉडल और टेक्स्ट नॉर्मलाइज़ेशन के लिए भाषा लागू करने में इस्तेमाल होने वाला भाषा कोड (ISO 639-1)। अगर मॉडल दिए गए भाषा कोड को सपोर्ट नहीं करता, तो उसे अनदेखा कर दिया जाएगा। यह पैरामीटर multilingual_v2 मॉडल के लिए समर्थित नहीं है।

settingsobject or nullOptional

dialogue generation को नियंत्रित करने वाली settings।

pronunciation_dictionary_locatorslist of objects or nullOptional

टेक्स्ट पर लागू किए जाने वाले उच्चारण शब्दकोश लोकेटर्स (id, version_id) की सूची। इन्हें क्रम से लागू किया जाएगा। हर अनुरोध में अधिकतम 3 लोकेटर्स हो सकते हैं।

seedinteger or nullOptional

निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।

apply_text_normalizationenumOptionalDefaults to auto

यह पैरामीटर तीन मोड के साथ टेक्स्ट नॉर्मलाइज़ेशन नियंत्रित करता है: ‘auto’, ‘on’ और ‘off’। ‘auto’ पर सेट होने पर, सिस्टम अपने-आप तय करेगा कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं, जैसे संख्याओं को शब्दों में लिखना। ‘on’ के साथ टेक्स्ट नॉर्मलाइज़ेशन हमेशा लागू होगा, जबकि ‘off’ के साथ इसे छोड़ दिया जाएगा।

Allowed values:
use_pvc_as_ivcbooleanOptionalDefaults to false

प्रोफेशनल वॉइस का IVC वर्शन इस्तेमाल करना है या नहीं। इससे अभिव्यक्तिशीलता बेहतर हो सकती है और लेटेंसी कम हो सकती है।

previous_request_idslist of strings or nullOptional

इससे पहले हुई डायलॉग जनरेशन्स के request_ids की सूची। किसी बड़े कार्य को कई अनुरोधों में बाँटते समय निरंतरता के लिए मॉडल को कंडीशन करने में उपयोग होती है। अधिकतम 3 request_ids भेजे जा सकते हैं। आखिरी request_id उस ऑडियो का है जो वर्तमान अनुरोध के सबसे निकट है। हर मॉडल इसका समर्थन नहीं करता।

next_request_idslist of strings or nullOptional

इसके बाद होने वाली डायलॉग जनरेशन्स के request_ids की सूची। किसी सीक्वेंस के बीच में क्लिप को फिर से जनरेट करते समय निरंतरता बनाए रखने के लिए उपयोगी है। अधिकतम 3 request_ids भेजे जा सकते हैं। पहला request_id उस ऑडियो का है जो वर्तमान अनुरोध के सबसे निकट है। हर मॉडल इसका समर्थन नहीं करता।

previous_textstring or nullOptional<=100 characters

वह टेक्स्ट जो इस जनरेशन से तुरंत पहले आता है और मॉडल को प्रोसोडिक निरंतरता के लिए कंडीशन करने में इस्तेमाल होता है। अधिकतम 100 कैरेक्टर भेजे जा सकते हैं। हर मॉडल में समर्थित नहीं है।

future_textstring or nullOptional<=100 characters

वह टेक्स्ट जो इस जनरेशन के तुरंत बाद आता है और मॉडल को प्रोसोडिक निरंतरता के लिए कंडीशन करने में इस्तेमाल होता है। अधिकतम 100 कैरेक्टर भेजे जा सकते हैं। हर मॉडल में समर्थित नहीं है।

Response

सफल रिस्पॉन्स

audio_base64string

Base64-एन्कोड किया गया ऑडियो डेटा

voice_segmentslist of objects

ऑडियो के लिए वॉइस सेगमेंट्स

alignmentobject or nullOptional

मूल टेक्स्ट के हर वर्ण की टाइमस्टैम्प जानकारी

normalized_alignmentobject or nullOptional

सामान्यीकृत टेक्स्ट के हर वर्ण की टाइमस्टैम्प जानकारी

Errors

422
Unprocessable Entity Error