स्पीच स्ट्रीम करें

अपनी पसंद की वॉइस का इस्तेमाल करके टेक्स्ट को स्पीच में बदलता है और ऑडियो स्ट्रीम के रूप में ऑडियो लौटाता है।

Path parameters

voice_idstringRequired
इस्तेमाल की जाने वाली वॉइस की ID। सभी उपलब्ध वॉइस सूचीबद्ध करने के लिए [Get voices](/docs/api-reference/voices/search) endpoint इस्तेमाल करें।

Headers

xi-api-keystringOptional

Query parameters

enable_loggingbooleanOptionalDefaults to true
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए history सुविधाएं, जिनमें request stitching भी शामिल है, उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।
optimize_streaming_latencyinteger or nullOptionalDeprecated
आप क्वालिटी में कुछ कमी के बदले लेटेंसी ऑप्टिमाइज़ेशन चालू कर सकते हैं। सबसे कम संभव अंतिम लेटेंसी मॉडल के अनुसार अलग-अलग होती है। संभावित मान: 0 - डिफ़ॉल्ट मोड (कोई लेटेंसी ऑप्टिमाइज़ेशन नहीं) 1 - सामान्य लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 50%) 2 - मज़बूत लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 75%) 3 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन 4 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन, साथ ही और अधिक लेटेंसी बचाने के लिए टेक्स्ट नॉर्मलाइज़र बंद रहता है (सबसे अच्छी लेटेंसी, लेकिन जैसे नंबर और तारीखों का गलत उच्चारण हो सकता है)। डिफ़ॉल्ट रूप से None।
output_formatenumOptionalDefaults to mp3_44100_128
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।

Request

This endpoint expects an object.
textstringRequired

वह टेक्स्ट जिसे स्पीच में बदला जाएगा।

model_idstringOptionalDefaults to eleven_multilingual_v2

इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में टेक्स्ट टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_text_to_speech प्रॉपर्टी से जांच सकते हैं।

language_codestring or nullOptional

मॉडल और टेक्स्ट नॉर्मलाइज़ेशन के लिए भाषा लागू करने में इस्तेमाल होने वाला भाषा कोड (ISO 639-1)। अगर मॉडल दिए गए भाषा कोड को सपोर्ट नहीं करता, तो उसे अनदेखा कर दिया जाएगा। यह पैरामीटर multilingual_v2 मॉडल के लिए समर्थित नहीं है।

voice_settingsobject or nullOptional

दी गई वॉइस की सेव की गई सेटिंग्स को ओवरराइड करने वाली वॉइस सेटिंग्स। ये सिर्फ़ दिए गए अनुरोध पर लागू होती हैं।

pronunciation_dictionary_locatorslist of objects or nullOptional

टेक्स्ट पर लागू किए जाने वाले उच्चारण शब्दकोश लोकेटर्स (id, version_id) की सूची। इन्हें क्रम से लागू किया जाएगा। हर अनुरोध में अधिकतम 3 लोकेटर्स हो सकते हैं।

seedinteger or nullOptional

निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।

previous_textstring or nullOptional

वह टेक्स्ट जो मौजूदा अनुरोध के टेक्स्ट से पहले आया था। कई जनरेशन को जोड़ते समय स्पीच की निरंतरता बेहतर करने या मौजूदा जनरेशन में स्पीच की निरंतरता को प्रभावित करने के लिए इस्तेमाल किया जा सकता है।

next_textstring or nullOptional

वह टेक्स्ट जो मौजूदा अनुरोध के टेक्स्ट के बाद आता है। कई जनरेशन को जोड़ते समय स्पीच की निरंतरता बेहतर करने या मौजूदा जनरेशन में स्पीच की निरंतरता को प्रभावित करने के लिए इस्तेमाल किया जा सकता है।

previous_request_idslist of strings or nullOptional

इस जनरेशन से पहले जनरेट किए गए सैंपल के request_id की सूची। किसी बड़े कार्य को कई अनुरोधों में बाँटते समय स्पीच की निरंतरता बेहतर करने के लिए इसका उपयोग किया जा सकता है। सभी जनरेशन्स में एक ही मॉडल इस्तेमाल करने पर परिणाम सबसे अच्छे होंगे। previous_text और previous_request_ids दोनों भेजने पर previous_text को अनदेखा किया जाएगा। अधिकतम 3 request_ids भेजे जा सकते हैं।

next_request_idslist of strings or nullOptional

इस जनरेशन के बाद आने वाले सैंपल के request_id की सूची। ऑडियो क्वालिटी संबंधी समस्या वाले सैंपल को फिर से जनरेट करते समय स्पीच की निरंतरता बनाए रखने के लिए next_request_ids खास तौर पर उपयोगी हैं। उदाहरण के लिए, अगर आपने 3 स्पीच क्लिप जनरेट किए हैं और क्लिप 2 को बेहतर बनाना चाहते हैं, तो क्लिप 3 का request id next_request_id के रूप में (और क्लिप 1 का previous_request_id के रूप में) देने से संयुक्त स्पीच में प्राकृतिक प्रवाह बनाए रखने में मदद मिलेगी। सभी जनरेशन्स में एक ही मॉडल इस्तेमाल करने पर परिणाम सबसे अच्छे होंगे। next_text और next_request_ids दोनों भेजने पर next_text को अनदेखा किया जाएगा। अधिकतम 3 request_ids भेजे जा सकते हैं।

use_pvc_as_ivcbooleanOptionalDefaults to false

प्रोफेशनल वॉइस का IVC वर्शन इस्तेमाल करना है या नहीं। इससे अभिव्यक्तिशीलता बेहतर हो सकती है और लेटेंसी कम हो सकती है।

apply_text_normalizationenumOptionalDefaults to auto

यह पैरामीटर तीन मोड के साथ टेक्स्ट नॉर्मलाइज़ेशन नियंत्रित करता है: ‘auto’, ‘on’ और ‘off’। ‘auto’ पर सेट होने पर, सिस्टम अपने-आप तय करेगा कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं, जैसे संख्याओं को शब्दों में लिखना। ‘on’ के साथ टेक्स्ट नॉर्मलाइज़ेशन हमेशा लागू होगा, जबकि ‘off’ के साथ इसे छोड़ दिया जाएगा।

Allowed values:
apply_language_text_normalizationbooleanOptionalDefaults to false

यह पैरामीटर भाषा टेक्स्ट नॉर्मलाइज़ेशन नियंत्रित करता है। इससे कुछ समर्थित भाषाओं में टेक्स्ट के सही उच्चारण में मदद मिलती है। चेतावनी: यह पैरामीटर अनुरोध की लेटेंसी को काफी बढ़ा सकता है। फ़िलहाल यह केवल जापानी के लिए समर्थित है।

Response

स्ट्रीमिंग ऑडियो डेटा

Errors

422
Unprocessable Entity Error