वॉइस डिज़ाइन करें।

प्रॉम्प्ट के ज़रिए वॉइस डिज़ाइन करें। यह तरीका वॉइस प्रीव्यू की सूची लौटाता है। हर प्रीव्यू में generated_voice_id और base64-एन्कोडेड mp3 ऑडियो के रूप में वॉइस का एक सैंपल होता है। वॉइस बनाने के लिए पसंदीदा प्रीव्यू के generated_voice_id को /v1/text-to-voice एंडपॉइंट के साथ इस्तेमाल करें।

Headers

xi-api-keystringOptional

Query parameters

output_formatenumOptional
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।

Request

This endpoint expects an object.
voice_descriptionstringRequired20-1000 characters

बनाई गई वॉइस के लिए इस्तेमाल किया जाने वाला विवरण।

model_idenumOptionalDefaults to eleven_multilingual_ttv_v2

वॉइस जनरेशन के लिए इस्तेमाल किया जाने वाला मॉडल। संभावित मान: eleven_multilingual_ttv_v2, eleven_ttv_v3।

Allowed values:
textstring or nullOptional100-1000 characters

जनरेट करने के लिए टेक्स्ट, जिसकी लंबाई 100 से 1000 के बीच होनी चाहिए।

auto_generate_textbooleanOptionalDefaults to false

क्या वॉइस विवरण के लिए उपयुक्त टेक्स्ट अपने-आप जनरेट करना है।

loudnessdoubleOptional-1-1Defaults to 0.5

जनरेट की गई वॉइस का वॉल्यूम स्तर नियंत्रित करता है। -1 सबसे धीमा, 1 सबसे तेज़ है और 0 लगभग -24 LUFS के बराबर है।

seedinteger or nullOptional0-2147483647

वॉइस जनरेशन को नियंत्रित करने वाली रैंडम संख्या। समान इनपुट के साथ वही seed इस्तेमाल करने पर वही वॉइस बनती है।

guidance_scaledoubleOptional0-100Defaults to 5

यह नियंत्रित करता है कि AI प्रॉम्प्ट का कितनी बारीकी से पालन करे। कम संख्याएं AI को रचनात्मक होने की अधिक आज़ादी देती हैं, जबकि अधिक संख्याएं उसे प्रॉम्प्ट पर अधिक टिके रहने के लिए बाध्य करती हैं। अधिक संख्याओं से वॉइस कृत्रिम या रोबोटिक लग सकती है। हम कम Guidance Scale पर लंबे और अधिक विस्तृत प्रॉम्प्ट इस्तेमाल करने की सलाह देते हैं।

stream_previewsbooleanOptionalDefaults to false

यह तय करता है कि रिस्पॉन्स में टेक्स्ट टू वॉइस प्रीव्यू शामिल किए जाएं या नहीं। अगर true है, तो केवल जनरेट किए गए IDs लौटाए जाएंगे, जिन्हें फिर /v1/text-to-voice/:generated_voice_id/stream एंडपॉइंट से स्ट्रीम किया जा सकता है।

should_enhancebooleanOptionalDefaults to false

क्या अधिक विवरण जोड़ने और वॉइस जनरेशन की गुणवत्ता सुधारने के लिए AI का उपयोग करके वॉइस विवरण बेहतर करना है। सक्षम होने पर सिस्टम सामान्य प्रॉम्प्ट को अपने-आप अधिक विस्तृत वॉइस विवरण में बदल देगा। डिफ़ॉल्ट रूप से False है

remixing_session_idstring or nullOptional

रीमिक्सिंग सेशन id।

remixing_session_iteration_idstring or nullOptional

उस रीमिक्सिंग सेशन इटरेशन की id जिसमें ये जनरेशन संलग्न की जानी चाहिए। न देने पर नया इटरेशन बनाया जाएगा।

qualitydouble or nullOptional-1-1

उच्च गुणवत्ता से बेहतर वॉइस आउटपुट मिलता है, लेकिन विविधता कम होती है।

reference_audio_base64string or nullOptional

वॉइस जनरेशन के लिए इस्तेमाल होने वाला रेफ़रेंस ऑडियो। ऑडियो base64 एन्कोडेड होना चाहिए। केवल eleven_ttv_v3 मॉडल इस्तेमाल करने पर समर्थित है।

prompt_strengthdouble or nullOptional0-1

वॉइस सैंपल जनरेट करते समय प्रॉम्प्ट और रेफ़रेंस ऑडियो के बीच संतुलन नियंत्रित करता है। 0 का मतलब है प्रॉम्प्ट का लगभग कोई प्रभाव नहीं और 1 का मतलब है रेफ़रेंस ऑडियो का लगभग कोई प्रभाव नहीं। यह केवल eleven_ttv_v3 मॉडल के साथ समर्थित है।

Response

सफल रिस्पॉन्स

previewslist of objects

जनरेट की गई वॉइसेस के प्रीव्यू।

textstring

वॉइस का प्रीव्यू देने के लिए इस्तेमाल किया गया टेक्स्ट।

Errors

409
Conflict Error
422
Unprocessable Entity Error