ट्रांसक्रिप्ट बनाएं

किसी ऑडियो या वीडियो फ़ाइल को ट्रांसक्राइब करें। अगर webhook को true सेट किया गया है, तो अनुरोध असिंक्रोनस रूप से प्रोसेस होगा और नतीजे कॉन्फ़िगर किए गए webhooks को भेजे जाएंगे। जब use_multi_channel true हो और दिए गए ऑडियो में कई चैनल हों, तो हर चैनल के लिए अलग ट्रांसक्रिप्ट वाला 'transcripts' ऑब्जेक्ट लौटाया जाता है; इसके बजाय सभी चैनलों को मिलाकर और समय के अनुसार क्रमबद्ध एक ट्रांसक्रिप्ट पाने के लिए multichannel_output_style='combined' सेट करें। अन्यथा, एक ट्रांसक्रिप्ट लौटता है। वैकल्पिक webhook_metadata पैरामीटर से आप कस्टम डेटा जोड़ सकते हैं, जो अनुरोध सहसंबंध और ट्रैकिंग के लिए webhook जवाबों में शामिल होगा।

Headers

xi-api-keystringOptional

Query parameters

tokenstring or nullOptional
POST /v1/single-use-token/batch_scribe के ज़रिए बनाया गया एकल-उपयोग ऑथेंटिकेशन टोकन। यह टोकन केवल एक बार इस्तेमाल किया जा सकता है और 15 मिनट बाद समाप्त हो जाता है। फ्रंटएंड क्लाइंट्स के लिए API key या bearer token ऑथेंटिकेशन का विकल्प।
enable_loggingbooleanOptionalDefaults to true
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए log और transcript storage सुविधाएं उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।

Request

This endpoint expects a multipart form containing an optional file.
model_idstringRequired

ट्रांसक्रिप्शन के लिए उपयोग किए जाने वाले मॉडल की ID।

filefileOptional
ट्रांसक्राइब करने की फ़ाइल (न्यूनतम ऑडियो लंबाई 100ms)। सभी प्रमुख ऑडियो और वीडियो फ़ॉर्मैट समर्थित हैं। file या cloud_storage_url पैरामीटर में से ठीक एक देना ज़रूरी है। फ़ाइल का आकार 5.0GB से कम होना चाहिए।
language_codestring or nullOptional
ऑडियो फ़ाइल की भाषा से मेल खाता ISO-639-1 या ISO-639-3 language_code। पहले से पता होने पर यह कभी-कभी ट्रांसक्रिप्शन की परफ़ॉर्मेंस बेहतर कर सकता है। डिफ़ॉल्ट रूप से null होता है, जिसमें भाषा का अनुमान अपने-आप लगाया जाता है।
transcript_editstring or nullOptional
अंतिम ट्रांसक्रिप्ट पर लागू किया जाने वाला प्राकृतिक भाषा का निर्देश (अधिकतम 2000 वर्ण)। एडिट किया गया टेक्स्ट मूल ट्रांसक्रिप्ट के साथ 'edited_transcript' में लौटाया जाता है। इसे entity_detection, entity_redaction या use_multi_channel के साथ नहीं जोड़ा जा सकता। इस पैरामीटर के इस्तेमाल पर बेस ट्रांसक्रिप्शन लागत पर अतिरिक्त 30% शुल्क लगेगा और कम से कम 10 सेकंड के ऑडियो का बिल किया जाएगा।
tag_audio_eventsbooleanOptionalDefaults to true

ट्रांसक्रिप्शन में (हँसी), (कदमों की आहट) आदि ऑडियो इवेंट टैग करने हैं या नहीं।

num_speakersinteger or nullOptional1-32
अपलोड की गई फ़ाइल में बोलने वाले स्पीकर की अधिकतम संख्या। इससे यह अनुमान लगाने में मदद मिल सकती है कि कौन कब बोलता है। अनुमान लगाए जा सकने वाले स्पीकर की अधिकतम संख्या 32 है। डिफ़ॉल्ट रूप से यह null है; इस स्थिति में स्पीकर की संख्या मॉडल द्वारा समर्थित अधिकतम मान पर सेट होती है।
timestamps_granularityenumOptionalDefaults to word
ट्रांसक्रिप्शन में टाइमस्टैम्प की ग्रैन्युलैरिटी। 'word' शब्द-स्तर के टाइमस्टैम्प देता है और 'character' हर शब्द के लिए वर्ण-स्तर के टाइमस्टैम्प देता है।
Allowed values:
diarizebooleanOptionalDefaults to false

क्या अपलोड की गई फ़ाइल में इस समय बोल रहे स्पीकर को एनोटेट करना है।

diarization_thresholddouble or nullOptional0.1-0.4
स्पीकर डायराइज़ेशन के दौरान लागू की जाने वाली डायराइज़ेशन थ्रेशहोल्ड। ज़्यादा मान का मतलब है कि एक स्पीकर के दो अलग-अलग स्पीकर के रूप में डायराइज़ होने की संभावना कम होगी, लेकिन दो अलग-अलग स्पीकर के एक स्पीकर के रूप में डायराइज़ होने की संभावना ज़्यादा होगी (कुल अनुमानित स्पीकर कम)। कम मान का मतलब है कि एक स्पीकर के दो अलग-अलग स्पीकर के रूप में डायराइज़ होने की संभावना ज़्यादा होगी, लेकिन दो अलग-अलग स्पीकर के एक स्पीकर के रूप में डायराइज़ होने की संभावना कम होगी (कुल अनुमानित स्पीकर ज़्यादा)। इसे केवल तब सेट किया जा सकता है जब diarize=True और num_speakers=None हो। डिफ़ॉल्ट None है; इस स्थिति में हम model_id के आधार पर थ्रेशहोल्ड चुनेंगे (आमतौर पर 0.22)।
additional_formatslist of objectsOptional

ट्रांसक्रिप्ट एक्सपोर्ट करने के लिए अतिरिक्त फ़ॉर्मैट की सूची।

file_formatenumOptionalDefaults to other
इनपुट ऑडियो का फ़ॉर्मैट। विकल्प हैं 'pcm_s16le_16' या 'other'। `pcm_s16le_16` के लिए, इनपुट ऑडियो 16kHz सैंपल रेट, सिंगल चैनल (मोनो) और लिटल-एंडियन बाइट ऑर्डर वाला 16-बिट PCM होना चाहिए। एन्कोडेड वेवफ़ॉर्म देने की तुलना में लेटेंसी कम होगी।
Allowed values:
cloud_storage_urlstring or nullOptionalDeprecated
[बहिष्कृत] यह पैरामीटर बहिष्कृत है और भविष्य में हटा दिया जाएगा। इसके बजाय 'source_url' इस्तेमाल करें। ट्रांसक्राइब की जाने वाली फ़ाइल का HTTPS URL। file या cloud_storage_url पैरामीटर में से ठीक एक देना ज़रूरी है। फ़ाइल HTTPS के ज़रिए उपलब्ध होनी चाहिए और उसका आकार 2GB से कम होना चाहिए। कोई भी मान्य HTTPS URL स्वीकार किया जाता है, जिसमें क्लाउड स्टोरेज प्रदाताओं (AWS S3, Google Cloud Storage, Cloudflare R2 आदि), CDN या किसी अन्य HTTPS स्रोत के URL शामिल हैं। URL पहले से हस्ताक्षरित हो सकते हैं या query parameters में authentication tokens शामिल कर सकते हैं।
source_urlstring or nullOptional
ट्रांसक्राइब करने के लिए ऑडियो या वीडियो फ़ाइल का URL। होस्ट की गई वीडियो या ऑडियो फ़ाइलों, YouTube वीडियो URL, TikTok वीडियो URL और अन्य वीडियो होस्टिंग सेवाओं का समर्थन करता है।
webhookbooleanOptionalDefaults to false
ट्रांसक्रिप्शन परिणाम को कॉन्फ़िगर किए गए स्पीच टू टेक्स्ट वेबहुक पर भेजना है या नहीं। सेट होने पर, रिक्वेस्ट ट्रांसक्रिप्शन के बिना जल्दी लौटेगी और ट्रांसक्रिप्शन बाद में वेबहुक के ज़रिए भेजा जाएगा।
webhook_idstring or nullOptional
ट्रांसक्रिप्शन परिणाम भेजने के लिए वैकल्पिक विशिष्ट webhook ID। यह केवल तब मान्य है जब webhook को true पर सेट किया गया हो। न दिए जाने पर, ट्रांसक्रिप्शन सभी कॉन्फ़िगर किए गए स्पीच टू टेक्स्ट webhooks पर भेजा जाएगा।
temperaturedouble or nullOptional0-2
ट्रांसक्रिप्शन आउटपुट की रैंडमनेस नियंत्रित करता है। 0.0 से 2.0 के बीच के मान स्वीकार करता है, जहाँ ज़्यादा मान से अधिक विविध और कम निश्चित नतीजे मिलते हैं। छोड़े जाने पर, हम आपके चुने हुए मॉडल के आधार पर तापमान इस्तेमाल करेंगे, जो आमतौर पर 0 होता है।
seedinteger or nullOptional0-2147483647
निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 2147483647 के बीच एक पूर्णांक होना चाहिए।
use_multi_channelbooleanOptionalDefaults to false
क्या ऑडियो फ़ाइल में कई channels हैं, जिनमें हर channel में एक ही speaker है। सक्षम होने पर, हर channel को स्वतंत्र रूप से ट्रांसक्राइब किया जाता है। डिफ़ॉल्ट रूप से हर channel के लिए अलग transcript लौटता है; सभी channels को मिलाकर और समय के हिसाब से क्रमबद्ध एक transcript पाने के लिए multichannel_output_style='combined' सेट करें। response के हर शब्द में 'channel_index' field होता है, जो बताता है कि वह किस channel में बोला गया था। अधिकतम 5 channels समर्थित हैं। हर channel का बिल पूरे ऑडियो duration के हिसाब से अलग से बनता है, इसलिए लागत channels की संख्या के साथ रैखिक रूप से बढ़ती है।
multichannel_output_styleenumOptionalDefaults to separate
use_multi_channel सक्षम होने पर रिस्पॉन्स का स्वरूप नियंत्रित करता है। 'separate' (डिफ़ॉल्ट) 'transcripts' के अंतर्गत हर चैनल के लिए एक ट्रांसक्रिप्ट लौटाता है। 'combined' सभी चैनलों को एक ट्रांसक्रिप्ट में मर्ज करता है, जिसके शब्द शुरू होने के समय के अनुसार क्रमबद्ध होते हैं और हर शब्द में 'channel_index' होता है — जो सिंगल-चैनल रिस्पॉन्स स्वरूप से मेल खाता है। 'combined' के लिए टाइमस्टैंप आवश्यक हैं (timestamps_granularity 'none' नहीं होना चाहिए) और यह एंटिटी डिटेक्शन या रिडैक्शन का समर्थन नहीं करता।
Allowed values:
webhook_metadatastring or map from strings to any or nullOptional
webhook response में शामिल करने के लिए वैकल्पिक metadata। यह अधिकतम 2 levels की depth और 16KB के अधिकतम आकार वाले object का प्रतिनिधित्व करने वाली JSON string होनी चाहिए। internal IDs, job references या अन्य contextual information को track करने के लिए उपयोगी है।
entity_detectionstring or list of strings or nullOptional
ट्रांसक्रिप्ट में एंटिटीज़ का पता लगाएं। सभी एंटिटीज़ का पता लगाने के लिए 'all', किसी एक एंटिटी प्रकार या कैटेगरी स्ट्रिंग, या एंटिटी प्रकारों/कैटेगरी की सूची दी जा सकती है। कैटेगरी में 'pii', 'phi', 'pci', 'other', 'offensive_language' शामिल हैं। सक्षम होने पर, मिली हुई एंटिटीज़ उनके टेक्स्ट, प्रकार और कैरेक्टर पोज़िशन के साथ 'entities' फ़ील्ड में लौटाई जाएंगी। इस पैरामीटर के इस्तेमाल पर बेस ट्रांसक्रिप्शन लागत पर अतिरिक्त 30% शुल्क लगेगा।
no_verbatimbooleanOptionalDefaults to false

अगर true है, तो ट्रांसक्रिप्शन में filler words, गलत शुरुआतें और गैर-भाषण ध्वनियां नहीं होंगी। केवल scribe_v2 मॉडल के साथ समर्थित है।

use_speaker_librarybooleanOptionalDefaults to false
डायराइज़ेशन के दौरान जाने-पहचाने स्पीकर्स की पहचान करने के लिए स्पीकर लाइब्रेरी इस्तेमाल करनी है या नहीं। सक्षम होने और diarize के true होने पर, पहचाने गए स्पीकर्स का मिलान वर्कस्पेस की स्पीकर लाइब्रेरी में रजिस्टर्ड स्पीकर्स से किया जाएगा।
detect_speaker_rolesbooleanOptionalDefaults to false
क्या स्पीकर की भूमिकाएँ (एजेंट बनाम ग्राहक) पहचाननी हैं। इसके लिए diarize=true आवश्यक है। इसे use_multi_channel=true के साथ इस्तेमाल नहीं किया जा सकता। सक्षम होने पर speaker_id वैल्यू 'speaker_0', 'speaker_1' आदि के बजाय 'agent' और 'customer' होंगी। इसके उपयोग पर बेस ट्रांसक्रिप्शन लागत का अतिरिक्त 10% शुल्क लगेगा।
entity_redactionstring or list of strings or nullOptional
ट्रांसक्रिप्ट टेक्स्ट से entities को redact करें। entity_detection जैसा ही फ़ॉर्मैट स्वीकार करता है: 'all', कोई category ('pii', 'phi') या विशेष entity types। यह entity_detection का subset होना चाहिए। redaction सक्षम होने पर entities फ़ील्ड वापस नहीं किया जाएगा। इस पैरामीटर के इस्तेमाल पर मूल ट्रांसक्रिप्शन लागत पर अतिरिक्त 30% शुल्क लगेगा।
entity_redaction_modestringOptionalDefaults to enumerated_entity_type
रिडैक्ट की गई एंटिटी को कैसे फ़ॉर्मैट करना है। 'redacted', {REDACTED} से बदलता है; 'entity_type', {ENTITY_TYPE} से बदलता है; और 'enumerated_entity_type', {ENTITY_TYPE_N} से बदलता है, जहां N हर घटना की क्रम संख्या है। सिर्फ़ entity_redaction सेट होने पर इस्तेमाल होता है।
keytermslist of stringsOptionalDefaults to []
ट्रांसक्रिप्शन को इन मुख्य शब्दों की ओर झुकाने के लिए उनकी सूची। मुख्य शब्द वे शब्द या वाक्यांश हैं जिन्हें आप चाहते हैं कि मॉडल अधिक सटीकता से पहचाने। मुख्य शब्दों की संख्या 1000 से अधिक नहीं हो सकती। हर मुख्य शब्द की लंबाई 50 वर्णों से कम होनी चाहिए। मुख्य शब्दों में अधिकतम 5 शब्द हो सकते हैं (नॉर्मलाइज़ेशन के बाद)। उदाहरण के लिए ["hello", "world", "technical term"]। ये वर्ण समर्थित नहीं हैं: `<`, `>`, `{`, `}`, `[`, `]`, `\`। इस पैरामीटर के उपयोग पर मूल ट्रांसक्रिप्शन लागत पर अतिरिक्त 20% शुल्क लगेगा। 100 से अधिक मुख्य शब्द देने पर, हर अनुरोध के लिए न्यूनतम बिल योग्य अवधि 20 सेकंड होगी।

Response

सिंक्रोनस ट्रांसक्रिप्शन नतीजा

SpeechToTextChunkResponseModelobject

टाइमिंग जानकारी के साथ ट्रांसक्रिप्शन का चंक-स्तरीय विवरण।

OR
MultichannelSpeechToTextResponseModelobject

मल्टीचैनल स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए रिस्पॉन्स मॉडल।

OR
SpeechToTextWebhookResponseModelobject

Errors

422
Unprocessable Entity Error