पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

टाइमस्टैंप और इवेंट टैगिंग के साथ ऑडियो ट्रांसक्रिप्शन कैसे काम करता है?

लेखक
Jack Limebear
प्रकाशित

सुनेंइस आर्टिकल को सुनें

एक नेटिव शब्द-स्तरीय ट्रांसक्रिप्शन मॉडल ऑडियो रिकॉर्डिंग या रियल-टाइम स्ट्रीम को इनपुट के रूप में लेता है और बोलचाल व गैर-बोलचाल की ध्वनियों को दर्शाने वाले टैग किए गए, टाइमस्टैंपयुक्त टोकन ऑब्जेक्ट्स की एक संरचित ऐरे आउटपुट करता है। हर टोकन तीन में से एक प्रकार का होता है: word, spacing या audio_event। ऑडियो इवेंट में हंसी, तालियां या अन्य बैकग्राउंड ध्वनियां हो सकती हैं।

इस लेख में हम जानेंगे कि टाइमस्टैंप के साथ ऑडियो ट्रांसक्रिप्शन कैसे काम करता है और यह फोर्स्ड अलाइनमेंट पर निर्भर पारंपरिक ट्रांसक्रिप्शन से अधिक लचीला और शक्तिशाली क्यों है।

सारांश

  • शब्द-स्तरीय ट्रांसक्रिप्शन सीधे बोलचाल के डेटा और गैर-मौखिक ऑडियो इवेंट्स की संरचित, टाइमस्टैंपयुक्त ऐरे आउटपुट करता है।
  • यह पारंपरिक ऑटोमैटिक स्पीच रिकग्निशन मॉडल्स से अलग है, जो टेक्स्ट के पूरे ब्लॉक आउटपुट करते हैं। उन्हें रॉ ऑडियो के साथ टाइमस्टैंप करने के लिए आपको दूसरी फोर्स्ड-अलाइनमेंट प्रक्रिया चलानी पड़ती है, जिसमें अधिक समय और कंप्यूट संसाधन लगते हैं।
  • इवेंट टैग आपको हंसी या तालियों जैसी गैर-मौखिक सामग्री कैप्चर करने में मदद करते हैं। यह डेटा खोजा जा सकता है, इसलिए आप ऑडियंस की प्रतिक्रियाओं के आधार पर हाइलाइट्स या वायरल पलों की पहचान कर सकते हैं।
  • आप संरचित आउटपुट डेटा को कई उपयोग मामलों के लिए ऐप्लिकेशन्स में भेज सकते हैं, जिनमें अत्यधिक सटीक कैप्शनिंग, खोजे जा सकने वाले ऑडियो आर्काइव और ऑटोमेटेड सोशल क्लिपिंग शामिल हैं।
  • Scribe का शब्द-स्तरीय ट्रांसक्रिप्शन अधिकतम 5 चैनलों को सपोर्ट करता है, जिनमें से हर एक का स्वतंत्र रूप से ट्रांसक्रिप्शन होता है।

टाइमस्टैंप और इवेंट टैग्स के साथ ऑडियो ट्रांसक्रिप्शन क्या है?

टाइमस्टैंपयुक्त ट्रांसक्रिप्शन ऑटोमैटिक स्पीच रिकग्निशन (ASR) का एक रूप है, जो ट्रांसक्राइब करते समय शब्दों और तालियों जैसे अन्य ऑडियो इवेंट्स के सटीक शुरू और खत्म होने के समय को ट्रैक करता है। इसका आउटपुट पूरी तरह संरचित, नेविगेट किया जा सकने वाला डेटा होता है।

पारंपरिक ASR ट्रांसक्रिप्शन ऑडियो को इंसानों के पढ़ने योग्य टेक्स्ट के बड़े ब्लॉक्स में पार्स करता है। यह आपको कैप्शन और मानव पाठकों के लिए ट्रांसक्रिप्ट देता है, लेकिन डेटा के रूप में बहुत उपयोगी नहीं होता।

अगर आप इसे टाइमस्टैंप के साथ संरचित करना चाहते हैं, तो टेक्स्ट को ऑडियो से मैप करने के लिए आपको इसे दोबारा किसी सेकेंडरी मशीन लर्निंग सेवा से चलाना होगा। आप आखिरकार समान आउटपुट बना सकते हैं, लेकिन यह API से नेटिव रूप से मिलने के बजाय कई प्रोसेसिंग स्टेप्स लेता है, जिससे कुछ लेटेंसी और अतिरिक्त कंप्यूट ओवरहेड जुड़ता है।

ऑडियो में नेविगेशन जोड़ना

टाइमस्टैंपयुक्त, इवेंट-टैग्ड ट्रांसक्रिप्शन का मुख्य लाभ यह है कि इसे इंसान और मशीन, दोनों पढ़ सकते हैं। इसके कुछ महत्वपूर्ण व्यावसायिक उपयोग हैं:

  • कंप्लायंस ऑडिटिंग: आप कीवर्ड्स के लिए ट्रांसक्रिप्शन में खोज कर सकते हैं और संवेदनशील डेटा के किसी भी उल्लेख के सटीक टाइमस्टैंप पा सकते हैं।
  • वीडियो प्रोडक्शन और एडिटिंग: वीडियो प्रोडक्शन सॉफ़्टवेयर स्क्रीन पर कही जा रही बातों के साथ सबटाइटल्स को मिलीसेकंड तक सिंक्रनाइज़ कर सकता है। यह ऑडियंस की प्रतिक्रियाओं को भी सही ढंग से लेबल कर सकता है।
  • खोजे जा सकने वाले आर्काइव: जनसंपर्क, सेल्स और ट्रेनिंग टीमें, अन्य टीमों के साथ, ग्राहक इंटरव्यू, ट्रेड शो भाषण, वेबिनार या टाउन हॉल की बड़ी मात्रा को विशाल, खोजे जा सकने वाले आर्काइव में ट्रांसक्राइब कर सकती हैं।
  • मार्केटिंग एनालिटिक्स और ग्राहक भावना: इवेंट टैगिंग ऑडियंस की उन प्रतिक्रियाओं को लेबल कर सकती है जो सामान्य टेक्स्ट ट्रांसक्रिप्शन में छूट सकती हैं।

नेटिव शब्द-स्तरीय टाइमस्टैंप पाने के क्या फायदे हैं?

मानक स्पीच टू टेक्स्ट मॉडल बोली को प्रोसेस करते हैं छोटे भागों में, आमतौर पर पूरे वाक्यों या पैराग्राफ़ के रूप में। अगर आपको शब्द-दर-शब्द टाइमस्टैंपिंग चाहिए, तो दूसरे पास में फोर्स्ड अलाइनमेंट करने के लिए आपको एक और प्रोसेसिंग लेयर बनानी होगी। इससे इन्फ्रास्ट्रक्चर और लेटेंसी बढ़ती है, साथ ही फेल होने के संभावित बिंदु भी अधिक होते हैं। उदाहरण के लिए, तेज़ बोली या तेज़ बैकग्राउंड शोर में दबी बोली को प्रोसेस करते समय टाइमिंग खिसक सकती है या प्रक्रिया पूरी तरह विफल हो सकती है।

टाइमस्टैंपयुक्त ट्रांसक्रिप्शन, जैसा कि Scribe करता है, शब्द-दर-शब्द अधिक बारीकी से ट्रांसक्राइब करके इस समस्या से बचता है। यह एक ही API कॉल में ऐसा करता है। किसी अतिरिक्त इन्फ्रास्ट्रक्चर या स्क्रिप्टिंग की जरूरत नहीं होती। मॉडल ट्रांसक्राइब करते समय ही टाइमस्टैंप की गणना करता है, इसलिए स्पीच डेटा हमेशा ऑडियो को सटीक रूप से दर्शाता है।

Audio transcription with timestamps guide. Native transcription provides word timestamps in one API call, avoiding forced-alignment drift.

टाइमस्टैंपयुक्त, इवेंट-टैग्ड ट्रांसक्रिप्शन कैसे काम करता है?

आइए Scribe को उदाहरण के रूप में लें।

एक नेटिव शब्द-स्तरीय ट्रांसक्रिप्शन मॉडल ऑडियो फ़ीड में मौजूद बोलचाल की ध्वनियों को टोकन ऑब्जेक्ट्स की संरचित ऐरे में मैप करता है। यह हर टोकन को तीन प्रकारों में से एक के रूप में लेबल करता है: word, spacing या audio_event।

  • word: पहचाना गया एक अलग बोला गया शब्द, जिसमें शुरू और खत्म होने का समय तथा speaker_id टैग होता है।
  • spacing: स्पष्ट रूप से टैग किया गया सन्नाटा या बोलते समय का विराम। कैप्शनिंग सेवाओं को सही गति बनाए रखने में उपयोगी। उन पहचानी गई भाषाओं में इस्तेमाल नहीं होता जिनमें शब्दों के बीच स्पेस नहीं होते, जैसे जापानी, मंदारिन, थाई, लाओ, बर्मी और कैंटोनीज़।
  • audio_event: अर्थपूर्ण गैर-मौखिक ऑडियो, जैसे हंसी या तालियां। मॉडल इन्हें अलग इवेंट टाइप के रूप में संरचित करता है और ऑडियो को काल्पनिक बोली में बदलने की कोशिश नहीं करता।
Timestamped token array separates speech, silence, and laughter across two speakers.

रियल-टाइम स्ट्रीमिंग पैरामीटर्स

शब्द-स्तरीय ट्रांसक्रिप्शन मॉडल लाइव WebSocket ऑडियो ट्रांसक्रिप्शन को सपोर्ट करने के लिए विशेष सुविधाएं भी शामिल कर सकते हैं। उदाहरण के लिए:

  • include_timestamps=true: यह पैरामीटर कनेक्शन को हर फ़ाइनलाइज़्ड ऑडियो चंक के आखिर में भेजे गए committed_transcript_with_timestamps JSON मैसेज में शब्द-स्तरीय टाइमस्टैंप शामिल करने के लिए कहता है, ताकि स्ट्रीम चलते समय ही आपको टाइमस्टैंप मिल जाएं। ऑडियो इवेंट टैग केवल तब शामिल होते हैं जब tag_audio_events भी सक्षम हो।
  • include_language_detection=true: यह पैरामीटर कनेक्शन को मॉडल के डिटेक्शन कॉन्फिडेंस स्कोर के साथ पहचानी गई अलग-अलग बोली जाने वाली भाषाओं को टैग करने के लिए कहता है। इससे आप लाइव मल्टी-लैंग्वेज कैप्शनिंग चला सकते हैं।

स्पीच टू टेक्स्ट मॉडल गैर-बोलचाल इवेंट्स को कैसे टैग करता है?

जब आप tag_audio_events पैरामीटर सक्षम करते हैं, तो Scribe ऑडियो इवेंट्स को टैग करता है। यह शब्दों की तरह ही उनके शुरू और खत्म होने के सटीक समय को टैग और टाइमस्टैंप करता है। यह कई तरह की प्रतिक्रियाओं को टैग कर सकता है, जिनमें सबसे आम हैं हंसी और तालियां, साथ ही ऐसे अन्य परिवेशी साउंड्स भी जो संदर्भ के अनुसार मायने रखते हों, जैसे कदमों की आवाज़ या बैकग्राउंड संगीत।

सबसे सीधे स्तर पर, यह महत्वपूर्ण संदर्भ जोड़कर ट्रांसक्रिप्ट और कैप्शनिंग को अधिक समृद्ध बनाता है। साधारण, सपाट टेक्स्ट पढ़ते समय पाठक के लिए व्यंग्य समझना कठिन हो सकता है। [laughter] टैग ट्रांसक्रिप्ट को समृद्ध करता है और उसे भावनात्मक रूप से अधिक प्रभावशाली बनाता है।

बेहतर एनालिटिक्स

इवेंट टैगिंग आपके डाउनस्ट्रीम एनालिटिक्स को भी अधिक साफ़ बनाती है, क्योंकि उन टूल्स को असंरचित टेक्स्ट के एक ही ब्लॉक को पार्स नहीं करना पड़ता। नेटिव शब्द-स्तरीय ट्रांसक्रिप्शन ऑडियो इवेंट्स को संरचित डेटा के रूप में अलग करता है, इसलिए आपके टूल्स जरूरत पड़ने पर उन्हें फ़िल्टर कर सकते हैं और केवल मौखिक सामग्री पर काम कर सकते हैं।

spacing टोकन विरामों को दिखाई देने योग्य बनाते हैं, इसलिए आप उनका विश्लेषण कर सकते हैं। यह सेंटिमेंट एनालिसिस और QA उपयोग मामलों के लिए उपयोगी हो सकता है, जैसे यह मापना कि ग्राहक सेवा एजेंट कॉल के दौरान कितनी देर तक चुप रहा।

टाइमस्टैंप खोजना हुआ आसान

या आप इन्हें खास तौर पर खोज सकते हैं। अगर आप किसी प्रोडक्ट टेस्टिंग इंटरव्यू पर सेंटिमेंट एनालिसिस कर रहे हैं, तो आप महत्वपूर्ण भावनात्मक प्रतिक्रियाएं अलग से निकाल सकते हैं। या अगर आप कोई सोशल अकाउंट चला रहे हैं, तो एक घंटे के भाषण में हंसी को तुरंत खोजकर उन क्लिप्स को ढूंढ सकते हैं जिनके वायरल होने की संभावना सबसे अधिक है।

बड़े पैमाने पर अपने ऐप्लिकेशन्स में STT इंटीग्रेट करें

कुछ और चाहिए? देखें हमारा सहायता केंद्र

संरचित, टाइमस्टैंपयुक्त ट्रांसक्रिप्ट के व्यावहारिक उपयोग क्या हैं?

ट्रांसक्रिप्शन में नेटिव रूप से संरचित डेटा मिलने के कई महत्वपूर्ण उपयोग हैं।

कैप्शन और सबटाइटल जनरेशन

आप बिना किसी बीच की प्रोसेसिंग के टाइमस्टैंपयुक्त ट्रांसक्रिप्ट को सीधे SRT और VTT समेत प्रोडक्शन कैप्शनिंग फ़ॉर्मेट्स में एक्सपोर्ट कर सकते हैं। आपका वीडियो एडिटिंग टूल कैप्शन में शब्दों को बोले जाने के समय हाइलाइट करने के लिए शब्दों की टाइमिंग का उपयोग कर सकता है।

ट्रांसक्रिप्शन मॉडल तेज़ बोली को आसानी से पार्स कर सकता है क्योंकि यह उसे शब्द-दर-शब्द प्रोसेस करता है। जहां पारंपरिक मॉडल तेज़ रफ्तार बोली या एक-दूसरे पर चढ़ती आवाज़ों में अटक सकता है, वहीं Scribe जैसा शब्द-स्तरीय मॉडल साफ़, संरचित ट्रांसक्रिप्शन आउटपुट कर सकता है।

ऑडियो और वीडियो खोज

पारंपरिक ट्रांसक्रिप्शन आपको टेक्स्ट ब्लॉक में कीवर्ड्स मिलाने देता है, लेकिन फोर्स्ड अलाइनमेंट के बिना आप उस क्षण पर नहीं जा सकते जब कोई वाक्यांश बोला गया था। शब्द-स्तरीय ट्रांसक्रिप्शन पर कीवर्ड खोज पूरी तरह इंडेक्स्ड होती है और आपको ऑडियो में उस सटीक सेकंड पर ले जाती है जब वाक्यांश बोला गया था। इससे आपका ऑडियो आर्काइव एक पूरी तरह खोजे जा सकने वाले रेफरेंस कैटलॉग में बदल जाता है। यह क्षमता बड़ी मीडिया लाइब्रेरी, पॉडकास्ट नेटवर्क और कॉर्पोरेट आर्काइव मैनेज करने में खास तौर पर उपयोगी है।

कंप्लायंस और जोखिम ऑडिटिंग

कई बार आपको संवेदनशील जानकारी वाले ऑडियो रिकॉर्ड करने होंगे, जैसे QA के लिए ग्राहक सेवा कॉल रिकॉर्ड करना। इन कॉल्स में संवेदनशील या विनियमित व्यक्तिगत जानकारी होने की संभावना सबसे अधिक होती है। 

एनालिटिक्स के लिए ऑडियो डेटा रखते हुए भी कंप्लायंट बने रहने के लिए, आपको ट्रांसक्रिप्ट से रियल टाइम में संवेदनशील डेटा हटाने का तरीका चाहिए। नेटिव शब्द-स्तरीय टाइमस्टैंपिंग आपको ElevenLabs की एंटिटी डिटेक्शन जैसी सुविधाओं का लाभ लेने देती है, जो संवेदनशील एंटिटीज़ (जैसे क्रेडिट कार्ड नंबर या नाम) को फ़्लैग करती है और उनके ऑफ़सेट व टाइमस्टैंप लौटाती है, ताकि आप स्ट्रीम में आते ही उन्हें अपने ट्रांसक्रिप्ट में छिपा सकें।

उदाहरण के लिए, आप पहचान सत्यापित करने वाली कॉल पर क्रेडिट कार्ड नंबर, मां का विवाह-पूर्व उपनाम, जन्मतिथि और ग्राहक का नाम बोले जाते ही पहचानकर हटा सकते हैं।

ऑटोमेटेड सोशल मीडिया क्लिपिंग

लंबे फ़ॉर्मेट वाले कंटेंट में हाइलाइट्स ढूंढने के लिए आप कीवर्ड खोजों को प्रोग्राम के जरिए ऑटोमेट भी कर सकते हैं। उदाहरण के लिए, आप किसी चुनावी भाषण या कॉर्पोरेट सेमिनार के महत्वपूर्ण पलों को हाइलाइट कर सकते हैं। इससे आप हालिया कंटेंट को YouTube, LinkedIn या TikTok के लिए प्रोफेशनल तरीके से एडिट किए गए हाइलाइट्स में बदल सकते हैं।

मल्टीचैनल और मल्टी-स्पीकर टाइमिंग

Scribe पांच चैनलों तक का स्वतंत्र और समानांतर रूप से ट्रांसक्रिप्शन कर सकता है। हर चैनल को एक स्पीकर ID और टाइमस्टैंपिंग मिलती है। यह मानक अकूस्टिक स्पीकर डायराइज़ेशन से अधिक भरोसेमंद है, जिसे अक्सर बारी-बारी से होने वाले संवाद में मुश्किल होती है। मल्टीचैनल रिकॉर्डिंग्स के लिए Scribe का स्पीकर असाइनमेंट पूरी तरह डिटरमिनिस्टिक होता है। यानी चैनल 0 speaker_0 से, चैनल 1 speaker_1 से मैप होता है, और इसी तरह आगे।

यह एक साथ बोलने की कोशिश कर रहे स्पीकर्स को पहचान सकता है और फिर भी उनकी बोली के लिए स्वतंत्र टाइमस्टैंप बना सकता है। वे अलग-अलग भाषाओं में भी बोल सकते हैं।

Multichannel transcription keeps five channels separate, mapping each to speaker 0–4.

अपनी जरूरत के फ़ॉर्मेट में टाइमस्टैंपयुक्त डेटा एक्सपोर्ट करना

अगर आप पारंपरिक ट्रांसक्रिप्शन को कई फ़ॉर्मेट्स में वितरित करना चाहते हैं, तो संभवतः आपको खुद पार्सिंग स्क्रिप्ट्स लिखनी होंगी। Scribe आपके उपयोग के आधार पर ट्रांसक्रिप्शन को कई फ़ॉर्मेट्स में एक्सपोर्ट कर सकता है। आप पूरी स्कीमा परिभाषाएं ElevenLabs क्रिएट ट्रांसक्रिप्ट API रेफरेंस में देख सकते हैं।

डेवलपर्स के लिए संरचित डेटा: JSON

Scribe उन डेवलपर्स के लिए JSON में एक्सपोर्ट को सपोर्ट करता है जिन्हें स्कीमा में ऐसा डेटा चाहिए जिसे वे डाउनस्ट्रीम ऐप्लिकेशन्स को भेज सकें। उदाहरण के लिए, डेवलपर्स इस JSON डेटा का उपयोग इंटरैक्टिव मीडिया या अपनी संस्था के लिए सिमैंटिक सर्च डेटाबेस बनाने में कर सकते हैं। word, spacing और audio_event टोकन्स की पूरी ऐरे शुरू और खत्म होने के ऑफ़सेट्स व स्पीकर IDs के साथ आउटपुट होती है।

मीडिया कैप्शनिंग: SRT और VTT

Scribe SRT और VTT ट्रांसक्रिप्ट आउटपुट कर सकता है, जिन्हें आप मैन्युअल सिंक्रनाइज़ेशन के बिना सीधे Adobe Premiere या अन्य प्रोडक्शन ऐप्लिकेशन्स में भेज सकते हैं।

मानव-पठनीय: TXT, DOCX और PDF

यह ट्रांसक्रिप्ट को पाठक-अनुकूल फ़ॉर्मेट्स में भी आउटपुट कर सकता है। इन फ़ॉर्मेट्स में Scribe टेक्स्ट को अधिक पठनीय और कानूनी या ऑडिट दस्तावेज़ों के लिए उपयुक्त बनाने हेतु निम्न-स्तरीय टाइमिंग मार्कर्स हटा देता है। उदाहरण के लिए, जब आपको किसी सत्र के तुरंत बाद बोर्ड मीटिंग के मिनट्स कुशलता से वितरित करने हों, SEO के लिए पॉडकास्ट ट्रांसक्रिप्ट प्रकाशित करने हों या कानूनी रिकॉर्ड आर्काइव करने हों, तब यह उपयोगी है।

Scribe exports one transcript as JSON, SRT/VTT, or TXT/DOCX/PDF for different uses.

ElevenLabs के टाइमस्टैंपयुक्त, इवेंट-टैग्ड ट्रांसक्रिप्शन का इस्तेमाल शुरू करें 

नेटिव शब्द-स्तरीय ट्रांसक्रिप्शन आपको अपने वर्कफ़्लोज़ के लिए जरूरी संरचित डेटा तेज़ी और कुशलता से देता है।

आज ही अपने ऑडियो को Scribe के साथ ElevenAPI में ट्रांसक्राइब करना शुरू करें या शब्द-स्तरीय ट्रांसक्रिप्शन के बारे में और जानें।

टाइमस्टैंप और इवेंट-टैग्ड ट्रांसक्रिप्शन FAQ

लेखक

Jack Limebear हमारी ग्रोथ टीम में हैं और ब्लॉग व इनसाइट्स पेज के लिए कंटेंट राइटर और स्ट्रैटेजिस्ट के तौर पर काम करते हैं। ElevenLabs से पहले, उन्होंने दस साल से ज़्यादा समय तक तेज़ी से बढ़ती SaaS स्टार्टअप्स से लेकर Fortune 500 कंपनियों तक के लिए कंटेंट स्ट्रैटेजी लीड की है। उनके पास यूनिवर्सिटी ऑफ़ कैम्ब्रिज से इंग्लिश लिटरेचर में मास्टर डिग्री है।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं