कंटेंट पर जाएं

ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

ऑडियो टैग ब्रैकेट में लिखे प्राकृतिक भाषा के संकेत होते हैं, जैसे [laughs], [gasps], [excited] और [worried], जिन्हें Eleven v3 बोलने वाले शब्दों के बजाय प्रदर्शन के निर्देश के रूप में पढ़ता है। टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते समय इन ऑडियो टैग को जोड़ने से आपको अपनी लिखी बात की भावनात्मक डिलीवरी पर बारीकी से नियंत्रण मिलता है।

Eleven v3 मार्च 2026 में सार्वजनिक रूप से उपलब्ध हुआ। v3 से पहले, टेक्स्ट टू स्पीच मॉडल से मनचाहा भावनात्मक प्रदर्शन पाना, कंटेंट को बार-बार जनरेट करने और सर्वश्रेष्ठ की उम्मीद करने जैसा था। ऑडियो टैग इस अंदाज़े को खत्म करते हैं और भावनात्मक टेक्स्ट टू स्पीच प्रदर्शन पर आपको पूरा नियंत्रण देते हैं।

इस गाइड में बताया गया है कि ऑडियो टैग क्या हैं, वे कैसे काम करते हैं, टैग की कौन-कौन सी श्रेणियां उपलब्ध हैं और उनकी तुलना SSML (स्पीच सिंथेसिस मार्कअप लैंग्वेज) से कैसे होती है। हम आम इस्तेमाल के मामलों को भी कवर करेंगे, जिनमें से हर एक की अपनी विस्तृत गाइड है।

संक्षेप में:

  • ऑडियो टैग, [shouts] या [excited] जैसे ब्रैकेट में लिखे संकेत हैं, जो Eleven v3 में TTS की भावना, गति, डिलीवरी और टोन को निर्देशित करते हैं।
  • Eleven v3, SSML को सपोर्ट नहीं करता, लेकिन अधिक स्वाभाविक लेखन अनुभव के लिए उसकी जगह ऑडियो टैग देता है।
  • टैग कई श्रेणियों में होते हैं, जैसे भावनाएं, डिलीवरी और गति, मानवीय प्रतिक्रियाएं, एक्सेंट और साउंड इफेक्ट्स।
  • आपके टेक्स्ट में विराम चिह्न और कैपिटल अक्षर, AI वॉइस प्रदर्शन की गति को आकार देने में मदद करते हैं।
  • आप ElevenLabs पर UI या API के जरिए ऑडियो टैग इस्तेमाल कर सकते हैं।

ऑडियो टैग कैसे काम करते हैं?

ऑडियो टैग आपके ट्रांसक्रिप्ट के बीच में लिखे जाते हैं और स्क्वेयर ब्रैकेट में होते हैं। जब भी आप डिलीवरी बदलना चाहें, मान लीजिए सामान्य से [worried] करना हो, तो बस एक ऑडियो टैग जोड़ दें।

आप एक ही वाक्य में एक से अधिक टैग भी इस्तेमाल कर सकते हैं और अधिक परतदार प्रदर्शन के लिए उन्हें मिला सकते हैं, जैसे [tired] आज का दिन बहुत लंबा था… [upset] मैं और कितने दिन सह सकता हूँ?

Eleven v3 के पीछे की आर्किटेक्चर मॉडल को पहले के मॉडल्स की तुलना में संदर्भ को अधिक गहराई से समझने देती है। इसलिए यह अलग पैरामीटर या सेटिंग की जरूरत के बिना भावनात्मक संकेतों, टोन में बदलाव, स्पीकर ट्रांज़िशन और संदर्भ संकेतों को फॉलो कर सकता है। बस मॉडल को बताइए कि उस पल की क्या जरूरत है, और यह लाइन को ठीक आपके प्लान के अनुसार पेश करेगा।

Eleven v3 केवल टैग और स्क्रिप्ट की संरचना से ही सहज लगने वाले मल्टी-स्पीकर डायलॉग भी संभालता है, जिनमें रुकावटें, मूड में बदलाव और असली बातचीत का स्वाभाविक आदान-प्रदान शामिल है।

ऑडियो टैग बनाम SSML

अगर आपने दूसरे TTS सिस्टम्स के साथ काम किया है, तो आपने शायद स्पीच सिंथेसिस मार्कअप लैंग्वेज देखी होगी। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफ़ॉर्म, TTS स्क्रिप्ट को अतिरिक्त संदर्भ देने के लिए <break> या <emphasis> जैसे SSML टैग इस्तेमाल करते हैं।

Eleven v3, SSML ब्रेक टैग या बाकी SSML टैग सेट को सपोर्ट नहीं करता। इसके बजाय, ऑडियो टैग, विराम चिह्न और टेक्स्ट की संरचना ही यह भूमिका निभाते हैं, साथ ही डिलीवरी पर बारीकी से नियंत्रण भी देते हैं।

नीचे दी गई तालिका से आप आम SSML टैग को उनके Eleven v3 विकल्पों से मैप कर सकते हैं।

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

लेखक के नज़रिए से, किसी लाइन में [whispers] जोड़ना प्रोसोडी रेट कॉन्फ़िगर करने से कहीं आसान है।

v3 में ऑडियो टैग की श्रेणियां: ऑडियो टैग से प्रदर्शन को निर्देशित करें

आप रियल टाइम में डिलीवरी को आकार देने के लिए अपनी स्क्रिप्ट में कहीं भी ऑडियो टैग लगा सकते हैं। आप स्क्रिप्ट में या एक ही वाक्य में टैग के कॉम्बिनेशन भी इस्तेमाल कर सकते हैं।

टैग इन मुख्य श्रेणियों में आते हैं।

भावनाएं

ये टैग वॉइस का भावनात्मक टोन तय करने में मदद करते हैं, चाहे वह उदास, तीव्र या उत्साहपूर्ण हो। उदाहरण के लिए, आप [sad], [angry], [happily] और [sorrowful] में से एक या इनके कॉम्बिनेशन का इस्तेमाल कर सकते हैं।

Background
Background

डिलीवरी और गति

ये टोन और प्रदर्शन से अधिक जुड़े होते हैं। जिन दृश्यों में संयम या प्रभाव की जरूरत हो, उनमें वॉल्यूम और ऊर्जा समायोजित करने के लिए आप इन टैग का इस्तेमाल कर सकते हैं। उदाहरणों में [whispers], [shouts] और [softly] जैसे टैग शामिल हैं।

Background
Background

मानवीय प्रतिक्रियाएं

वास्तविक प्राकृतिक बोलचाल में प्रतिक्रियाएं शामिल होती हैं। उदाहरण के लिए, आप बोलचाल में स्वाभाविक, बिना स्क्रिप्ट वाले पल जोड़कर उसे अधिक वास्तविक बना सकते हैं। [laughs], [clears throat] और [sighs] जैसे टैग, मानवीय भावनाएं पेश कर सकने वाला TTS मॉडल बनाने में मदद करते हैं।

अलग-अलग ऑडियो टैग श्रेणियों के अन्य उदाहरण:

  • एक्सेंट और कैरेक्टर वॉइस: एक्सेंट टैग, मॉडल बदले बिना वॉइस को किसी खास क्षेत्र या व्यक्तित्व में बदल देते हैं, जैसे [French accent], [British accent] या [pirate voice]। इनसे एक ही वॉइस को स्थिर प्रदर्शन के बजाय एक लचीले कलाकारों के समूह में बदला जा सकता है।
  • साउंड इफेक्ट्स: साउंड इफेक्ट टैग सीधे जनरेशन में गैर-वाचिक ऑडियो जोड़ते हैं, जैसे [gunshot], [explosion] और [clapping]। ये इमर्सिव ऑडियो, गेम्स और नाटकीय नैरेशन के लिए अच्छे हैं, जहां दृश्य को सिर्फ एक वॉइस से अधिक की जरूरत होती है। विकल्प के तौर पर ElevenCreative AI साउंड इफेक्ट जनरेटर इस्तेमाल करें।

हालांकि टैग आपको काफी नियंत्रण देते हैं, लेकिन आप लय और ज़ोर को आकार देने के लिए विराम चिह्नों का भी इस्तेमाल कर सकते हैं। उदाहरण के लिए, प्राकृतिक विराम के लिए इलिप्सिस जोड़ें या स्वाभाविक सांस लेने का पैटर्न बनाने के लिए कॉमा इस्तेमाल करें। ज़ोर देने के लिए किसी शब्द को सभी कैपिटल अक्षरों में लिखकर देखें: “मुझे यह अभी इसी वक्त चाहिए।”

Background
Background

आप ऑडियो टैग से क्या कर सकते हैं?

ऑडियो टैग सहज तरीके से स्क्रिप्ट की भावनात्मक जटिलता को उजागर करते हैं। स्वाभाविक रूप से लिखें और लिखते समय टैग जोड़ते जाएं।

यहां ऑडियो टैग के साथ भावनात्मक TTS के कुछ इस्तेमाल के मामलों की एक झलक दी गई है।

AI ऑडियो में स्थितिजन्य समझ

[whisper] या [shouting] जैसे टैग Eleven v3 को उस पल के अनुसार प्रतिक्रिया करने देते हैं। चेतावनी को नरम बनाने से लेकर सस्पेंस के लिए लंबा विराम रखने तक, आप अपनी स्क्रिप्ट में डायनामिक स्थितिजन्य समझ बना सकते हैं।

विस्तृत जानकारी के लिए हमारी AI ऑडियो में स्थितिजन्य समझ गाइड देखें।

बोलचाल में कैरेक्टर प्रदर्शन को निर्देशित करना

कई किरदारों वाली स्क्रिप्ट बनाते समय, आप साफ़ तौर पर दिखाना चाहेंगे कि हर वॉइस अलग कैसे है। [sarcastically] से उनके व्यक्तित्व में बदलाव करने से लेकर [British accent] से उनके बोलने का तरीका तय करने तक, आप हमारे TTS इंजन के साथ भावनाओं की पूरी रेंज पेश कर सकते हैं।

इसके बारे में अधिक जानें: AI स्पीच में कैरेक्टर प्रदर्शन को निर्देशित करना

बोलचाल में भावनात्मक संदर्भ व्यक्त करना

ऑडियो टैग से आप लाइन के आगे बढ़ने के साथ उसकी भावनात्मक डिलीवरी को आकार दे सकते हैं। आप पूरे भाषण में भावनाएं विकसित कर सकते हैं और ठीक उस पल चरम पर पहुंच सकते हैं, जब आप अपने किरदार को उसकी पूरी क्षमता पर देखना चाहते हैं। [awe], [booming] और [big laugh] जैसे टैग आपके AI वॉइस प्रदर्शन में भावनाओं की पूरी रेंज बनाने में मदद करते हैं।

इसके इस्तेमाल के बारे में और पढ़ें: AI स्पीच में भावनात्मक संदर्भ

कई किरदारों वाले डायलॉग को जीवंत बनाना

कई किरदारों वाले डायलॉग प्रदर्शन बनाते समय, आप समृद्ध किरदारों की बातचीत तैयार करने के लिए हर लाइन की शुरुआत ऑडियो टैग से कर सकते हैं।

उदाहरण के लिए: टॉम: [coughing] [beginning to speak] माफ़ करना, आज मेरी तबीयत थोड़ी खराब है— एम्मा: [interrupting] —बीमार? तुम्हें पता है मुझे खांसी कितनी नापसंद है, टॉम! टॉम: [surprised] बस हल्की-सी खांसी है, कोई गंभीर बात नहीं। अगर तुम्हें— एम्मा: [overlapping] [annoyed] —मुझे लगता है तुम्हें घर चले जाना चाहिए।

देखें कि Eleven v3 पर मल्टी-कैरेक्टर डायलॉग के साथ आप और क्या कर सकते हैं।

AI स्पीच के लिए सटीक डिलीवरी नियंत्रण

आप ऑडियो टैग या विराम चिह्नों के जरिए Eleven v3 में स्पीच की गति नियंत्रित कर सकते हैं। [pause], [rushed] या [drawn out] जैसे टैग आपको सटीकता के साथ लाइन को सक्रिय रूप से आकार देने देते हैं। विकल्प के तौर पर, अपने TTS प्रदर्शन में स्वाभाविक रूप से भावना जोड़ने के लिए इलिप्सिस, पूर्ण विराम और विस्मयादिबोधक चिह्न जोड़ें।

हमने इस बारे में एक विस्तृत गाइड लिखी है: Eleven v3 पर सटीक डिलीवरी नियंत्रण

भावनात्मक TTS API पर उपलब्ध है

ऑडियो टैग टेक्स्ट टू स्पीच API के जरिए भी उसी तरह काम करते हैं जैसे ElevenLabs UI में करते हैं। टैग को स्क्रिप्ट टेक्स्ट के बीच में लिखें और API ऑडियोबुक पाइपलाइनों से लेकर विज्ञापन वॉइसओवर तक, जनरेट किए गए ऑडियो में टैग वाला प्रदर्शन लौटाएगा।

आज शुरू करने के लिए Eleven v3 के बारे में और जानें या सेल्स से संपर्क करें

ऑडियो टैग और भावनात्मक TTS: अक्सर पूछे जाने वाले सवाल

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं