ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड
- लेखक
- Jack Limebear
- प्रकाशित
- आखिरी बार अपडेट किया गया
ऑडियो टैग ब्रैकेट में लिखे प्राकृतिक भाषा के संकेत होते हैं, जैसे [laughs], [gasps], [excited] और [worried], जिन्हें Eleven v3 बोलने वाले शब्दों के बजाय प्रदर्शन के निर्देश के रूप में पढ़ता है। टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते समय इन ऑडियो टैग को जोड़ने से आपको अपनी लिखी बात की भावनात्मक डिलीवरी पर बारीकी से नियंत्रण मिलता है।
Eleven v3 मार्च 2026 में सार्वजनिक रूप से उपलब्ध हुआ। v3 से पहले, टेक्स्ट टू स्पीच मॉडल से मनचाहा भावनात्मक प्रदर्शन पाना, कंटेंट को बार-बार जनरेट करने और सर्वश्रेष्ठ की उम्मीद करने जैसा था। ऑडियो टैग इस अंदाज़े को खत्म करते हैं और भावनात्मक टेक्स्ट टू स्पीच प्रदर्शन पर आपको पूरा नियंत्रण देते हैं।
इस गाइड में बताया गया है कि ऑडियो टैग क्या हैं, वे कैसे काम करते हैं, टैग की कौन-कौन सी श्रेणियां उपलब्ध हैं और उनकी तुलना SSML (स्पीच सिंथेसिस मार्कअप लैंग्वेज) से कैसे होती है। हम आम इस्तेमाल के मामलों को भी कवर करेंगे, जिनमें से हर एक की अपनी विस्तृत गाइड है।
संक्षेप में:
- ऑडियो टैग, [shouts] या [excited] जैसे ब्रैकेट में लिखे संकेत हैं, जो Eleven v3 में TTS की भावना, गति, डिलीवरी और टोन को निर्देशित करते हैं।
- Eleven v3, SSML को सपोर्ट नहीं करता, लेकिन अधिक स्वाभाविक लेखन अनुभव के लिए उसकी जगह ऑडियो टैग देता है।
- टैग कई श्रेणियों में होते हैं, जैसे भावनाएं, डिलीवरी और गति, मानवीय प्रतिक्रियाएं, एक्सेंट और साउंड इफेक्ट्स।
- आपके टेक्स्ट में विराम चिह्न और कैपिटल अक्षर, AI वॉइस प्रदर्शन की गति को आकार देने में मदद करते हैं।
- आप ElevenLabs पर UI या API के जरिए ऑडियो टैग इस्तेमाल कर सकते हैं।
ऑडियो टैग कैसे काम करते हैं?
ऑडियो टैग आपके ट्रांसक्रिप्ट के बीच में लिखे जाते हैं और स्क्वेयर ब्रैकेट में होते हैं। जब भी आप डिलीवरी बदलना चाहें, मान लीजिए सामान्य से [worried] करना हो, तो बस एक ऑडियो टैग जोड़ दें।
आप एक ही वाक्य में एक से अधिक टैग भी इस्तेमाल कर सकते हैं और अधिक परतदार प्रदर्शन के लिए उन्हें मिला सकते हैं, जैसे [tired] आज का दिन बहुत लंबा था… [upset] मैं और कितने दिन सह सकता हूँ?
Eleven v3 के पीछे की आर्किटेक्चर मॉडल को पहले के मॉडल्स की तुलना में संदर्भ को अधिक गहराई से समझने देती है। इसलिए यह अलग पैरामीटर या सेटिंग की जरूरत के बिना भावनात्मक संकेतों, टोन में बदलाव, स्पीकर ट्रांज़िशन और संदर्भ संकेतों को फॉलो कर सकता है। बस मॉडल को बताइए कि उस पल की क्या जरूरत है, और यह लाइन को ठीक आपके प्लान के अनुसार पेश करेगा।
Eleven v3 केवल टैग और स्क्रिप्ट की संरचना से ही सहज लगने वाले मल्टी-स्पीकर डायलॉग भी संभालता है, जिनमें रुकावटें, मूड में बदलाव और असली बातचीत का स्वाभाविक आदान-प्रदान शामिल है।
ऑडियो टैग बनाम SSML
अगर आपने दूसरे TTS सिस्टम्स के साथ काम किया है, तो आपने शायद स्पीच सिंथेसिस मार्कअप लैंग्वेज देखी होगी। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफ़ॉर्म, TTS स्क्रिप्ट को अतिरिक्त संदर्भ देने के लिए <break> या <emphasis> जैसे SSML टैग इस्तेमाल करते हैं।
Eleven v3, SSML ब्रेक टैग या बाकी SSML टैग सेट को सपोर्ट नहीं करता। इसके बजाय, ऑडियो टैग, विराम चिह्न और टेक्स्ट की संरचना ही यह भूमिका निभाते हैं, साथ ही डिलीवरी पर बारीकी से नियंत्रण भी देते हैं।
नीचे दी गई तालिका से आप आम SSML टैग को उनके Eleven v3 विकल्पों से मैप कर सकते हैं।
लेखक के नज़रिए से, किसी लाइन में [whispers] जोड़ना प्रोसोडी रेट कॉन्फ़िगर करने से कहीं आसान है।
v3 में ऑडियो टैग की श्रेणियां: ऑडियो टैग से प्रदर्शन को निर्देशित करें
आप रियल टाइम में डिलीवरी को आकार देने के लिए अपनी स्क्रिप्ट में कहीं भी ऑडियो टैग लगा सकते हैं। आप स्क्रिप्ट में या एक ही वाक्य में टैग के कॉम्बिनेशन भी इस्तेमाल कर सकते हैं।
टैग इन मुख्य श्रेणियों में आते हैं।
भावनाएं
ये टैग वॉइस का भावनात्मक टोन तय करने में मदद करते हैं, चाहे वह उदास, तीव्र या उत्साहपूर्ण हो। उदाहरण के लिए, आप [sad], [angry], [happily] और [sorrowful] में से एक या इनके कॉम्बिनेशन का इस्तेमाल कर सकते हैं।
डिलीवरी और गति
ये टोन और प्रदर्शन से अधिक जुड़े होते हैं। जिन दृश्यों में संयम या प्रभाव की जरूरत हो, उनमें वॉल्यूम और ऊर्जा समायोजित करने के लिए आप इन टैग का इस्तेमाल कर सकते हैं। उदाहरणों में [whispers], [shouts] और [softly] जैसे टैग शामिल हैं।
मानवीय प्रतिक्रियाएं
वास्तविक प्राकृतिक बोलचाल में प्रतिक्रियाएं शामिल होती हैं। उदाहरण के लिए, आप बोलचाल में स्वाभाविक, बिना स्क्रिप्ट वाले पल जोड़कर उसे अधिक वास्तविक बना सकते हैं। [laughs], [clears throat] और [sighs] जैसे टैग, मानवीय भावनाएं पेश कर सकने वाला TTS मॉडल बनाने में मदद करते हैं।
अलग-अलग ऑडियो टैग श्रेणियों के अन्य उदाहरण:
- एक्सेंट और कैरेक्टर वॉइस: एक्सेंट टैग, मॉडल बदले बिना वॉइस को किसी खास क्षेत्र या व्यक्तित्व में बदल देते हैं, जैसे [French accent], [British accent] या [pirate voice]। इनसे एक ही वॉइस को स्थिर प्रदर्शन के बजाय एक लचीले कलाकारों के समूह में बदला जा सकता है।
- साउंड इफेक्ट्स: साउंड इफेक्ट टैग सीधे जनरेशन में गैर-वाचिक ऑडियो जोड़ते हैं, जैसे [gunshot], [explosion] और [clapping]। ये इमर्सिव ऑडियो, गेम्स और नाटकीय नैरेशन के लिए अच्छे हैं, जहां दृश्य को सिर्फ एक वॉइस से अधिक की जरूरत होती है। विकल्प के तौर पर ElevenCreative AI साउंड इफेक्ट जनरेटर इस्तेमाल करें।
हालांकि टैग आपको काफी नियंत्रण देते हैं, लेकिन आप लय और ज़ोर को आकार देने के लिए विराम चिह्नों का भी इस्तेमाल कर सकते हैं। उदाहरण के लिए, प्राकृतिक विराम के लिए इलिप्सिस जोड़ें या स्वाभाविक सांस लेने का पैटर्न बनाने के लिए कॉमा इस्तेमाल करें। ज़ोर देने के लिए किसी शब्द को सभी कैपिटल अक्षरों में लिखकर देखें: “मुझे यह अभी इसी वक्त चाहिए।”
आप ऑडियो टैग से क्या कर सकते हैं?
ऑडियो टैग सहज तरीके से स्क्रिप्ट की भावनात्मक जटिलता को उजागर करते हैं। स्वाभाविक रूप से लिखें और लिखते समय टैग जोड़ते जाएं।
यहां ऑडियो टैग के साथ भावनात्मक TTS के कुछ इस्तेमाल के मामलों की एक झलक दी गई है।
AI ऑडियो में स्थितिजन्य समझ
[whisper] या [shouting] जैसे टैग Eleven v3 को उस पल के अनुसार प्रतिक्रिया करने देते हैं। चेतावनी को नरम बनाने से लेकर सस्पेंस के लिए लंबा विराम रखने तक, आप अपनी स्क्रिप्ट में डायनामिक स्थितिजन्य समझ बना सकते हैं।
विस्तृत जानकारी के लिए हमारी AI ऑडियो में स्थितिजन्य समझ गाइड देखें।
बोलचाल में कैरेक्टर प्रदर्शन को निर्देशित करना
कई किरदारों वाली स्क्रिप्ट बनाते समय, आप साफ़ तौर पर दिखाना चाहेंगे कि हर वॉइस अलग कैसे है। [sarcastically] से उनके व्यक्तित्व में बदलाव करने से लेकर [British accent] से उनके बोलने का तरीका तय करने तक, आप हमारे TTS इंजन के साथ भावनाओं की पूरी रेंज पेश कर सकते हैं।
इसके बारे में अधिक जानें: AI स्पीच में कैरेक्टर प्रदर्शन को निर्देशित करना।
बोलचाल में भावनात्मक संदर्भ व्यक्त करना
ऑडियो टैग से आप लाइन के आगे बढ़ने के साथ उसकी भावनात्मक डिलीवरी को आकार दे सकते हैं। आप पूरे भाषण में भावनाएं विकसित कर सकते हैं और ठीक उस पल चरम पर पहुंच सकते हैं, जब आप अपने किरदार को उसकी पूरी क्षमता पर देखना चाहते हैं। [awe], [booming] और [big laugh] जैसे टैग आपके AI वॉइस प्रदर्शन में भावनाओं की पूरी रेंज बनाने में मदद करते हैं।
इसके इस्तेमाल के बारे में और पढ़ें: AI स्पीच में भावनात्मक संदर्भ।
कई किरदारों वाले डायलॉग को जीवंत बनाना
कई किरदारों वाले डायलॉग प्रदर्शन बनाते समय, आप समृद्ध किरदारों की बातचीत तैयार करने के लिए हर लाइन की शुरुआत ऑडियो टैग से कर सकते हैं।
उदाहरण के लिए: टॉम: [coughing] [beginning to speak] माफ़ करना, आज मेरी तबीयत थोड़ी खराब है— एम्मा: [interrupting] —बीमार? तुम्हें पता है मुझे खांसी कितनी नापसंद है, टॉम! टॉम: [surprised] बस हल्की-सी खांसी है, कोई गंभीर बात नहीं। अगर तुम्हें— एम्मा: [overlapping] [annoyed] —मुझे लगता है तुम्हें घर चले जाना चाहिए।
देखें कि Eleven v3 पर मल्टी-कैरेक्टर डायलॉग के साथ आप और क्या कर सकते हैं।
AI स्पीच के लिए सटीक डिलीवरी नियंत्रण
आप ऑडियो टैग या विराम चिह्नों के जरिए Eleven v3 में स्पीच की गति नियंत्रित कर सकते हैं। [pause], [rushed] या [drawn out] जैसे टैग आपको सटीकता के साथ लाइन को सक्रिय रूप से आकार देने देते हैं। विकल्प के तौर पर, अपने TTS प्रदर्शन में स्वाभाविक रूप से भावना जोड़ने के लिए इलिप्सिस, पूर्ण विराम और विस्मयादिबोधक चिह्न जोड़ें।
हमने इस बारे में एक विस्तृत गाइड लिखी है: Eleven v3 पर सटीक डिलीवरी नियंत्रण।
भावनात्मक TTS API पर उपलब्ध है
ऑडियो टैग टेक्स्ट टू स्पीच API के जरिए भी उसी तरह काम करते हैं जैसे ElevenLabs UI में करते हैं। टैग को स्क्रिप्ट टेक्स्ट के बीच में लिखें और API ऑडियोबुक पाइपलाइनों से लेकर विज्ञापन वॉइसओवर तक, जनरेट किए गए ऑडियो में टैग वाला प्रदर्शन लौटाएगा।
आज शुरू करने के लिए Eleven v3 के बारे में और जानें या सेल्स से संपर्क करें।










