ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड
- लेखक
- Jack Limebear
- प्रकाशित
- आखिरी बार अपडेट किया गया
ऑडियो टैग, जैसे [laughs], [gasps], [excited] और [worried], ब्रैकेट में लिखे प्राकृतिक भाषा के संकेत हैं, जिन्हें Eleven v3 बोलने के शब्दों के बजाय परफॉर्मेंस निर्देश के रूप में पढ़ता है। टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते समय, इन ऑडियो टैग को जोड़कर आप अपनी लिखी बात के भावनात्मक प्रस्तुतीकरण को बारीकी से नियंत्रित कर सकते हैं।
Eleven v3 मार्च 2026 में सार्वजनिक रूप से उपलब्ध हुआ। v3 से पहले, किसी टेक्स्ट टू स्पीच मॉडल से मनचाहा भावनात्मक प्रदर्शन पाने के लिए कंटेंट को बार-बार जनरेट करना और अच्छे नतीजे की उम्मीद करना पड़ता था। ऑडियो टैग इस अनुमान को खत्म कर देते हैं और भावनात्मक टेक्स्ट टू स्पीच प्रदर्शन पर आपको पूरा नियंत्रण देते हैं।
इस गाइड में बताया गया है कि ऑडियो टैग क्या हैं, वे कैसे काम करते हैं, कौन-कौन सी टैग कैटेगरी उपलब्ध हैं और उनकी तुलना SSML (स्पीच सिंथेसिस मार्कअप लैंग्वेज) से कैसे होती है। हम सामान्य उपयोग के मामलों को भी कवर करेंगे, जिनमें से हर एक की अपनी विस्तृत गाइड है।
सारांश:
- ऑडियो टैग, जैसे [shouts] या [excited], ब्रैकेट में लिखे संकेत हैं जो Eleven v3 में TTS के भाव, गति, डिलीवरी और टोन को निर्देशित करते हैं।
- Eleven v3 SSML को सपोर्ट नहीं करता, बल्कि ज़्यादा स्वाभाविक लेखन अनुभव के लिए उसकी जगह ऑडियो टैग देता है।
- टैग कई कैटेगरी में होते हैं, जैसे भावनाएं, डिलीवरी और गति, मानवीय प्रतिक्रियाएं, एक्सेंट और साउंड इफेक्ट्स।
- आपके टेक्स्ट में विराम चिह्न और कैपिटलाइज़ेशन से आप AI वॉइस प्रदर्शन की गति तय कर सकते हैं।
- आप ElevenLabs में UI या API के ज़रिए ऑडियो टैग इस्तेमाल कर सकते हैं।
ऑडियो टैग कैसे काम करते हैं?
ऑडियो टैग आपके ट्रांसक्रिप्ट में इनलाइन होते हैं और स्क्वेयर ब्रैकेट में लिखे जाते हैं। जब भी आपको डिलीवरी बदलनी हो, जैसे सामान्य से [worried] करना हो, बस एक ऑडियो टैग जोड़ दें।
आप एक ही वाक्य में एक से ज़्यादा टैग इस्तेमाल कर सकते हैं और अधिक परतदार प्रदर्शन के लिए टैग को मिला भी सकते हैं, जैसे [tired] आज का दिन बहुत लंबा था… [upset] मैं और कितने दिन सह सकता हूँ?
Eleven v3 का आर्किटेक्चर मॉडल को पहले के मॉडल की तुलना में संदर्भ को अधिक गहराई से पढ़ने देता है। इससे वह किसी अलग पैरामीटर या सेटिंग के बिना भावनात्मक संकेतों, टोन में बदलाव, स्पीकर ट्रांज़िशन और संदर्भ संकेतों को समझ पाता है। बस मॉडल को बताएं कि उस पल में क्या चाहिए, और वह लाइन को ठीक वैसे प्रस्तुत करेगा जैसा आपने सोचा है।
Eleven v3 सिर्फ टैग और स्क्रिप्ट के ढांचे के आधार पर मल्टी-स्पीकर डायलॉग भी संभालता है जो स्वाभाविक लगते हैं, जिनमें बीच में टोकना, मूड में बदलाव और असली बातचीत की प्राकृतिक आगे-पीछे की लय शामिल है।
ऑडियो टैग बनाम SSML
अगर आपने दूसरे TTS सिस्टम के साथ काम किया है, तो आप शायद स्पीच सिंथेसिस मार्कअप लैंग्वेज से परिचित होंगे। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफ़ॉर्म TTS स्क्रिप्ट को अतिरिक्त संदर्भ देने के लिए <break> या <emphasis> जैसे SSML टैग इस्तेमाल करते हैं।
Eleven v3 SSML ब्रेक टैग या बाकी SSML टैग सेट को सपोर्ट नहीं करता। इसकी जगह ऑडियो टैग, विराम चिह्न और टेक्स्ट का ढांचा यह भूमिका निभाते हैं, साथ ही डिलीवरी पर बारीकी से नियंत्रण भी देते हैं।
नीचे दी गई टेबल से आप सामान्य SSML टैग को उनके Eleven v3 विकल्पों से मैप कर सकते हैं।
एक लेखक के नज़रिए से, किसी लाइन में [whispers] जोड़ना प्रोसोडी रेट कॉन्फ़िगर करने से कहीं आसान है।
v3 में ऑडियो टैग की कैटेगरी: ऑडियो टैग से प्रदर्शन निर्देशित करें
रियल टाइम में डिलीवरी को आकार देने के लिए आप अपनी स्क्रिप्ट में कहीं भी ऑडियो टैग लगा सकते हैं। आप स्क्रिप्ट या एक ही वाक्य में टैग के संयोजन भी इस्तेमाल कर सकते हैं।
टैग इन मुख्य कैटेगरी में आते हैं।
भावनाएं
ये टैग वॉइस का भावनात्मक टोन सेट करने में मदद करते हैं, चाहे वह उदास, तीव्र या उत्साहपूर्ण हो। उदाहरण के लिए, आप [sad], [angry], [happily] और [sorrowful] में से एक या इनके संयोजन का उपयोग कर सकते हैं।
डिलीवरी और गति
ये टोन और प्रदर्शन पर ज़्यादा केंद्रित होते हैं। जिन दृश्यों में संयम या दमदार प्रस्तुति चाहिए, वहां वॉल्यूम और ऊर्जा को समायोजित करने के लिए आप इन टैग का इस्तेमाल कर सकते हैं। उदाहरणों में [whispers], [shouts] और [softly] जैसे टैग शामिल हैं।
मानवीय प्रतिक्रियाएं
वास्तव में प्राकृतिक बोलचाल में प्रतिक्रियाएं शामिल होती हैं। उदाहरण के लिए, आप बोलचाल में स्वाभाविक, बिना स्क्रिप्ट वाले पल जोड़कर इसे ज़्यादा वास्तविक बना सकते हैं। [laughs], [clears throat] और [sighs] जैसे टैग TTS मॉडल को मानवीय भावनाएं व्यक्त करने में मदद करते हैं।
ऑडियो टैग की अलग-अलग कैटेगरी के कुछ और उदाहरण:
- एक्सेंट और कैरेक्टर वॉइस: एक्सेंट टैग मॉडल बदले बिना वॉइस को किसी खास क्षेत्र या व्यक्तित्व में बदल देते हैं, जैसे [French accent], [British accent] या [pirate voice]। एक तय प्रदर्शन के बजाय एक ही वॉइस को लचीले कलाकारों के समूह में बदलने के लिए इनका उपयोग करें।
- साउंड इफेक्ट्स: साउंड इफेक्ट टैग सीधे जनरेशन में गैर-वाचिक ऑडियो जोड़ते हैं, जैसे [gunshot], [explosion] और [clapping]। ये इमर्सिव ऑडियो, गेम्स और नाटकीय नैरेशन के लिए अच्छी तरह काम करते हैं, जहां दृश्य को सिर्फ वॉइस से ज़्यादा की ज़रूरत होती है। विकल्प के तौर पर ElevenCreative AI साउंड इफेक्ट जनरेटर इस्तेमाल करें।
टैग से आपको काफी नियंत्रण मिलता है, लेकिन लय और ज़ोर तय करने के लिए आप विराम चिह्न भी इस्तेमाल कर सकते हैं। उदाहरण के लिए, स्वाभाविक ठहराव के लिए इलिप्सिस जोड़ें या प्राकृतिक सांस लेने का पैटर्न बनाने के लिए कॉमा लगाएं। ज़ोर देने के लिए किसी शब्द को सभी कैपिटल अक्षरों में लिखें: “मुझे यह अभी चाहिए।”
आप ऑडियो टैग से क्या कर सकते हैं?
ऑडियो टैग सहज तरीके से स्क्रिप्ट की भावनात्मक जटिलता को सामने लाते हैं। स्वाभाविक रूप से लिखें और लिखते समय टैग जोड़ते जाएं।
ऑडियो टैग के साथ भावनात्मक TTS के कुछ उपयोग मामलों की एक झलक यहां दी गई है।
AI ऑडियो में स्थितिजन्य समझ
[whisper] या [shouting] जैसे टैग Eleven v3 को पल के हिसाब से प्रतिक्रिया देने देते हैं। चेतावनी को नरम बनाने से लेकर सस्पेंस के लिए लंबा ठहराव रखने तक, आप अपनी स्क्रिप्ट में डायनामिक स्थितिजन्य समझ जोड़ सकते हैं।
विस्तृत जानकारी के लिए हमारी AI ऑडियो में स्थितिजन्य समझ गाइड देखें।
स्पीच में कैरेक्टर परफॉर्मेंस निर्देशित करना
कई कैरेक्टर वाली स्क्रिप्ट बनाते समय, आप साफ़ दिखाना चाहते हैं कि हर वॉइस कैसे अलग है। [sarcastically] से उनके व्यक्तित्व में बदलाव करने से लेकर [British accent] से उनके बोलने का तरीका तय करने तक, आप हमारे TTS इंजन से भावनाओं की पूरी रेंज कैप्चर कर सकते हैं।
इसके बारे में और जानें: AI स्पीच में कैरेक्टर परफॉर्मेंस निर्देशित करना।
स्पीच में भावनात्मक संदर्भ व्यक्त करना
ऑडियो टैग आपको लाइन के आगे बढ़ने के साथ उसकी भावनात्मक डिलीवरी को आकार देने देते हैं। आप पूरे भाषण में भावनाओं को बढ़ाते हुए उस चरम तक पहुंच सकते हैं, जहां आप अपने कैरेक्टर को उसकी पूरी क्षमता पर देखना चाहते हैं। [awe], [booming] और [big laugh] जैसे टैग आपकी AI वॉइस परफॉर्मेंस में भावनाओं की पूरी रेंज जोड़ने में मदद करते हैं।
इसके इस्तेमाल के बारे में और पढ़ें: AI स्पीच में भावनात्मक संदर्भ।
मल्टी-कैरेक्टर डायलॉग को जीवंत बनाना
मल्टी-कैरेक्टर डायलॉग परफॉर्मेंस बनाते समय, आप समृद्ध कैरेक्टर चर्चाएं तैयार करने के लिए हर लाइन की शुरुआत ऑडियो टैग से कर सकते हैं।
इसे उदाहरण के तौर पर देखें: टॉम: [coughing] [beginning to speak] माफ़ कीजिए, आज मेरी तबीयत थोड़ी खराब है— एम्मा: [interrupting] —तबीयत खराब? तुम्हें पता है मुझे खांसी कितनी नापसंद है, टॉम! टॉम: [surprised] बस हल्की-सी खांसी है, कोई गंभीर बात नहीं। अगर तुम्हें— एम्मा: [overlapping] [annoyed] —मुझे लगता है तुम्हें घर जाना चाहिए।
जानें कि Eleven v3 पर मल्टी-कैरेक्टर डायलॉग से आप और क्या कर सकते हैं।
AI स्पीच के लिए सटीक डिलीवरी नियंत्रण
आप ऑडियो टैग या विराम चिह्नों के ज़रिए Eleven v3 में स्पीच की गति नियंत्रित कर सकते हैं। [pause], [rushed] या [drawn out] जैसे टैग आपको सटीकता से लाइन को आकार देने देते हैं। विकल्प के तौर पर, अपनी TTS परफॉर्मेंस में स्वाभाविक रूप से भाव जोड़ने के लिए इलिप्सिस, पूर्ण विराम और विस्मयादिबोधक चिह्न लगाएं।
हमने Eleven v3 पर सटीक डिलीवरी नियंत्रण पर एक विस्तृत गाइड लिखी है।
भावनात्मक TTS API पर उपलब्ध है
ऑडियो टैग टेक्स्ट टू स्पीच API के ज़रिए भी उसी तरह काम करते हैं जैसे ElevenLabs UI में करते हैं। टैग को स्क्रिप्ट टेक्स्ट के साथ इनलाइन लिखें और API जनरेट किए गए ऑडियो में टैग के अनुरूप परफॉर्मेंस लौटाएगा—ऑडियोबुक पाइपलाइन से लेकर विज्ञापन वॉइसओवर तक।
इसके बारे में और जानें: Eleven v3 या सेल्स टीम से संपर्क करें और आज ही शुरू करें।








.png&w=3840&q=80)
