कंटेंट पर जाएं

ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

ऑडियो टैग, जैसे [laughs], [gasps], [excited] और [worried], ब्रैकेट में लिखे प्राकृतिक भाषा के संकेत हैं, जिन्हें Eleven v3 बोलने के शब्दों के बजाय परफॉर्मेंस निर्देश के रूप में पढ़ता है। टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते समय, इन ऑडियो टैग को जोड़कर आप अपनी लिखी बात के भावनात्मक प्रस्तुतीकरण को बारीकी से नियंत्रित कर सकते हैं। 

Eleven v3 मार्च 2026 में सार्वजनिक रूप से उपलब्ध हुआ। v3 से पहले, किसी टेक्स्ट टू स्पीच मॉडल से मनचाहा भावनात्मक प्रदर्शन पाने के लिए कंटेंट को बार-बार जनरेट करना और अच्छे नतीजे की उम्मीद करना पड़ता था। ऑडियो टैग इस अनुमान को खत्म कर देते हैं और भावनात्मक टेक्स्ट टू स्पीच प्रदर्शन पर आपको पूरा नियंत्रण देते हैं।

इस गाइड में बताया गया है कि ऑडियो टैग क्या हैं, वे कैसे काम करते हैं, कौन-कौन सी टैग कैटेगरी उपलब्ध हैं और उनकी तुलना SSML (स्पीच सिंथेसिस मार्कअप लैंग्वेज) से कैसे होती है। हम सामान्य उपयोग के मामलों को भी कवर करेंगे, जिनमें से हर एक की अपनी विस्तृत गाइड है।

सारांश:

  • ऑडियो टैग, जैसे [shouts] या [excited], ब्रैकेट में लिखे संकेत हैं जो Eleven v3 में TTS के भाव, गति, डिलीवरी और टोन को निर्देशित करते हैं।
  • Eleven v3 SSML को सपोर्ट नहीं करता, बल्कि ज़्यादा स्वाभाविक लेखन अनुभव के लिए उसकी जगह ऑडियो टैग देता है।
  • टैग कई कैटेगरी में होते हैं, जैसे भावनाएं, डिलीवरी और गति, मानवीय प्रतिक्रियाएं, एक्सेंट और साउंड इफेक्ट्स।
  • आपके टेक्स्ट में विराम चिह्न और कैपिटलाइज़ेशन से आप AI वॉइस प्रदर्शन की गति तय कर सकते हैं।
  • आप ElevenLabs में UI या API के ज़रिए ऑडियो टैग इस्तेमाल कर सकते हैं।

ऑडियो टैग कैसे काम करते हैं?

ऑडियो टैग आपके ट्रांसक्रिप्ट में इनलाइन होते हैं और स्क्वेयर ब्रैकेट में लिखे जाते हैं। जब भी आपको डिलीवरी बदलनी हो, जैसे सामान्य से [worried] करना हो, बस एक ऑडियो टैग जोड़ दें।

आप एक ही वाक्य में एक से ज़्यादा टैग इस्तेमाल कर सकते हैं और अधिक परतदार प्रदर्शन के लिए टैग को मिला भी सकते हैं, जैसे [tired] आज का दिन बहुत लंबा था… [upset] मैं और कितने दिन सह सकता हूँ?

Eleven v3 का आर्किटेक्चर मॉडल को पहले के मॉडल की तुलना में संदर्भ को अधिक गहराई से पढ़ने देता है। इससे वह किसी अलग पैरामीटर या सेटिंग के बिना भावनात्मक संकेतों, टोन में बदलाव, स्पीकर ट्रांज़िशन और संदर्भ संकेतों को समझ पाता है। बस मॉडल को बताएं कि उस पल में क्या चाहिए, और वह लाइन को ठीक वैसे प्रस्तुत करेगा जैसा आपने सोचा है।

Eleven v3 सिर्फ टैग और स्क्रिप्ट के ढांचे के आधार पर मल्टी-स्पीकर डायलॉग भी संभालता है जो स्वाभाविक लगते हैं, जिनमें बीच में टोकना, मूड में बदलाव और असली बातचीत की प्राकृतिक आगे-पीछे की लय शामिल है। 

ऑडियो टैग बनाम SSML

अगर आपने दूसरे TTS सिस्टम के साथ काम किया है, तो आप शायद स्पीच सिंथेसिस मार्कअप लैंग्वेज से परिचित होंगे। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफ़ॉर्म TTS स्क्रिप्ट को अतिरिक्त संदर्भ देने के लिए <break> या <emphasis> जैसे SSML टैग इस्तेमाल करते हैं। 

Eleven v3 SSML ब्रेक टैग या बाकी SSML टैग सेट को सपोर्ट नहीं करता। इसकी जगह ऑडियो टैग, विराम चिह्न और टेक्स्ट का ढांचा यह भूमिका निभाते हैं, साथ ही डिलीवरी पर बारीकी से नियंत्रण भी देते हैं।

नीचे दी गई टेबल से आप सामान्य SSML टैग को उनके Eleven v3 विकल्पों से मैप कर सकते हैं।

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

एक लेखक के नज़रिए से, किसी लाइन में [whispers] जोड़ना प्रोसोडी रेट कॉन्फ़िगर करने से कहीं आसान है।

v3 में ऑडियो टैग की कैटेगरी: ऑडियो टैग से प्रदर्शन निर्देशित करें

रियल टाइम में डिलीवरी को आकार देने के लिए आप अपनी स्क्रिप्ट में कहीं भी ऑडियो टैग लगा सकते हैं। आप स्क्रिप्ट या एक ही वाक्य में टैग के संयोजन भी इस्तेमाल कर सकते हैं।

टैग इन मुख्य कैटेगरी में आते हैं।

भावनाएं

ये टैग वॉइस का भावनात्मक टोन सेट करने में मदद करते हैं, चाहे वह उदास, तीव्र या उत्साहपूर्ण हो। उदाहरण के लिए, आप [sad], [angry], [happily] और [sorrowful] में से एक या इनके संयोजन का उपयोग कर सकते हैं।

Background
Background

डिलीवरी और गति

ये टोन और प्रदर्शन पर ज़्यादा केंद्रित होते हैं। जिन दृश्यों में संयम या दमदार प्रस्तुति चाहिए, वहां वॉल्यूम और ऊर्जा को समायोजित करने के लिए आप इन टैग का इस्तेमाल कर सकते हैं। उदाहरणों में [whispers], [shouts] और [softly] जैसे टैग शामिल हैं।

Background
Background

मानवीय प्रतिक्रियाएं

वास्तव में प्राकृतिक बोलचाल में प्रतिक्रियाएं शामिल होती हैं। उदाहरण के लिए, आप बोलचाल में स्वाभाविक, बिना स्क्रिप्ट वाले पल जोड़कर इसे ज़्यादा वास्तविक बना सकते हैं। [laughs], [clears throat] और [sighs] जैसे टैग TTS मॉडल को मानवीय भावनाएं व्यक्त करने में मदद करते हैं।

ऑडियो टैग की अलग-अलग कैटेगरी के कुछ और उदाहरण:

  • एक्सेंट और कैरेक्टर वॉइस: एक्सेंट टैग मॉडल बदले बिना वॉइस को किसी खास क्षेत्र या व्यक्तित्व में बदल देते हैं, जैसे [French accent], [British accent] या [pirate voice]। एक तय प्रदर्शन के बजाय एक ही वॉइस को लचीले कलाकारों के समूह में बदलने के लिए इनका उपयोग करें।
  • साउंड इफेक्ट्स: साउंड इफेक्ट टैग सीधे जनरेशन में गैर-वाचिक ऑडियो जोड़ते हैं, जैसे [gunshot], [explosion] और [clapping]। ये इमर्सिव ऑडियो, गेम्स और नाटकीय नैरेशन के लिए अच्छी तरह काम करते हैं, जहां दृश्य को सिर्फ वॉइस से ज़्यादा की ज़रूरत होती है। विकल्प के तौर पर ElevenCreative AI साउंड इफेक्ट जनरेटर इस्तेमाल करें।

टैग से आपको काफी नियंत्रण मिलता है, लेकिन लय और ज़ोर तय करने के लिए आप विराम चिह्न भी इस्तेमाल कर सकते हैं। उदाहरण के लिए, स्वाभाविक ठहराव के लिए इलिप्सिस जोड़ें या प्राकृतिक सांस लेने का पैटर्न बनाने के लिए कॉमा लगाएं। ज़ोर देने के लिए किसी शब्द को सभी कैपिटल अक्षरों में लिखें: “मुझे यह अभी चाहिए।”

Background
Background

आप ऑडियो टैग से क्या कर सकते हैं?

ऑडियो टैग सहज तरीके से स्क्रिप्ट की भावनात्मक जटिलता को सामने लाते हैं। स्वाभाविक रूप से लिखें और लिखते समय टैग जोड़ते जाएं।

ऑडियो टैग के साथ भावनात्मक TTS के कुछ उपयोग मामलों की एक झलक यहां दी गई है।

AI ऑडियो में स्थितिजन्य समझ

[whisper] या [shouting] जैसे टैग Eleven v3 को पल के हिसाब से प्रतिक्रिया देने देते हैं। चेतावनी को नरम बनाने से लेकर सस्पेंस के लिए लंबा ठहराव रखने तक, आप अपनी स्क्रिप्ट में डायनामिक स्थितिजन्य समझ जोड़ सकते हैं।

विस्तृत जानकारी के लिए हमारी AI ऑडियो में स्थितिजन्य समझ गाइड देखें।

स्पीच में कैरेक्टर परफॉर्मेंस निर्देशित करना

कई कैरेक्टर वाली स्क्रिप्ट बनाते समय, आप साफ़ दिखाना चाहते हैं कि हर वॉइस कैसे अलग है। [sarcastically] से उनके व्यक्तित्व में बदलाव करने से लेकर [British accent] से उनके बोलने का तरीका तय करने तक, आप हमारे TTS इंजन से भावनाओं की पूरी रेंज कैप्चर कर सकते हैं।

इसके बारे में और जानें: AI स्पीच में कैरेक्टर परफॉर्मेंस निर्देशित करना

स्पीच में भावनात्मक संदर्भ व्यक्त करना

ऑडियो टैग आपको लाइन के आगे बढ़ने के साथ उसकी भावनात्मक डिलीवरी को आकार देने देते हैं। आप पूरे भाषण में भावनाओं को बढ़ाते हुए उस चरम तक पहुंच सकते हैं, जहां आप अपने कैरेक्टर को उसकी पूरी क्षमता पर देखना चाहते हैं। [awe], [booming] और [big laugh] जैसे टैग आपकी AI वॉइस परफॉर्मेंस में भावनाओं की पूरी रेंज जोड़ने में मदद करते हैं।

इसके इस्तेमाल के बारे में और पढ़ें: AI स्पीच में भावनात्मक संदर्भ। 

मल्टी-कैरेक्टर डायलॉग को जीवंत बनाना

मल्टी-कैरेक्टर डायलॉग परफॉर्मेंस बनाते समय, आप समृद्ध कैरेक्टर चर्चाएं तैयार करने के लिए हर लाइन की शुरुआत ऑडियो टैग से कर सकते हैं। 

इसे उदाहरण के तौर पर देखें: टॉम: [coughing] [beginning to speak] माफ़ कीजिए, आज मेरी तबीयत थोड़ी खराब है— एम्मा: [interrupting] —तबीयत खराब? तुम्हें पता है मुझे खांसी कितनी नापसंद है, टॉम! टॉम: [surprised] बस हल्की-सी खांसी है, कोई गंभीर बात नहीं। अगर तुम्हें— एम्मा: [overlapping] [annoyed] —मुझे लगता है तुम्हें घर जाना चाहिए। 

जानें कि Eleven v3 पर मल्टी-कैरेक्टर डायलॉग से आप और क्या कर सकते हैं।

AI स्पीच के लिए सटीक डिलीवरी नियंत्रण

आप ऑडियो टैग या विराम चिह्नों के ज़रिए Eleven v3 में स्पीच की गति नियंत्रित कर सकते हैं। [pause], [rushed] या [drawn out] जैसे टैग आपको सटीकता से लाइन को आकार देने देते हैं। विकल्प के तौर पर, अपनी TTS परफॉर्मेंस में स्वाभाविक रूप से भाव जोड़ने के लिए इलिप्सिस, पूर्ण विराम और विस्मयादिबोधक चिह्न लगाएं।

हमने Eleven v3 पर सटीक डिलीवरी नियंत्रण पर एक विस्तृत गाइड लिखी है।

भावनात्मक TTS API पर उपलब्ध है

ऑडियो टैग टेक्स्ट टू स्पीच API के ज़रिए भी उसी तरह काम करते हैं जैसे ElevenLabs UI में करते हैं। टैग को स्क्रिप्ट टेक्स्ट के साथ इनलाइन लिखें और API जनरेट किए गए ऑडियो में टैग के अनुरूप परफॉर्मेंस लौटाएगा—ऑडियोबुक पाइपलाइन से लेकर विज्ञापन वॉइसओवर तक। 

इसके बारे में और जानें: Eleven v3 या सेल्स टीम से संपर्क करें और आज ही शुरू करें।

ऑडियो टैग और भावनात्मक TTS: अक्सर पूछे जाने वाले सवाल

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं