पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

भावनात्मक टेक्स्ट टू स्पीच: Eleven v4 के साथ AI वॉइस परफ़ॉर्मेंस को कैसे निर्देशित करें

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

भावनात्मक टेक्स्ट टू स्पीच (TTS) स्क्रिप्ट को परफ़ॉर्मेंस में बदल देता है। एक जैसी सपाट आवाज़ में पढ़ने के बजाय, भावनात्मक TTS मॉडल हर शब्द को एहसास के साथ बोलता है और गुस्से, खुशी, उदासी, निराशा व अन्य भावों से दृश्य को जीवंत बना देता है।

स्क्रिप्ट में Audio Tags जोड़कर आप टेक्स्ट टू स्पीच परफ़ॉर्मेंस को ठीक वैसे आकार दे सकते हैं जैसे कोई निर्देशक देता है। किसी पंक्ति की तीव्रता बढ़ाने के लिए [furious], हल्के व्यंग्य का रंग जोड़ने के लिए [sarcastic], या मॉडल को यह बताने के लिए कोई और टैग जोड़ें कि आप पंक्ति को कैसे सुनना चाहते हैं।

Eleven v4 के साथ आपको भावनात्मक TTS मिलता है, जिसे आप पंक्ति-दर-पंक्ति निर्देशित कर सकते हैं। जानें कि अपनी रचना को जीवंत बनाने वाली स्क्रिप्ट कैसे तैयार करें।

भावनात्मक टेक्स्ट टू स्पीच क्या है?

भावनात्मक टेक्स्ट टू स्पीच, AI से जनरेट की गई ऐसी आवाज़ है जो किसी पंक्ति को सिर्फ पढ़ती नहीं, बल्कि परफ़ॉर्म करती है। यह भावनाएं व्यक्त करती है, समय और गति को समझती है, सही शब्दों पर ज़ोर देती है और आहें भरने व हंसने जैसी गैर-मौखिक आवाज़ें जोड़ती है।

Eleven v4 एक बेहतरीन मॉडल है जो टेक्स्ट को असली परफ़ॉर्मेंस में बदल देता है। इन-लाइन विवरणों के साथ, आपकी कल्पना के अनुसार एक ही वाक्य को फुसफुसाकर, चिल्लाकर या आंसुओं के साथ बोला जा सकता है।

चाहे आप अपने अगले लॉन्च के लिए विज्ञापन अभियान लिख रहे हों या अपने उपन्यास के अध्यायों को जीवंत बना रहे हों, Eleven v4 आपकी रचनात्मक यात्रा में सबसे उच्च-गुणवत्ता वाले टेक्स्ट टू स्पीच के साथ आपका साथ देता है।

Eleven v4 भावनात्मक निर्देशों को कैसे समझता है

Eleven v4 आपकी स्क्रिप्ट के Audio Tags से भावनात्मक निर्देश लेता है और उन्हें स्वाभाविक ऑडियो परफ़ॉर्मेंस में बदल देता है।

बेहतर अंतिम आउटपुट के लिए Eleven v4 के साथ टेक्स्ट में भावनात्मक निर्देश जोड़ने के कुछ तरीके यहां दिए गए हैं:

  • Audio Tags: अपनी हिदायतों में Audio Tags लिखें, जैसे स्क्रिप्ट में इन-लाइन निर्देश जोड़ने के लिए [whispers] या [cries]। v4 को किसी मंच कलाकार की तरह निर्देशित करके, आप भावनात्मक गहराई वाले दृश्य बना पाएंगे।
  • विराम चिह्न: अपने Audio Tags के साथ गति और बोलने के अंदाज़ को आकार देने के लिए विराम चिह्नों का इस्तेमाल करें। एलिप्सिस पंक्ति को धीमा करते हैं, डैश वक्ता को वाक्य के बीच में रोक देते हैं और विस्मयादिबोधक चिह्न तीव्रता बढ़ाते हैं। इस तरह, बिना टैग जोड़े भी आपको निर्देश देने की एक और परत मिलती है।
  • भावनात्मक निरंतरता: वाक्य की शुरुआत एक भावना से करें और Eleven v4 उसी टोन को पूरी पंक्ति में बनाए रखता है। अपने दृश्य क्रमशः बनाएं और v4 पर Audio Tags के साथ समृद्ध, संदर्भयुक्त स्क्रिप्ट तैयार करें।

यह दिखाने के लिए कि v4 के साथ टेक्स्ट को जीवंत बनाने में Audio Tags कितने असरदार हैं, आइए टैग वाले और बिना टैग वाले ऑडियो के अंतर को एक उदाहरण से समझें।

इस पहले सैंपल में हम सिर्फ एक डिफ़ॉल्ट वाक्य इस्तेमाल कर रहे हैं। संदर्भ के लिए, इन उदाहरणों में हम Siren का इस्तेमाल कर रहे हैं।

Eleven v4 पर Audio Tags के बिना कहानी का पैराग्राफ

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

अब, इस दूसरे उदाहरण में उसी वाक्य के साथ Audio Tags जोड़े गए हैं। इसमें भावनात्मक संकेत, साउंड इफेक्ट्स और टेक्स्ट से परे की आवाज़ें भी हैं, जैसे एक दुष्ट हंसी।

Eleven v4 पर Audio Tags के साथ कहानी का पैराग्राफ

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Eleven v4 के साथ पांच भावनात्मक टेक्स्ट टू स्पीच परफ़ॉर्मेंस

Eleven v4 की पूरी रेंज देखने का सबसे अच्छा तरीका है इसे खुद आज़माना। अकाउंट बनाकर आप कुछ ही मिनटों में Eleven v4 इस्तेमाल करना शुरू कर सकते हैं।

इस भावनात्मक टेक्स्ट टू स्पीच मॉडल से क्या-क्या संभव है, इसकी छोटी-सी झलक के लिए यहां एक ही पंक्ति को पांच बार रेंडर किया गया है। हर पंक्ति को अलग मंच-निर्देश दिया गया है, जो दिखाता है कि आप मॉडल से क्या कर सकते हैं।

नीचे दिए गए सभी पांच कार्ड में “मुझे नहीं लगा था कि तुम सच में वापस आओगे।” टेक्स्ट का इस्तेमाल किया गया है, जिसे भावनात्मक रूप से समृद्ध Audio Tag के साथ बदला गया है। संदर्भ के लिए, इन उदाहरणों में भी Siren का इस्तेमाल किया गया है।

[furious] जोड़ना

व्यंजन कठोर हो जाते हैं और प्लोसिव ध्वनियां अधिक स्पष्ट हो जाती हैं। पंक्ति गुस्से भरी लगती है और आरोप जैसी सुनाई देती है।

[furious]

[furious] I didn't think you'd actually come back
0:00

[excited] जोड़ना

पिच ऊंची होती है और गति तेज़ हो जाती है, जिससे वही वाक्यांश खुशी भरे स्वागत में बदल जाता है।

[excited]

[excited] I didn't think you'd actually come back.
0:00

[sarcastic] जोड़ना

पिच सपाट हो जाती है और शब्दों के स्वर लंबे खिंचते हैं। व्यंग्य Audio Tags का एक बेहतरीन उपयोग है, क्योंकि बोले गए शब्द टोन में लिखे हुए शब्दों के बिल्कुल उलट होते हैं।

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

[crying] जोड़ना

यह सुनकर आंखें नम हो जाएंगी। बोलने की गति धीमी पड़ जाती है और आवाज़ वाक्य के बीच में टूटती है। आप देखेंगे कि यहां सांसों का इस्तेमाल बहुत बड़ा असर पैदा करता है।

[crying]

[crying] I didn't think you'd actually come back.
0:00

[worried] जोड़ना

धीमी और थोड़ी झिझक भरी आवाज़ में, [worried] पंक्ति से निश्चितता हटा देता है।

[worried] I didn't think you'd actually come back.
0:00

ऐसी स्क्रिप्ट लिखने के सुझाव जिन्हें AI परफ़ॉर्म कर सके

हमने ElevenLabs टेक्स्ट टू स्पीच ऐप को यथासंभव सहज बनाया है। पेज पर आएं और लिखना शुरू करें, या अपने दृश्य में खास आवाज़ें या भावनाएं जोड़ने के लिए विवरण वाले Audio Tags डालें।

Eleven v4 के भावनात्मक टेक्स्ट टू स्पीच से बेहतरीन नतीजे पाने के लिए ये कुछ और सुझाव अपनाएं:

  1. अपने निर्देशों को दोहराकर बेहतर बनाएं: अगर कोई पंक्ति सही असर नहीं डालती, तो टेक्स्ट दोबारा लिखने के बजाय टैग बदलें। [sad] के बजाय [worried] या [annoyed] के बजाय [sarcastic] आज़माएं, और तब तक फिर से जनरेट करें जब तक डिलीवरी आपकी सोच के मुताबिक न हो जाए।
  2. पूरे दृश्य एक बार में जनरेट करें: अलग-अलग वाक्य बारीक परफ़ॉर्मेंस दे सकते हैं (जैसा कि हमने ऊपर दिखाया), लेकिन पैराग्राफ़ या लंबे टेक्स्ट के साथ इस्तेमाल करने पर Eleven v4 सबसे अच्छा काम करता है। मॉडल को दृश्य का संदर्भ समझने के लिए पर्याप्त टेक्स्ट देने से पूरे अंश में परफ़ॉर्मेंस बेहतर होती है। Eleven v4 के साथ, आप TTS ऐप में हर जनरेशन के लिए 10,000 वर्ण तक लिख सकते हैं।
  3. हर वाक्यांश के लिए एक भावना रखें: हालांकि आप वाक्य में कई Audio Tags जोड़ सकते हैं, लेकिन भ्रम से बचने के लिए हर वाक्य खंड के लिए एक ही टैग इस्तेमाल करना बेहतर है। विरोधी भावनाओं को निर्देश के रूप में जोड़ने से आउटपुट कम सटीक हो सकता है। या फिर, जिस सटीक क्लॉज़ के लिए आप चाहते हैं उसके पहले टैग जोड़ें और वाक्य के बीच में भावना बदलनी हो तो उस क्लॉज़ के बाद नया टैग लगाएं।

इन सुझावों के साथ, आप जल्द ही अपने टेक्स्ट को परफ़ॉर्मेंस में बदलने लगेंगे।

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

भावनात्मक टेक्स्ट टू स्पीच के लिए Eleven v4 के साथ शुरू करें

इस लेख में आपने जो कुछ भी देखा, वह ElevenLabs टेक्स्ट टू स्पीच ऐप में स्क्रिप्ट, एक वॉइस और Eleven v4 पर कुछ Audio Tags के साथ जनरेट किया गया था।

अपने दृश्य बनाने के लिए, बस एक वॉइस चुनें, अपनी लिखी हुई पंक्ति पेस्ट करें और अपनी पहली परफ़ॉर्मेंस को निर्देशित करें।

Eleven v4 के बारे में और जानें या शुरू करने के लिए साइन अप करें और अपनी पहली जनरेशन बनाएं।

भावनात्मक टेक्स्ट टू स्पीच AI के बारे में FAQ

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं