वॉइस डिज़ाइन
वॉइस डिज़ाइन
टेक्स्ट प्रॉम्प्ट से वॉइस बनाने की गाइड।
ओवरव्यू
वॉइस डिज़ाइन क्रिएटर्स को तब मदद करता है, जब उन्हें चाहिए वाली सटीक वॉइस वॉइस लाइब्रेरी में उपलब्ध नहीं होती। अगर आपको अपने प्रोजेक्ट के लिए उपयुक्त वॉइस नहीं मिलती, तो आप एक बना सकते हैं। वॉइस डिज़ाइन तेज़ी से अलग-अलग विकल्प देखने और उनमें बदलाव करने के लिए सबसे अच्छा है, और आउटपुट क्वालिटी आपके प्रॉम्प्ट और इस्तेमाल के मामले के अनुसार अलग हो सकती है। अगर आपको सबसे एकसमान, प्रोडक्शन-रेडी क्वालिटी चाहिए, तो प्रोफेशनल वॉइस क्लोन्स (PVC) फिलहाल हमारे प्लेटफ़ॉर्म की सबसे उच्च-क्वालिटी वॉइसेस हैं—इसलिए अगर हमारी लाइब्रेरी में आपकी ज़रूरत के अनुकूल कोई PVC उपलब्ध है, तो हम उसका इस्तेमाल करने की सलाह देते हैं।
आप ElevenLabs ऐप में Voices -> My Voices -> Add a new voice -> Voice Design पर जाकर या API के ज़रिए वॉइस डिज़ाइन पा सकते हैं।
जब आप जनरेट पर क्लिक करते हैं, तो हम आपके लिए वॉइस के तीन विकल्प जनरेट करेंगे। वॉइस डिज़ाइन इस्तेमाल करने के लिए केवल आपके प्रीव्यू टेक्स्ट को जनरेट करने में लगने वाले क्रेडिट्स का शुल्क लिया जाता है। हम आपके लिए तीन सैंपल जनरेट करते हैं, फिर भी आपसे केवल एक बार शुल्क लिया जाता है। “टेक्स्ट टू प्रीव्यू” टेक्स्ट बॉक्स में आप कटने वाले कैरेक्टर्स की संख्या देख सकते हैं।
जनरेट करने के बाद, आप किसी एक जनरेशन को चुनकर सेव कर सकते हैं, जो आपके एक वॉइस स्लॉट का इस्तेमाल करेगी।
प्रॉम्प्टिंग गाइड
प्रॉम्प्ट आपकी वॉइस की बुनियाद है। यह मॉडल को बताता है कि आप किस तरह की वॉइस बनाना चाहते हैं—एक्सेंट और किरदार के प्रकार से लेकर वॉइस के जेंडर और वाइब तक। अच्छी तरह बनाया गया प्रॉम्प्ट एक सामान्य वॉइस और आपकी कल्पना के बिल्कुल अनुकूल वॉइस के बीच अंतर पैदा कर सकता है। आम तौर पर, ज़्यादा वर्णनात्मक और बारीक प्रॉम्प्ट अधिक सटीक और सूक्ष्म नतीजे देते हैं। आप जितनी ज़्यादा जानकारी देंगे—जिसमें उम्र, जेंडर, टोन, एक्सेंट, गति, भावना, स्टाइल और अन्य बातें शामिल हैं—मॉडल उतना ही बेहतर तरीके से समझ पाएगा और ऐसी वॉइस दे पाएगा जो सोच-समझकर बनाई गई और आपकी ज़रूरत के अनुसार लगे।
हालांकि, कभी-कभी छोटे और सरल प्रॉम्प्ट भी काम कर सकते हैं, खासकर जब आप ज़्यादा तटस्थ या व्यापक रूप से उपयोग की जा सकने वाली वॉइस चाहते हैं। उदाहरण के लिए, “एक शांत पुरुष नैरेटर” आपको बिना विस्तार में जाए़ ठीक वही दे सकता है जो आपको चाहिए—खासकर तब, जब आप कोई बहुत विशिष्ट किरदार या स्टाइल नहीं बनाना चाहते। सही स्तर की जानकारी आपके इस्तेमाल के मामले पर निर्भर करती है। क्या आप एक फैंटेसी किरदार बना रहे हैं? एक वर्चुअल असिस्टेंट? सूखे हास्य-बोध वाली 60 वर्ष की थकी हुई न्यू यॉर्कर? आप अपने प्रॉम्प्ट में इसे जितना स्पष्ट रूप से परिभाषित करेंगे, आउटपुट उतना ही आपकी कल्पना के करीब होगा।
सुझाया गया प्रॉम्प्ट फ़ॉर्मैट
एकसमान नतीजों के लिए, अपने प्रॉम्प्ट को इस फ़ॉर्मैट में लिखें:
उदाहरण:
मूल स्पेनिश, español europeo (sin rasgos de español latinoamericano)। महिला, 35–40। ठीक क्वालिटी। व्यक्तित्व: operadora de soporte confiable। भावना: आश्वस्त करने वाली, सतर्क, आत्मविश्वासी। कोमल इंटोनेशन, आगे की निकटता और नॉइज़-फ़्री सिग्नल के साथ सहज, प्राकृतिक टिम्बर। मददगार जानकारी पर साफ़ ज़ोर देते हुए आरामदायक गति से अपडेट देती है और सहानुभूति व प्रोफेशनलिज़्म दिखाती है।
इन आम गलतियों से बचें
- जब आपका मतलब इंटोनेशन हो, तब “accent” का इस्तेमाल न करें — इससे अनचाहे डायलेक्ट बदलाव हो सकते हैं। इसके बजाय, इंटोनेशन, ज़ोर देने के तरीके या डिलीवरी पैटर्न का वर्णन करें।
- FX शब्दों से बचें — “reverb,” “echo,” “phone,” या “tape” जैसे शब्द आउटपुट क्वालिटी पर नकारात्मक असर डाल सकते हैं।
- भाषा और डायलेक्ट स्पष्ट रूप से बताएं — बदलाव से बचने के लिए पहले वाक्य में हमेशा भाषा और क्षेत्रीय वैरिएंट बताएं।
ऑडियो क्वालिटी
ऑडियो क्वालिटी का मतलब जनरेट की गई वॉइस की स्पष्टता, साफ़-सफ़ाई और कुल गुणवत्ता से है। डिफ़ॉल्ट रूप से, ElevenLabs साफ़ और प्राकृतिक सुनाई देने वाला ऑडियो बनाने का लक्ष्य रखता है — लेकिन अगर आपके प्रोजेक्ट को किसी खास स्तर की गुणवत्ता चाहिए, तो उसे अपने प्रॉम्प्ट में साफ़ तौर पर शामिल करना बेहतर है।
उच्च-गुणवत्ता वाले नतीजों के लिए, आप अपनी वॉइस डिस्क्रिप्शन में “बेहतरीन ऑडियो क्वालिटी” या “स्टूडियो-क्वालिटी रिकॉर्डिंग” जैसा वाक्यांश जोड़कर मॉडल की मदद कर सकते हैं। इससे यह सुनिश्चित करने में मदद मिलती है कि वॉइस को अधिकतम स्पष्टता, न्यूनतम विकृति और एक निखरे हुए फिनिश के साथ रेंडर किया जाए।
आप ऐसे खास क्वालिटी डिस्क्रिप्टर भी इस्तेमाल कर सकते हैं जो एक जैसे नतीजे देते हैं:
- ठीक-ठाक क्वालिटी
- अच्छी क्वालिटी
- बहुत अच्छी क्वालिटी
- बेहतरीन क्वालिटी
- स्टूडियो क्वालिटी
- ब्रॉडकास्ट क्वालिटी
प्रॉम्प्ट में शामिल किए जाने पर ये डिस्क्रिप्टर सर्वोच्च ऑडियो क्वालिटी पाने में मदद करते हैं।
अगर वॉइस बहुत खास या विशिष्ट हो, तो इस तरह के वाक्यांश शामिल करने से कभी-कभी प्रॉम्प्ट की सामान्य सटीकता कम हो सकती है।
कुछ रचनात्मक मामलों में कम ऑडियो क्वालिटी जानबूझकर भी रखी जा सकती है, जैसे फ़ोन कॉल, पुराने रेडियो ब्रॉडकास्ट या मिले हुए फुटेज का सिमुलेशन करते समय। ऐसी स्थितियों में, या तो क्वालिटी डिस्क्रिप्टर पूरी तरह छोड़ दें या साफ़ तौर पर ऐसे वाक्यांश शामिल करें:
- “लो-फिडेलिटी ऑडियो”
- “खराब ऑडियो क्वालिटी”
- “वॉइसमेल जैसा सुनाई देता है”
- “पुराने टेप रिकॉर्डर की तरह दबा हुआ और दूर का”
आपके प्रॉम्प्ट में इस वाक्यांश की जगह लचीली है — यह शुरुआत या अंत में आ सकता है, हालांकि हमने पाया है कि दोनों जगह यह अच्छी तरह काम करता है।
उम्र, टोन/टिम्बर और जेंडर
ये तीन विशेषताएं वॉइस डिज़ाइन की नींव हैं, जो वॉइस की समग्र पहचान और भावनात्मक प्रभाव तय करती हैं। आप जितनी अधिक जानकारी देंगे, AI के लिए आपकी रचनात्मक सोच के अनुकूल वॉइस बनाना उतना ही आसान होगा — चाहे आप एक विश्वसनीय किरदार बना रहे हों, एक प्रभावशाली नैरेटर तैयार कर रहे हों या एक वर्चुअल असिस्टेंट डिज़ाइन कर रहे हों।
उम्र
वॉइस की महसूस होने वाली उम्र बताने से उसकी परिपक्वता, वोकल टेक्सचर और ऊर्जा तय करने में मदद मिलती है। AI को सही वोकल क्वालिटी की ओर निर्देशित करने के लिए खास शब्दों का इस्तेमाल करें।
उपयोगी डिस्क्रिप्टर:
- “किशोर पुरुष” / “किशोरी महिला”
- “युवा वयस्क” / “20 की उम्र में” / “30 की शुरुआती उम्र में”
- “अधेड़ पुरुष” / “40 की उम्र में महिला”
- “बुज़ुर्ग पुरुष” / “उम्रदराज़ महिला” / “80 की उम्र में पुरुष”
टोन/टिम्बर
यह वॉइस की भौतिक गुणवत्ता को दर्शाता है, जो पिच, रेज़ोनेंस और वोकल टेक्सचर से बनती है। यह भावनात्मक डिलीवरी या रवैये से अलग है।
सामान्य टोन/टिम्बर डिस्क्रिप्टर:
- “गहरी” / “लो-पिच्ड”
- “मुलायम” / “भरपूर”
- “खुरदरी” / “रैस्पी”
- “नाक से निकलने वाली” / “तीखी”
- “हवादार” / “सांस भरी”
- “गूंजती हुई” / “रेज़ोनेंट”
- “हल्की” / “पतली”
- “गर्माहट भरी” / “मधुर”
- “टनटनाती” / “मेटैलिक”
जेंडर
जेंडर अक्सर पिच, वोकल वज़न और टोनल मौजूदगी को प्रभावित करता है — लेकिन आप पहचान के बजाय ध्वनि का वर्णन करके साधारण श्रेणियों से आगे जा सकते हैं।
उदाहरण:
- “कम पिच वाली, भारी महिला वॉइस”
- “मर्दाना पुरुष वॉइस, गहरी और रेज़ोनेंट”
- “न्यूट्रल जेंडर — मुलायम और मिड-पिच्ड”
एक्सेंट
एक्सेंट किसी वॉइस की क्षेत्रीय, सांस्कृतिक और भावनात्मक पहचान तय करने में अहम भूमिका निभाता है। अगर आपका प्रोजेक्ट एक प्रामाणिक ध्वनि पर निर्भर है — चाहे वह यथार्थपरक हो या किरदार के लिए स्टाइलाइज़ की गई हो — तो वांछित एक्सेंट के बारे में स्पष्ट और सोच-समझकर बताना ज़रूरी है।
वाक्यांश का चुनाव मायने रखता है - कुछ शब्दों से अधिक एक जैसे नतीजे मिलते हैं। उदाहरण के लिए, एक्सेंट कितना स्पष्ट होना चाहिए, यह बताने के लिए “strong” की तुलना में “thick” से अक्सर बेहतर नतीजे मिलते हैं। इसमें काफी ट्रायल और एरर होता है, और हम आपको शब्दों के साथ प्रयोग करने तथा जितना संभव हो उतना रचनात्मक और वर्णनात्मक होने के लिए प्रोत्साहित करते हैं।
“accent” शब्द इस्तेमाल करते समय सावधान रहें — अगर आपका मतलब क्षेत्रीय बोली के बजाय इंटोनेशन या ज़ोर देने के पैटर्न से है, तो उनकी जगह इन्हीं शब्दों का इस्तेमाल करें। इंटोनेशन के अर्थ में “accent” का इस्तेमाल अनचाहे डायलेक्ट बदलाव ट्रिगर कर सकता है।
- स्पष्ट एक्सेंट प्रॉम्प्ट के उदाहरण:
- “घने फ्रेंच एक्सेंट वाला एक अधेड़ पुरुष”
- “हल्के सदर्न ड्रॉल वाली एक युवा महिला”
- “भारी ईस्टर्न यूरोपियन एक्सेंट वाला एक बूढ़ा पुरुष”
- “स्पष्ट ब्रिटिश एक्सेंट में बोलती एक खुशमिज़ाज महिला”
- “नरम आयरिश लहजे वाला एक युवा पुरुष”
- “न्यूट्रल अमेरिकन एक्सेंट वाली एक प्रभावशाली वॉइस”
- “क्षेत्रीय ऑस्ट्रेलियाई एक्सेंट वाला एक पुरुष, बेफ़िक्र और नाक से बोलने वाला”
“foreign” या “exotic” जैसे बहुत अस्पष्ट डिस्क्रिप्टर से बचें — वे सटीक नहीं होते और असंगत नतीजे दे सकते हैं।
बेहतर नियंत्रण के लिए एक्सेंट को टोन, उम्र या पेसिंग जैसी दूसरी विशेषताओं के साथ मिलाएं। जैसे, “घने न्यूयॉर्क एक्सेंट वाली एक व्यंग्यात्मक बूढ़ी महिला, जो धीरे बोलती है।”
फैंटेसी या काल्पनिक वॉइस के लिए, आप प्रेरणा के रूप में असली दुनिया के एक्सेंट सुझा सकते हैं:
- “घने ब्रिटिश एक्सेंट वाला एक एल्फ। वह शाही और गीतात्मक है।”
- “रैस्पी ईस्टर्न यूरोपियन एक्सेंट वाला एक गॉब्लिन।”
पेसिंग
पेसिंग उस गति और लय को दर्शाती है, जिस पर एक वॉइस बोलती है। यह वॉइस के व्यक्तित्व, भावनात्मक टोन और स्पष्टता को आकार देने का एक अहम हिस्सा है। पेसिंग के बारे में स्पष्ट होना खास तौर पर तब ज़रूरी है, जब आप कहानी कहने, विज्ञापन, किरदार के संवाद या निर्देशात्मक कंटेंट जैसे खास उपयोगों के लिए वॉइस डिज़ाइन कर रहे हों।
वॉइस को कितनी तेज़ या धीमी बोलनी चाहिए, यह बताने के लिए साफ़ भाषा इस्तेमाल करें। आप यह भी बता सकते हैं कि पेसिंग कैसी महसूस होती है — स्थिर, अनियमित, सोच-समझकर या सहज। अगर पेसिंग बदलती है, तो यह ज़रूर बताएं कि कहां और क्यों।
पेसिंग डिस्क्रिप्टर के उदाहरण:
- “तेज़ी से बोलते हुए” / “तेज़ गति से”
- “सामान्य गति से” / “सामान्य रूप से बोलते हुए”
- “धीरे बोलते हुए” / “धीमी लय में”
- “सोच-समझकर और नपी-तुली पेसिंग”
- “हर शब्द का स्वाद लेते हुए, खींचकर”
- “जल्दबाज़ी भरी कैडेंस के साथ, जैसे उन्हें जल्दी हो”
- “आरामदेह और बातचीत वाली पेसिंग”
- “गति में लयबद्ध और संगीतात्मक”
- “अचानक ठहराव और तेज़ उछालों वाली अनियमित पेसिंग”
- “शब्दों के बीच एक समान टाइमिंग वाली स्थिर पेसिंग”
- “स्टैकैटो डिलीवरी”
प्रीव्यू के लिए टेक्स्ट
एक मज़बूत वॉइस प्रॉम्प्ट लिखने के बाद, उस वॉइस का प्रीव्यू लेने के लिए इस्तेमाल किया गया टेक्स्ट यह तय करने में अहम भूमिका निभाता है कि वह वास्तव में कैसी सुनाई देगी। प्रीव्यू टेक्स्ट एक परफॉर्मेंस स्क्रिप्ट की तरह काम करता है — यह टोन, पेसिंग और भावनात्मक डिलीवरी तय करता है, जिसे वॉइस मिलाने की कोशिश करेगी।
सबसे अच्छे नतीजों के लिए, आपका प्रीव्यू टेक्स्ट वॉइस डिस्क्रिप्शन के अनुकूल होना चाहिए, उसके विपरीत नहीं। उदाहरण के लिए, अगर आपका प्रॉम्प्ट “हल्के जापानी एक्सेंट वाली शांत और विचारशील युवा महिला वॉइस” का वर्णन करता है, तो “अरे! तुमने इस बेकार जगह का जो हाल किया है, वह मुझसे बर्दाश्त नहीं होता!!!” जैसे वाक्य का इस्तेमाल उस इरादे से टकराएगा। मॉडल उस असंगति को मिलाने की कोशिश करेगा, जिससे अक्सर अप्राकृतिक या असंगत नतीजे मिलते हैं।
इसके बजाय, ऐसा सैंपल टेक्स्ट इस्तेमाल करें जो वॉइस के इच्छित व्यक्तित्व और भावनात्मक टोन को दर्शाता हो। ऊपर दिए उदाहरण के लिए, “हाल में बहुत शांति रही है… मुझे सोचने का समय मिला, और शायद मुझे सबसे ज़्यादा इसी की ज़रूरत थी।” जैसा टेक्स्ट प्रॉम्प्ट का समर्थन करता है और अधिक प्राकृतिक, सुसंगत वॉइस जनरेट करने में मदद करता है।
इसके अलावा, हमने पाया है कि लंबे प्रीव्यू टेक्स्ट से ज़्यादा स्थिर और अभिव्यक्तिपूर्ण नतीजे मिलते हैं। छोटे वाक्यांश कभी-कभी अचानक या असंगत सुनाई दे सकते हैं, खासकर टोन या पेसिंग जैसी सूक्ष्म खूबियों को जांचते समय। मॉडल को ज़्यादा संदर्भ देना — एक पूरा वाक्य या छोटा पैराग्राफ भी — उसे वॉइस का अधिक सहज और सटीक प्रतिनिधित्व देने में मदद करता है।
पैरामीटर्स
लाउडनेस
टेक्स्ट टू प्रीव्यू जनरेशन और अंततः सेव की गई वॉइस का वॉल्यूम नियंत्रित करता है।
गाइडेंस स्केल
यह तय करता है कि प्रॉम्प्ट का कितनी सख्ती से पालन किया जाए। उच्च मान प्रॉम्प्ट का अधिक सख्ती से पालन करेंगे, लेकिन अगर प्रॉम्प्ट बहुत विशिष्ट है तो ऑडियो क्वालिटी खराब हो सकती है। वहीं, कम मान प्रॉम्प्ट की सटीकता की कीमत पर मॉडल को अधिक रचनात्मक होने देते हैं। अगर प्रॉम्प्ट से बिल्कुल सटीक मिलान करने के बजाय परफॉर्मेंस और ऑडियो क्वालिटी ज़्यादा महत्वपूर्ण है, तो कम मान इस्तेमाल करें। जब एक्सेंट या टोन की सटीकता सबसे अधिक महत्वपूर्ण हो, तो उच्च मान सुझाए जाते हैं।
विशेषताएं और उदाहरण
इन डिस्क्रिप्टर को लिखने के तरीके के साथ प्रयोग करें। उदाहरण के लिए, “बेहतरीन ऑडियो क्वालिटी” को “ऑडियो क्वालिटी बेहतरीन है” के रूप में भी लिखा जा सकता है। इनसे कभी-कभी अलग नतीजे मिल सकते हैं!