पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

वॉइस डिज़ाइन - ऑडियो के लिए पहला जनरेटिव AI

प्रकाशित

सुनेंइस आर्टिकल को सुनें

पिछले महीने हमने घोषणा की थी कि वॉइस बनाने वाला हमारा जनरेटिव मॉडल जल्द आ रहा है। अब यह आखिरकार आ गया है और अपनी तरह का पहला मॉडल है — हम इसे वॉइस डिज़ाइन कहते हैं। यह फीचर आपको लिंग, उम्र और लहजे जैसे मुख्य गुण चुनकर, बिल्कुल शुरुआत से नई वॉइस बनाने देता है। एक जैसी मुख्य पैरामीटर सेटिंग्स के साथ भी, हमारा मॉडल हर बार जनरेट पर रैंडमनेस जोड़ता है, ताकि आप जो भी वॉइस सुनें, वह पूरी तरह अनोखी हो। वॉइस डिज़ाइन पब्लिशर्स और क्रिएटर्स को सबसे बहुमुखी AI स्टोरीटेलिंग टूल्स देने की हमारी व्यापक कोशिश का हिस्सा है।

वॉइस डिज़ाइन

वॉइस डिज़ाइन के पीछे का मॉडल मुख्य रूप से स्पीच सिंथेसिस और वॉइस क्लोनिंग पर हमारी रिसर्च का नतीजा है, हालांकि हमें अलग से ही स्पीच के लिए एक जनरेटिव टूल का विचार हमेशा पसंद था। जनरेटिव टेक्स्ट-टू-इमेज और चैटबॉट मॉडल्स के व्यावहारिक उपयोग हम पहले ही देख चुके थे, लेकिन ऑडियो के लिए ऐसा टूल मौजूद नहीं था। लॉन्च के बाद से ही हमें अपने बैंक में और स्पीकर्स जोड़ने के अनुरोध मिल रहे हैं। लाइब्रेरी में अनगिनत वॉइसेज़ भर देने और आपको यह जानने के लिए हर प्रीव्यू सुनने पर मजबूर करने के बजाय कि कौन कौन है, हमने तरीका बदलने का फैसला किया। अब आप स्पीकर की पहचान तय कर सकते हैं, और इन सीमाओं के भीतर अनंत विविधता भी पा सकते हैं।

वॉइस चुनने में कुछ नियंत्रण जोड़ना ज़रूरी था, क्योंकि हमारे यूज़र्स अक्सर अपनी स्क्रिप्ट के लिए आवाज़ की खास विशेषताएं चाहते हैं। यह सुनिश्चित करना भी उतना ही अहम था कि हर जनरेट की गई वॉइस अनोखी हो, क्योंकि कई उपयोग के मामलों में किसी वॉइस तक विशेष पहुंच की ज़रूरत होती है या उससे फ़ायदा मिलता है। यूज़र्स को रचनात्मकता का नया माध्यम देने के अलावा, वॉइस डिज़ाइन से बनी वॉइसेज़ पूरी तरह कृत्रिम होती हैं और किसी वास्तविक व्यक्ति की नहीं होतीं।

उपयोग

हमारे मुख्य स्पीच सिंथेसिस टूल से लिखे हुए टेक्स्ट को आसानी से बेहतरीन ऑडियो में बदलने के अलावा, किताबों के लेखक अब वॉइस डिज़ाइन का इस्तेमाल करके नैरेशन पर रचनात्मक नियंत्रण रख सकते हैं और हर किरदार के व्यक्तित्व को कस्टम वॉइसेज़ से आकार दे सकते हैं।

न्यूज़ पब्लिशर्स जो ऑडियो में कदम रख रहे हैं, उन्हें अपनी कहानियों के लिए वॉइसेज़ चाहिए। नैरेटर उस प्रकाशन से पहचाने जाने लगते हैं जिसका वे प्रतिनिधित्व करते हैं, इसलिए सही वॉइसओवर चुनना एक अहम काम है, जो अक्सर बार-बार नहीं किया जाता। वॉइस डिज़ाइन पब्लिशर्स को तुरंत लगभग अनगिनत नैरेटर्स चुनने और उनकी तुलना करने देता है। इससे उन्हें यह भरोसा भी मिलता है कि एक खास वॉइस सिर्फ़ उनका ही प्रतिनिधित्व करेगी।

गेम डेवलपर्स को अब यह तय नहीं करना पड़ता कि किसी खास किरदार पर रिकॉर्डिंग की लागत लगाना उचित है या नहीं। पहले मौन रहने वाले हजारों NPCs को अब अलग-अलग व्यक्तित्व मिल सकते हैं, जिससे वर्चुअल इमर्शन की सीमाएं और आगे बढ़ती हैं।

चाहे आप अपनी अगली रिलीज़ पर काम कर रहे कंटेंट क्रिएटर हों या कंपनी कम्युनिकेशंस को आवाज़ देने की सोच रहे कॉर्पोरेट अधिकारी — खास उपयोग के मामलों और दर्शकों के लिए जीवंत, प्रभावशाली ऑडियो डिज़ाइन करने की संभावनाएं अब असीमित हैं।

इकोसिस्टम

वॉइस डिज़ाइन नैरेशन एडिटिंग के उन कई फीचर्स में से एक है, जिन्हें हम इस साल लॉन्च करने की योजना बना रहे हैं। अगला है स्टूडियो — बड़े टेक्स्ट को व्यवस्थित करने के लिए हमारा नया वर्कस्टेशन, पॉज़ जोड़ना, ऑडियो के हिस्सों को फिर से जनरेट करना और टेक्स्ट के भाग अलग-अलग स्पीकर्स को असाइन करना। स्टूडियो मार्च के आखिर में आ रहा है और इस साल Q2 में बाद में इसे इंटोनेशन एडिटिंग सपोर्ट के साथ और बेहतर बनाया जाएगा।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं