मल्टी-वॉइस सपोर्ट

मल्टी-कैरेक्टर बातचीत और बेहतर कहानी कहने के लिए अपने AI एजेंट को अलग-अलग वॉइस के बीच स्विच करने दें।

परिचय

मल्टी-वॉइस सपोर्ट आपके ElevenLabs एजेंट को एक ही बातचीत के दौरान अलग-अलग ElevenLabs वॉइस के बीच डायनामिक रूप से स्विच करने देता है। यह शक्तिशाली सुविधा इन कामों में मदद करती है:

  • मल्टी-कैरेक्टर कहानी-कथन: कथाओं में अलग-अलग किरदारों के लिए अलग वॉइस
  • भाषा ट्यूटोरिंग: अलग-अलग भाषाओं के लिए नेटिव स्पीकर वॉइस
  • भावनात्मक एजेंट: भावनात्मक संदर्भ के आधार पर वॉइस में बदलाव
  • रोल-प्लेइंग स्थितियां: अलग-अलग व्यक्तित्वों के लिए अलग वॉइस
मल्टी-वॉइस कॉन्फ़िगरेशन इंटरफ़ेस

यह कैसे काम करता है

मल्टी-वॉइस सपोर्ट चालू होने पर, आपका एजेंट टेक्स्ट जनरेशन के दौरान कॉन्फ़िगर की गई वॉइस के बीच स्विच करने के लिए XML-स्टाइल मार्कअप का इस्तेमाल कर सकता है। कोई खास वॉइस तय न होने पर एजेंट अपने-आप डिफ़ॉल्ट वॉइस पर लौट आता है।

The teacher said, <spanish>¡Hola estudiantes!</spanish>
Then the student replied, <student>Hello! How are you today?</student>

कॉन्फ़िगरेशन

समर्थित वॉइस जोड़ना

हर समर्थित वॉइस में ये प्रॉपर्टीज़ होती हैं:

  • वॉइस लेबल: यूनिक आइडेंटिफ़ायर (जैसे, “Joe”, “Spanish”, “Happy”)
  • वॉइस: अपनी उपलब्ध ElevenLabs वॉइस में से चुनें
  • मॉडल फैमिली: Turbo, Flash या Multilingual चुनें (वैकल्पिक)
  • भाषा: इस वॉइस के लिए डिफ़ॉल्ट भाषा बदलें (वैकल्पिक)
  • विवरण: एजेंट को यह वॉइस कब इस्तेमाल करनी चाहिए

डैशबोर्ड में अपना एजेंट खोलें, Voice टैब पर जाएं और Multi-voice support सेक्शन ढूंढें। नई समर्थित वॉइस कॉन्फ़िगर करने के लिए Add voice पर क्लिक करें।

मल्टी-वॉइस कॉन्फ़िगरेशन इंटरफ़ेस

वॉइस प्रॉपर्टीज़

एक यूनिक आइडेंटिफ़ायर, जिसका इस्तेमाल LLM इस वॉइस को रेफ़र करने के लिए करता है। ऐसे वर्णनात्मक लेबल चुनें: - किरदारों के नाम: “Alice”, “Bob”, “Narrator” - भाषाएं: “Spanish”, “French”, “German” - भावनाएं: “Happy”, “Sad”, “Excited” - भूमिकाएं: “Teacher”, “Student”, “Guide”

इस खास वॉइस के लिए एजेंट की डिफ़ॉल्ट मॉडल फैमिली बदलें: - Flash: सबसे तेज़ जनरेशन, रीयल-टाइम इस्तेमाल के लिए ऑप्टिमाइज़्ड - Turbo: स्पीड और क्वालिटी का संतुलन - Multilingual: सबसे बेहतर क्वालिटी, गैर-अंग्रेज़ी भाषाओं के लिए सबसे अच्छा - एजेंट जैसा ही: एजेंट की डिफ़ॉल्ट सेटिंग इस्तेमाल करें

इस वॉइस के लिए अलग भाषा चुनें। यह इन स्थितियों में उपयोगी है: - बहुभाषी बातचीत - भाषा ट्यूटोरिंग ऐप्लिकेशन - क्षेत्र-विशिष्ट उच्चारण

एजेंट को यह वॉइस कब इस्तेमाल करनी चाहिए, इसके लिए संदर्भ दें। उदाहरण:

  • “किसी भी स्पैनिश शब्द या वाक्यांश के लिए”
  • “जब मैसेज का कंटेंट खुशी या उत्साह दिखाता हो”
  • “जब भी किरदार Joe बोल रहा हो”

इम्प्लीमेंटेशन

XML मार्कअप सिंटैक्स

आपका एजेंट वॉइस के बीच स्विच करने के लिए XML-स्टाइल टैग इस्तेमाल करता है:

<VOICE_LABEL>text to be spoken</VOICE_LABEL>

मुख्य बातें:

  • VOICE_LABEL को अपने कॉन्फ़िगर किए गए सटीक लेबल से बदलें
  • टैग के बाहर का टेक्स्ट डिफ़ॉल्ट वॉइस का इस्तेमाल करता है
  • टैग केस-सेंसिटिव होते हैं
  • नेस्टेड टैग समर्थित नहीं हैं

सिस्टम प्रॉम्प्ट इंटीग्रेशन

समर्थित वॉइस कॉन्फ़िगर करने पर, सिस्टम अपने-आप आपके एजेंट के प्रॉम्प्ट में निर्देश जोड़ देता है:

When a message should be spoken by a particular person, use markup: "<CHARACTER>message</CHARACTER>" where CHARACTER is the character label.
Available voices are as follows:
- default: any text outside of the CHARACTER tags
- Joe: Whenever Joe is speaking
- Spanish: For any Spanish words or phrases
- Narrator: For narrative descriptions

इस्तेमाल का उदाहरण

Teacher: Let's practice greetings. In Spanish, we say <Spanish>¡Hola! ¿Cómo estás?</Spanish>
Student: How do I respond?
Teacher: You can say <Spanish>¡Hola! Estoy bien, gracias.</Spanish> which means Hello! I'm fine, thank you.

सर्वोत्तम तरीके

  • ऐसी वॉइस चुनें जो किरदारों या संदर्भों के बीच साफ़ अंतर दिखाएं
  • वॉइस कॉम्बिनेशन की जांच करें, ताकि वे साथ में अच्छी तरह काम करें
  • हर वॉइस के लिए भावनात्मक टोन और व्यक्तित्व पर विचार करें
  • भाषा बदलते समय वॉइस का भाषा और एक्सेंट से मेल होना सुनिश्चित करें
  • ऐसे वर्णनात्मक और सहज लेबल इस्तेमाल करें जिन्हें LLM समझ सके
  • लेबल छोटे और याद रखने में आसान रखें
  • लेबल में स्पेशल कैरेक्टर या स्पेस से बचें
  • समर्थित वॉइस की संख्या उतनी ही रखें, जितनी आपको वास्तव में चाहिए
  • स्विचिंग ओवरहेड कम करने के लिए जहां संभव हो एक ही मॉडल फैमिली इस्तेमाल करें
  • अपनी अपेक्षित बातचीत के पैटर्न के साथ जांच करें
  • कई वॉइस स्विच के साथ रिस्पॉन्स टाइम मॉनिटर करें
  • हर वॉइस कब इस्तेमाल करनी है, इसके लिए साफ़ विवरण दें
  • ऐसे एज केस की जांच करें जहां वॉइस स्विचिंग अस्पष्ट हो सकती है
  • जब वॉइस लेबल अस्पष्ट हों, तो फ़ॉलबैक व्यवहार पर विचार करें
  • सुनिश्चित करें कि वॉइस स्विच बातचीत में ध्यान भटकाने के बजाय उसे बेहतर बनाएं

सीमाएं

  • हर एजेंट के लिए अधिकतम 10 समर्थित वॉइस (डिफ़ॉल्ट सहित)
  • वॉइस स्विचिंग जनरेशन के दौरान बहुत कम लेटेंसी जोड़ती है
  • XML टैग सही फ़ॉर्मैट में और बंद होने चाहिए
  • मार्कअप में वॉइस लेबल केस-सेंसिटिव होते हैं
  • नेस्टेड वॉइस टैग समर्थित नहीं हैं

FAQ

अगर एजेंट ऐसा वॉइस लेबल इस्तेमाल करता है जिसे कॉन्फ़िगर नहीं किया गया है, तो टेक्स्ट डिफ़ॉल्ट वॉइस में बोला जाएगा। XML टैग अनदेखा कर दिए जाएंगे।

हां, आप एक ही रिस्पॉन्स में वॉइस बदल सकते हैं। हर टैग किए गए सेक्शन में तय की गई वॉइस इस्तेमाल होगी, जबकि बिना टैग वाला टेक्स्ट डिफ़ॉल्ट वॉइस इस्तेमाल करेगा।

वॉइस स्विचिंग बहुत कम ओवरहेड जोड़ती है। बातचीत में हर वॉइस के पहले इस्तेमाल पर वॉइस इनिशियलाइज़ होने के कारण लेटेंसी थोड़ी अधिक हो सकती है।

हां, आप कई लेबल कॉन्फ़िगर कर सकते हैं जो एक ही ElevenLabs वॉइस का इस्तेमाल करते हों, लेकिन अलग मॉडल फैमिली, भाषाओं या संदर्भों के साथ।

अपने सिस्टम प्रॉम्प्ट में साफ़ उदाहरण दें और अच्छी तरह जांच करें। आप खास स्थितियां शामिल कर सकते हैं जहां वॉइस स्विचिंग होनी चाहिए, साथ ही XML मार्कअप फ़ॉर्मैट के उदाहरण भी।