अभिव्यंजक मोड

ऐसे वॉइस एजेंट बनाएं जो बातचीत के संदर्भ के आधार पर टोन, समय और भावनात्मक अभिव्यक्ति को अनुकूलित करें।

परिचय

अभिव्यंजक मोड एजेंट को इरादे, भावना और ज़ोर को दर्शाने वाली स्पीच देने में सक्षम बनाता है। यह यूज़र कैसे बोलते हैं और क्या कहते हैं, उसके अनुसार रियल टाइम में अनुकूलित होता है। यह कन्वर्सेशनल स्टैक में सिस्टम-लेवल के दो सुधारों पर बना है:

  1. Eleven v3 Conversational — ElevenAgents में उपलब्ध सबसे भावनात्मक रूप से बुद्धिमान, संदर्भ-सजग टेक्स्ट टू स्पीच मॉडल।
  2. नया टर्न-टेकिंग सिस्टम — कम रुकावटों के साथ बेहतर समय पर जवाब।

अपने एजेंट के TTS मॉडल के रूप में Eleven v3 Conversational चुनने पर अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू होता है।

Eleven v3 Conversational

Eleven v3 Conversational, Eleven v3 का अल्ट्रा-लो-लेटेंसी वर्ज़न है, जिसे लाइव, दोतरफ़ा बातचीत के लिए ऑप्टिमाइज़ किया गया है। यह टर्न्स के बीच बातचीत का संदर्भ बनाए रखता है और हर बातचीत के टोन और इरादे के मुताबिक डिलीवरी को अनुकूलित करता है।

  • संदर्भ-सजग डिलीवरी: एजेंट बातचीत के संदर्भ के आधार पर टोन बदलते हैं — यूज़र के चिंतित लगने पर ज़्यादा शांत ढंग से जवाब देते हैं, या स्पष्टता ज़रूरी होने पर ज़्यादा सीधे बोलते हैं।
  • स्पष्ट भावनात्मक नियंत्रण: ब्रैंड वॉइस और कंप्लायंस आवश्यकताओं के अनुरूप डिलीवरी के लिए, सटीक ट्रिगर से लेकर व्यापक स्थितियों तक, सिस्टम प्रॉम्प्ट नियमों से डिलीवरी गाइड करें।
  • 70+ भाषाओं का समर्थन: Flash मॉडल की ~32 भाषाओं से बढ़कर 70+ भाषाएं, साथ ही उन भाषाओं में बेहतर अभिव्यक्ति जहां पहले बारीकियां कमज़ोर थीं, जिनमें जापानी भी शामिल है।
  • अभिव्यंजक टैग: LLM डिलीवरी के खास पलों को नियंत्रित करने के लिए [laughs], [whispers] या [sighs] जैसे टैग आउटपुट कर सकता है।

Eleven v3 Conversational की कीमत Agents में अन्य ElevenLabs TTS मॉडल जितनी ही है, जो $0.08 प्रति मिनट से शुरू होती है।

टर्न-टेकिंग सिस्टम

नया टर्न-टेकिंग सिस्टम Scribe v2 Realtime के रियल-टाइम सिग्नल — जिनमें भावनात्मक संकेत और बोलने के पैटर्न शामिल हैं — का इस्तेमाल यह तय करने के लिए करता है कि एजेंट को कब बोलना, रुकना या इंतज़ार करना चाहिए। इससे एजेंट ज़्यादा स्वाभाविक रूप से जवाब दे पाते हैं, खासकर भावनात्मक स्थितियों में।

उदाहरण के लिए, “हां” एक पूरा स्वीकार हो सकता है या आगे बोलते रहने का संकेत। ट्रांसक्रिप्ट के साथ यह भी विश्लेषण करके कि इसे कैसे कहा गया था (प्रोसोडी जैसे स्पीच संकेत), सिस्टम एजेंट के जवाब का समय ज़्यादा स्वाभाविक ढंग से तय करता है।

टर्न-टेकिंग व्यवहार को टर्न ईगरनेस सेटिंग से और ट्यून किया जा सकता है।

कॉन्फ़िगरेशन

अभिव्यंजक मोड चालू करना

1

TTS मॉडल चुनें

अपने एजेंट का TTS मॉडल V3 Conversational पर सेट करें। इस मॉडल के साथ अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू होता है।

डैशबोर्ड में अपना एजेंट खोलें, एजेंट वॉइस टैब पर जाएं और अपने टेक्स्ट टू स्पीच मॉडल के रूप में V3 Conversational चुनें। बदलाव सेव करें।

अभिव्यंजक मोड चालू करना

2

अपने सिस्टम प्रॉम्प्ट में भावनात्मक डिलीवरी गाइड करें

एजेंट अपने टोन को कैसे अनुकूलित करे, यह निर्देश देने के लिए उसके सिस्टम प्रॉम्प्ट में निर्देश जोड़ें। आप व्यापक मार्गदर्शन या विशिष्ट ट्रिगर इस्तेमाल कर सकते हैं।

सिस्टम प्रॉम्प्ट उदाहरण

सिस्टम प्रॉम्प्ट में प्राकृतिक भाषा के निर्देशों के ज़रिए अपने एजेंट की भावनात्मक डिलीवरी गाइड करें। मॉडल इन्हें संदर्भ के अनुसार समझता है, इसलिए हर स्थिति के लिए स्पष्ट टैग ज़रूरी नहीं हैं।

व्यापक मार्गदर्शन

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

विशिष्ट ट्रिगर

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

अभिव्यंजक टैग का इस्तेमाल

संदर्भ-सजग डिलीवरी के अलावा, LLM खास पलों को नियंत्रित करने के लिए स्पष्ट टैग आउटपुट कर सकता है। सामान्य टैग में शामिल हैं:

  • [laughs] — स्पीच में हंसी जोड़ता है
  • [whispers] — फुसफुसाहट के लिए वॉल्यूम कम करता है
  • [sighs] — आह भरने का प्रभाव जोड़ता है
  • [slow] — स्पीच डिलीवरी धीमी करता है
  • [excited] — डिलीवरी में उत्साह जोड़ता है

हर टैग सामान्य डिलीवरी पर लौटने से पहले स्पीच के लगभग अगले 4-5 शब्दों को प्रभावित करता है।

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

सर्वोत्तम तरीके

अपने एजेंट को उसकी भावनात्मक डिलीवरी स्थिति के मुताबिक रखने के लिए गाइड करें। निराश ग्राहक को शांत और सहानुभूतिपूर्ण जवाब मिलना चाहिए। अच्छी खबर साझा करने वाले यूज़र को सच्ची गर्मजोशी सुनाई देनी चाहिए। बेमेल टोन भरोसा कम करती है।

केवल मॉडल के निर्णय पर निर्भर रहने के बजाय, अपने सिस्टम प्रॉम्प्ट में स्पष्ट टोन दिशानिर्देश तय करें। इससे आपके ब्रैंड वॉइस और कंप्लायंस आवश्यकताओं के अनुरूप लगातार डिलीवरी सुनिश्चित होती है।

अभिव्यंजक डिलीवरी अलग-अलग भाषाओं में अलग हो सकती है। हर लक्ष्य भाषा में अपने एजेंट को टेस्ट करें, ताकि भावनात्मक बारीकी इच्छानुसार पहुंचे, खासकर उन भाषाओं में जहां बातचीत के मानदंड अलग हैं।

अभिव्यंजक मोड को उचित टर्न ईगरनेस सेटिंग्स के साथ जोड़ें। पेशेंट मोड भावनात्मक रूप से संवेदनशील बातचीत में यूज़र को ज़्यादा जगह देता है, जबकि ईगर मोड तेज़ गति वाली बातचीत के लिए काम करता है।

यूज़र अभिव्यंजक डिलीवरी पर कैसे प्रतिक्रिया देते हैं, इसे ट्रैक करने के लिए बातचीत एनालिटिक्स का इस्तेमाल करें। बातचीत के नतीजों और यूज़र फ़ीडबैक के आधार पर अपने टोन दिशानिर्देश बेहतर बनाएं।

सीमाएं

  • Eleven v3 Conversational, Professional Voice Clones (PVCs) की विशेषताओं को सुरक्षित नहीं रखता — आउटपुट मूल PVC वॉइस जैसा नहीं लग सकता।
  • अभिव्यंजक टैग के प्रभाव सामान्य डिलीवरी पर लौटने से पहले लगभग 4-5 शब्दों तक रहते हैं।
  • अभिव्यक्ति वॉइस और भाषा के अनुसार अलग हो सकती है।

FAQ

नहीं। Eleven v3 Conversational की कीमत Agents में अन्य ElevenLabs TTS मॉडल जितनी ही है, जो $0.08 प्रति मिनट से शुरू होती है।

अपने एजेंट के TTS मॉडल के रूप में V3 Conversational चुनें। इस मॉडल के साथ अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू होता है।

सिस्टम Scribe v2 Realtime के रियल-टाइम सिग्नल, जिनमें भावनात्मक संकेत और स्पीच पैटर्न शामिल हैं, का इस्तेमाल करके अनुमान लगाता है कि एजेंट को कब जवाब देना चाहिए। यह जवाब का समय स्वाभाविक रखने के लिए ट्रांसक्रिप्ट और शब्द कैसे बोले गए (प्रोसोडी), दोनों का विश्लेषण करता है।

Eleven v3 Conversational अभी PVC विशेषताओं को अच्छी तरह सुरक्षित नहीं रखता। अगर आपकी PVC वॉइस पहचान बनाए रखना महत्वपूर्ण है, तो इसके बजाय Flash v2 इस्तेमाल करने पर विचार करें।

Eleven v3 Conversational, Flash मॉडल की ~32 भाषाओं से बढ़कर 70+ भाषाओं को सपोर्ट करता है। इसमें जापानी जैसी भाषाओं में बेहतर अभिव्यक्ति शामिल है, जहां पहले बारीकियां कमज़ोर थीं।

Eleven v3 Conversational, Flash और Multilingual v2 की तुलना में ज़्यादा भावनात्मक रेंज देता है और बातचीत के संदर्भ के आधार पर डिलीवरी को अनुकूलित कर सकता है। यह Flash की ~32 भाषाओं की तुलना में 70+ भाषाओं को सपोर्ट करता है। इसकी कीमत अन्य मॉडल जितनी ही है।

संबंधित सुविधाएं