एक्सपेरिमेंट्स

अनुमान नहीं, डेटा के आधार पर एजेंट प्रदर्शन को बेहतर बनाने के लिए प्रोडक्शन ट्रैफ़िक पर नियंत्रित A/B टेस्ट चलाएं

एक्सपेरिमेंट्स आपको एजेंट कॉन्फ़िगरेशन के किसी भी हिस्से—प्रॉम्प्ट संरचना, वर्कफ़्लो लॉजिक, वॉइस, व्यक्तित्व, टूल्स, नॉलेज बेस—पर नियंत्रित A/B टेस्ट चलाने देते हैं। इसके लिए ट्रैफ़िक के एक तय हिस्से को किसी वेरिएंट पर रूट करें, मुख्य नतीजों पर असर मापें और विजेताओं को प्रोडक्शन में प्रमोट करें।

एक्सपेरिमेंट्स एजेंट वर्ज़निंग पर आधारित हैं। एक्सपेरिमेंट्स चलाने से पहले आपके एजेंट पर वर्ज़निंग सक्षम होनी चाहिए।

एक्सपेरिमेंट क्यों करें

सुव्यवस्थित एक्सपेरिमेंटेशन के बिना, ऑप्टिमाइज़ेशन अंतर्ज्ञान पर निर्भर करता है। प्रॉम्प्ट में बदलाव “बेहतर” लगता है। वर्कफ़्लो में बदलाव से कंटेनमेंट “सुधरना चाहिए”। एस्केलेशन का नया रास्ता “ज़्यादा असरदार” लगता है।

एक्सपेरिमेंट्स अनुमान की जगह सबूत देते हैं। आप लाइव ट्रैफ़िक पर बदलाव टेस्ट करते हैं, वास्तविक नतीजे मापते हैं और जो काम करता है उसे प्रमोट करते हैं।

यह कैसे काम करता है

एक्सपेरिमेंट्स चार चरणों वाले वर्कफ़्लो का पालन करते हैं:

1

वेरिएंट बनाएं

अपने मौजूदा एजेंट कॉन्फ़िगरेशन से शुरू करें और नई ब्रांच बनाएं। कुछ भी बदलें—सिस्टम प्रॉम्प्ट, वर्कफ़्लो, वॉइस, टूल्स, नॉलेज बेस, गार्डरेल्स या मूल्यांकन मानदंड। हर बदलाव को वर्ज़न वाले कॉन्फ़िगरेशन के रूप में ट्रैक किया जाता है।

एजेंट सेटिंग्स में Branches टैब पर जाएं और Create branch पर क्लिक करें।

2

ट्रैफ़िक रूट करें

तय करें कि कितने प्रतिशत लाइव कन्वर्सेशन आपके वेरिएंट पर जाने चाहिए। जोखिम सीमित रखने के लिए कम प्रतिशत (5–10%) से शुरू करें, फिर भरोसा बढ़ने पर इसे बढ़ाएं।

Edit traffic split पर क्लिक करें और हर ब्रांच का प्रतिशत सेट करें। कुल प्रतिशत ठीक 100% होना चाहिए।

ब्रांचों के बीच ट्रैफ़िक स्प्लिट कॉन्फ़िगर करना

3

असर मापें

एनालिटिक्स डैशबोर्ड का इस्तेमाल करके वेरिएंट की परफ़ॉर्मेंस की तुलना अपने बेसलाइन से करें। ब्रांच के अनुसार फ़िल्टर किए गए व्यू पर सीधे जाने के लिए ब्रांच पैनल से See analytics पर क्लिक करें।

ट्रैफ़िक स्प्लिट और मर्ज विकल्पों के साथ मुख्य और वेरिएंट ब्रांच दिखाता ब्रांच पैनल

टीमें इन नतीजों को माप सकती हैं:

  • CSAT
  • कंटेनमेंट रेट
  • कन्वर्ज़न
  • औसत हैंडलिंग समय
  • एजेंट रिस्पॉन्स लेटेंसी का मीडियन
  • प्रति एजेंट रिज़ॉल्यूशन लागत
4

विजेता को प्रमोट करें

जब कोई वेरिएंट मापने योग्य सुधार दिखाए, तो या तो उसका ट्रैफ़िक शेयर बढ़ाएं या उसे मुख्य ब्रांच में मर्ज करके नया डिफ़ॉल्ट बनाएं। पूरा वर्ज़न इतिहास सुरक्षित रहता है, ताकि ज़रूरत पड़ने पर रोलबैक किया जा सके।

ट्रैफ़िक रूटिंग

ट्रैफ़िक को प्रतिशत के आधार पर ब्रांचों में बांटा जाता है। रूटिंग कन्वर्सेशन ID के आधार पर नियतात्मक होती है, इसलिए एक ही यूज़र अलग-अलग सेशन में लगातार उसी ब्रांच तक पहुंचता है।

डिफ़ॉल्ट रूप से, ट्रैफ़िक को यूज़र बेस में रैंडमाइज़ किया जाता है। अगर आप कन्वर्सेशन शुरू करने के लिए API इस्तेमाल करते हैं, तो किस ब्रांच कॉन्फ़िगरेशन के साथ कौन से कन्वर्सेशन शुरू किए जाते हैं, इसे नियंत्रित करके खास कोहोर्ट्स को खास ब्रांचों पर रूट कर सकते हैं।

ट्रैफ़िक के सभी प्रतिशतों का योग ठीक 100% होना चाहिए। ऐसा न होने पर डिप्लॉयमेंट विफल हो जाएगा।

इस्तेमाल के मामले

एक्सपेरिमेंट्स ग्राहक-सामना करने वाले और ऑपरेशनल वर्कफ़्लो में निरंतर ऑप्टिमाइज़ेशन में मदद करते हैं।

ग्राहक अनुभव

टेस्ट करें कि संशोधित एस्केलेशन फ़्लो हैंडलिंग समय बढ़ाए बिना CSAT बेहतर करता है या नहीं। अलग-अलग ग्रीटिंग स्टाइल, सहानुभूति के स्तर या रिज़ॉल्यूशन रणनीतियों की तुलना करें।

रेवेन्यू

टेस्ट करें कि ज़्यादा सीधे टोन या अलग क्वालिफ़िकेशन लॉजिक से कन्वर्ज़न बढ़ता है या नहीं। आपत्ति प्रबंधन, प्राइसिंग प्रेज़ेंटेशन या फ़ॉलो-अप टाइमिंग के साथ एक्सपेरिमेंट करें।

ऑपरेशंस

मापें कि टूल लॉजिक में बदलाव से औसत हैंडलिंग समय या इन्फ़्रास्ट्रक्चर लागत कम होती है या नहीं। अलग-अलग नॉलेज बेस कॉन्फ़िगरेशन या वर्कफ़्लो संरचनाओं को टेस्ट करें।

हर एक्सपेरिमेंट एक खास एजेंट वर्ज़न से जुड़ा होता है, इसलिए परफ़ॉर्मेंस में हर बदलाव को तय कॉन्फ़िगरेशन बदलाव से जोड़ा जा सकता है।

आप क्या टेस्ट कर सकते हैं

ब्रांचों के बीच एजेंट कॉन्फ़िगरेशन के किसी भी हिस्से को बदला जा सकता है:

श्रेणीउदाहरण
सिस्टम प्रॉम्प्टटोन, निर्देश, व्यक्तित्व, गार्डरेल्स
वर्कफ़्लोनोड संरचना, ब्रांचिंग लॉजिक, एस्केलेशन पाथ
वॉइसवॉइस चयन, TTS मॉडल, स्पीड सेटिंग्स
टूल्सटूल कॉन्फ़िगरेशन, वेबहुक टूल लॉजिक, MCP सर्वर
नॉलेज बेसअलग दस्तावेज़, RAG सेटिंग्स
LLMमॉडल चयन, टेम्परेचर, अधिकतम टोकन
मूल्यांकन मानदंडहर ब्रांच के लिए अलग सफलता मेट्रिक
भाषाभाषा सेटिंग्स, बहु-भाषा कॉन्फ़िगरेशन

सर्वोत्तम तरीके

वेरिएंट बनाने से पहले तय करें कि आप क्या सुधारने की उम्मीद करते हैं और उसे कैसे मापेंगे। उदाहरण के लिए: “एस्केलेशन प्रॉम्प्ट में समस्या का सारांश जोड़ने से हमारा रिज़ॉल्यूशन-रेट मूल्यांकन मानदंड 10% बेहतर होगा।”

एक ही वेरिएबल को अलग रखने से यह स्पष्ट होता है कि परफ़ॉर्मेंस में अंतर किस वजह से आया। अगर आप प्रॉम्प्ट, वॉइस और वर्कफ़्लो को एक साथ बदलते हैं, तो आपको नहीं पता चलेगा कि नतीजा किस बदलाव से आया।

एक्सपेरिमेंट चलाने से पहले सफलता मूल्यांकन मानदंड कॉन्फ़िगर करें। ये आपको वेरिएंट्स की निष्पक्ष तुलना के लिए ज़रूरी संरचित मेट्रिक देते हैं।

वेरिएंट पर 5–10% ट्रैफ़िक से शुरू करें। इससे कुछ गलत होने पर जोखिम सीमित रहता है और फिर भी उपयोगी डेटा मिलता है।

नतीजा निकालने से पहले पर्याप्त कन्वर्सेशन जमा होने दें। छोटे सैंपल साइज़ से अविश्वसनीय नतीजे मिलते हैं। एनालिटिक्स डैशबोर्ड पर नज़र रखें और ट्रेंड्स स्थिर होने का इंतज़ार करें।

एक्सपेरिमेंट्स को तुरंत मर्ज करें या हटा दें। लंबे समय तक चलने वाली ब्रांचों को मर्ज करना मुश्किल हो जाता है और वे मुख्य कॉन्फ़िगरेशन से अलग हो सकती हैं।

अगले चरण