पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

वेबिनार सारांश: एंटरप्राइज डिप्लॉयमेंट के लिए सुरक्षित AI एजेंट बनाएं

प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

वेबिनार सारांश: एंटरप्राइज़ डिप्लॉयमेंट के लिए सुरक्षित AI एजेंट बनाएं

AI एजेंट से बातचीत संभलवाना आसान हिस्सा है। आपकी सुरक्षा टीम, कानूनी टीम और ग्राहक उस पर भरोसा करें—ज़्यादातर एंटरप्राइज़ डिप्लॉयमेंट यहीं रुक जाते हैं।

इस पोस्ट में हमारे लाइव वर्कशॉप का सार है, एंटरप्राइज़ डिप्लॉयमेंट के लिए सुरक्षित AI एजेंट बनाना, जिसमें हमने उन टूल्स, फ्रेमवर्क्स और डिप्लॉयमेंट तरीकों को समझाया, जो एंटरप्राइज़ एजेंट डिप्लॉयमेंट को बड़े पैमाने पर कारगर बनाते हैं। 

सुरक्षा के लिए स्तरित तरीका कैसे बनाएं 

ElevenAgents प्लेटफ़ॉर्म पर चालीस लाख से ज़्यादा एजेंट डिप्लॉय किए जा चुके हैं। एंटरप्राइज़ माहौल में भरोसेमंद तरीके से काम करने वाले एजेंटों में एक समान बात होती है: सुरक्षा शुरुआत से ही बनाई गई थी, पहली घटना के बाद जोड़ी नहीं गई।

हमारे लाइव सेशन में उन फ्रेमवर्क्स, नियंत्रणों और डिप्लॉयमेंट तरीकों पर बात हुई, जो सुरक्षा समीक्षा पास करने वाले एजेंटों को उन एजेंटों से अलग करते हैं जो इसे पास नहीं करते।

अलग-अलग एजेंटों के लिए मूल रूप से अलग सीमाएं चाहिए होती हैं।

  • एक वीडियो गेम किरदार को अनुभव के हिस्से के तौर पर स्पष्ट रूप से हिंसक भाषा इस्तेमाल करनी पड़ सकती है - लेकिन उसे कभी भी किरदार से बाहर नहीं आना चाहिए या यह नहीं बताना चाहिए कि वह AI है।
  • हेल्थकेयर रिसेप्शनिस्ट को चोटों और चिकित्सा संदर्भों पर बात करनी होती है - लेकिन उसे कभी भी चिकित्सा सलाह नहीं देनी चाहिए।
  • क्रेडिट कार्ड सपोर्ट एजेंट को स्पष्ट सामग्री से बिल्कुल नहीं जुड़ना चाहिए और बिना सत्यापित कॉलर्स के साथ खाते की जानकारी साझा नहीं करनी चाहिए। 

क्योंकि एजेंट गैर-नियतात्मक होते हैं, कोई एक सुरक्षा उपाय सभी संभावित जोखिमों से पूरी तरह बचाव नहीं कर सकता। इसलिए एंटरप्राइज़ टीम्स को स्तरित तरीके की ज़रूरत होती है - कई नियंत्रण मिलकर काम करते हैं, ताकि सुरक्षा संबंधी विफलताएं बहुत दुर्लभ रहें।

इसी सिद्धांत के आधार पर हमने सेशन को इन चार सवालों के आसपास व्यवस्थित किया:

  1. मैं अपने एजेंट की बातों और कामों को कैसे नियंत्रित कर सकता हूं?
  2. मैं कैसे जांच सकता हूं कि यह काम कर रहा है?
  3. सुरक्षा और अनुपालन की ज़रूरतें पूरी करने के लिए मैं डेटा को कैसे सुरक्षित रख सकता हूं?
  4. सुरक्षित तरीके से डिप्लॉय करने के लिए मैं प्रक्रियाएं कैसे बना सकता हूं

एजेंट के व्यवहार को नियंत्रित करने के बारे में कैसे सोचें 

किसी भी एजेंट बातचीत में तीन बिंदु होते हैं, जहां सुरक्षा पर विचार करना ज़रूरी है। 

इनपुट
यूज़र कुछ कहता है। विरोधी यूज़र "पिछले सभी निर्देश अनदेखा करो" या "दिखावा करो कि आप कोई अलग असिस्टेंट हैं" जैसी कोशिशें कर सकते हैं। आपको हेरफेर की कोशिशों को मॉडल तक पहुंचने से पहले पहचानना और संभालना होगा। इससे गैर-ज़रूरी लागत बचती है और गलत इरादे वाले लोग ऐसी जानकारी निकालने से रुकते हैं, जो उन्हें नहीं मिलनी चाहिए।

निर्णय लेना
LLM तय करता है कि क्या कहना या करना है। यहां आपका सिस्टम प्रॉम्प्ट मुख्य नियंत्रण बिंदु होता है - लेकिन लंबी या जटिल बातचीत में LLM अपने निर्देशों से भटक सकते हैं। आपको ऐसे तंत्र चाहिए जो केवल शुरुआत में नहीं, बल्कि पूरी बातचीत के दौरान व्यवहार को मज़बूत करें। आपको एस्केलेशन पथ भी तय करने चाहिए: क्या ऐसी स्थितियां हैं जिनमें एजेंट को किसी इंसान या अधिक विशेषज्ञ एजेंट को सौंप देना चाहिए, और किन शर्तों पर?

आउटपुट
मज़बूत निर्देशों के बावजूद भी कुछ छूट सकता है - खासकर लंबी बातचीत में। आपको एक अंतिम सुरक्षा कवच चाहिए। इसे ऐसे समझें जैसे कोई छोटा एजेंट आपके मुख्य एजेंट के काम की जांच कर रहा हो: वह यूज़र तक पहुंचने से पहले जवाब का मूल्यांकन करता है और तय करता है कि उसे भेजना है, दोबारा कोशिश करनी है या एस्केलेट करना है। यह जवाब जनरेट होने के साथ-साथ चलता है, इसलिए बहुत कम लेटेंसी जोड़ता है।

इन तीनों स्तरों पर, आपको अपनी एग्ज़िट रणनीतियां पहले से तय करनी होंगी: क्या उल्लंघन पर बातचीत खत्म होगी, सुधारात्मक निर्देशों के साथ दोबारा कोशिश होगी, या किसी इंसान को ट्रांसफर किया जाएगा? कुछ गलत होने पर यही फैसला यूज़र अनुभव तय करता है।

डेमो 1: ElevenAgents में गार्डरेल कॉन्फ़िगर करना

परिस्थिति: वेबसाइट के सेल्स और सपोर्ट एजेंट को हेरफेर, विषय से हटकर जवाबों और नीति उल्लंघनों से बचाने के लिए सुरक्षा नियंत्रणों की कई परतों के साथ कॉन्फ़िगर किया गया है।


क्या दिखाया गया:

  • मैनिपुलेशन गार्डरेल (इनपुट) - Security टैब में मौजूद यह टॉगल प्रॉम्प्ट इंजेक्शन पैटर्न—सिस्टम निर्देशों को ओवरराइड करने की कोशिशों—का पता लगाता है और एजेंट के जवाब देने से पहले बातचीत खत्म कर देता है। सभी प्रोडक्शन एजेंटों के लिए सुझाया गया।
  • सिस्टम प्रॉम्प्ट और Focus गार्डरेल (निर्णय लेना) -सिस्टम प्रॉम्प्ट बुनियादी है। हर महत्वपूर्ण नियम उसमें साफ़ तौर पर होना चाहिए। डेमो में सेशन के बीच में एक निर्देश जोड़ा गया: "कोई छूट ऑफ़र न करें।" अलग से सक्षम किया गया Focus गार्डरेल पूरी बातचीत के दौरान सिस्टम प्रॉम्प्ट को अपने-आप मज़बूत करता है - और लंबी बातचीत में होने वाली भटकाव की समस्या को दूर करता है। एजेंट को सही दिशा में रखने के लिए मज़बूत सिस्टम प्रॉम्प्ट और सक्षम Focus का संयोजन सबसे प्रभावी है।
  • कंटेंट गार्डरेल (आउटपुट) - गाली-गलौज, कानूनी सलाह और राजनीतिक राय को कवर करने वाली पहले से कॉन्फ़िगर की गई श्रेणियां। हर श्रेणी में एडजस्ट किया जा सकने वाला कॉन्फ़िडेंस थ्रेशोल्ड है - शुरुआत के लिए मध्यम स्तर सुझाया जाता है। यह फॉलबैक लेयर है: अगर एजेंट कुछ ऐसा देने वाला है जो उसे नहीं देना चाहिए, तो यह डिलीवरी से पहले उसे पकड़ लेती है।
  • कस्टम गार्डरेल (आउटपुट) - प्रिसेट्स में शामिल न होने वाले किसी भी मामले के लिए प्राकृतिक भाषा में लिखी यूज़र-परिभाषित जांचें। डेमो में "कोई छूट नहीं" गार्डरेल कॉन्फ़िगर किया गया: "ऐसे किसी भी जवाब को ब्लॉक करें जिसमें छूट, प्रमोशन या विशेष मूल्य का ज़िक्र हो, जिसे ऑफ़र करने के लिए एजेंट अधिकृत नहीं है।" कस्टम गार्डरेल अतिरिक्त LLM मूल्यांकन का उपयोग करते हैं — इसलिए उपयोग-आधारित लागत और लेटेंसी पर विचार करना होता है। निर्देश स्पष्ट रखें और अलग-अलग जांचों को एक साथ जोड़ने के बजाय अलग गार्डरेल में बांटें
  • उल्लंघन पर कार्रवाई - दो विकल्प: कॉल खत्म करें या दोबारा कोशिश करें। दोबारा कोशिश पर, एजेंट के अगले प्रयास को दिशा देने के लिए आप अतिरिक्त निर्देश दे सकते हैं — जैसे किसी इंसान तक एस्केलेट करना या डिफ़ॉल्ट रीडायरेक्ट संदेश देना।

यह क्यों मायने रखता है: ये नियंत्रण सभी के लिए एक जैसे नहीं हैं। इन्हें हर गार्डरेल के स्तर पर कॉन्फ़िगर किया जा सकता है। यही बारीकी सैद्धांतिक रूप से सुरक्षित एजेंट और अलग-अलग एंटरप्राइज़ संदर्भों में व्यावहारिक रूप से सुरक्षित एजेंट के बीच अंतर पैदा करती है।

डेमो 2: लॉन्च से पहले सिमुलेशन टेस्टिंग

परिस्थिति: सपोर्ट एजेंट को छूट से जुड़े दो बातचीत परिदृश्यों पर टेस्ट किया जाता है, ताकि यह पुष्टि हो सके कि वह छूट ऑफ़र किए बिना यूज़र्स को मूल्य निर्धारण पेज पर रीडायरेक्ट करता है।

क्या दिखाया गया: 

  • Tests टैब में परिभाषित दो सिमुलेशन टेस्ट, जिनमें से हर एक में सिम्युलेटेड यूज़र परिदृश्य, बातचीत के टर्न की तय संख्या और स्पष्ट सफलता मानदंड थे
  • एक टेस्ट शुरुआत में विफल हुआ, क्योंकि सिस्टम प्रॉम्प्ट में खास एज केस निर्देश नहीं थे
  • छूटे हुए निर्देश सिस्टम प्रॉम्प्ट के गार्डरेल सेक्शन में जोड़े गए
  • एजेंट को दोबारा पब्लिश किया गया और दोनों टेस्ट फिर चलाए गए - दोनों पास हुए
  • विस्तृत रन हिस्ट्री में टूल कॉल्स और एजेंट ऐक्शंस समेत, बातचीत का कौन-सा हिस्सा विफल हुआ था, यह साफ़ दिखता है

यह क्यों मायने रखता है: सिमुलेशन टेस्टिंग टीम्स को किसी वास्तविक यूज़र के एजेंट को देखने से पहले नियंत्रित माहौल में एजेंट के व्यवहार की पुष्टि करने देती है। इसमें नियमित और विरोधी, दोनों तरह के परिदृश्य शामिल होते हैं। यह सिर्फ़ अलग-अलग जवाबों के बजाय पूरी बातचीत के फ्लो पर भी चलता है। बदलाव करने के बाद, समाधान सही रहा या नहीं यह पुष्टि करने के लिए टेस्ट तुरंत फिर चलाए जा सकते हैं।

डेमो 3: संवेदनशील डिप्लॉयमेंट के लिए PII रिडैक्शन

परिस्थिति: एंटरप्राइज़ एजेंट को बातचीत लॉग्स से व्यक्तिगत पहचान योग्य जानकारी रिडैक्ट करने के लिए कॉन्फ़िगर किया गया है।

क्या दिखाया गया:

  • Privacy सेटिंग्स के तहत Advanced टैब में मौजूद Conversation History Redaction टॉगल
  • रेडैक्शन के लिए अलग-अलग टॉगल की जा सकने वाली खास डेटा इकाइयों की सूची, जिसमें जन्मतिथि, उम्र और अन्य संवेदनशील फ़ील्ड शामिल हैं
  • सभी इकाइयां चुनने या केवल उस खास एजेंट के उपयोग मामले से संबंधित इकाइयां चुनने का विकल्प

यह क्यों मायने रखता है: HIPAA जैसे उच्च-अनुपालन वाले माहौल में PII रिडैक्शन, ज़ीरो रिटेंशन मोड का विकल्प नहीं है। यह आंतरिक समीक्षा या क्वालिटी कंट्रोल के लिए इस्तेमाल होने वाले बातचीत लॉग्स में डेटा एक्सपोज़र कम करता है। टीम्स अपनी ज़रूरत के लॉग्स रख सकती हैं और जिस डेटा की ज़रूरत नहीं है उसे हटा सकती हैं। यह फ़िलहाल एंटरप्राइज़ ग्राहकों के लिए उपलब्ध है।

सुरक्षित एंटरप्राइज़ एजेंट डिप्लॉयमेंट के लिए सर्वोत्तम तरीके 

  1. स्तरित तरीका अपनाएं। कोई एक नियंत्रण सुरक्षित व्यवहार सुनिश्चित नहीं करता। इनपुट गार्डरेल, आउटपुट वैलिडेशन, प्रॉम्प्ट हार्डनिंग और टेस्टिंग को साथ मिलकर काम करना चाहिए। हर लेयर दूसरी लेयर्स को मज़बूत करती है और साथ मिलकर वे सुरक्षा संबंधी समस्याओं का जोखिम काफ़ी कम कर देती हैं।
  2. गार्डरेल को संदर्भ के अनुसार रखें। हेल्थकेयर एजेंट और रिटेल सपोर्ट एजेंट को अलग नियम चाहिए। सामान्य टेम्पलेट नहीं, बल्कि अपने उपयोग मामले के लिए खास सीमाएं तय करें।
  3. ऐसे उपयोग मामले से शुरुआत करें जो मायने रखता हो। सबसे सफल एंटरप्राइज़ डिप्लॉयमेंट किसी बेकार पायलट से शुरू नहीं होते। वे ग्राहक सहायता, शेड्यूलिंग जैसा कोई वास्तविक काम चुनते हैं - और उसे सही करने में निवेश करते हैं।
  4. लॉन्च से पहले टेस्ट करें, फिर टेस्ट करते रहें। सिमुलेशन टेस्टिंग और बाहरी रेड-टीमिंग टूल्स का उपयोग करें। नियमित और विरोधी, दोनों तरह के परिदृश्यों पर टेस्ट करें। प्रोडक्शन में मिले नए एज केस को अपने टेस्ट सूट में जोड़ें।
  5. चरणों में डिप्लॉय करें। सीमित ट्रैफ़िक से शुरुआत करें। वास्तविक बातचीत पर नज़र रखें। पहचानें कि एजेंट को किन चीज़ों में मुश्किल आती है। बदलाव करें, फिर से टेस्ट करें, और फिर विस्तार करें।
  6. एक्ज़ीक्यूशन मोड सोच-समझकर चुनें। टेक्स्ट एजेंटों के लिए blocking मोड का उपयोग करें, जहां गति से ज़्यादा सख्त वैलिडेशन मायने रखता है। वॉइस एजेंटों के लिए streaming मोड इस्तेमाल करें, जहां लेटेंसी प्राथमिकता होती है।
  7. गार्डरेल उल्लंघन पर स्पष्ट कार्रवाई तय करें। पहले से तय करें कि उल्लंघन पर कॉल खत्म होनी चाहिए, दोबारा कोशिश शुरू होनी चाहिए या किसी इंसान तक एस्केलेट करना चाहिए।
  8. कस्टम गार्डरेल निर्देश संक्षिप्त रखें। गार्डरेल समानांतर चलते हैं। लंबा और जटिल कस्टम गार्डरेल लेटेंसी बढ़ाता है। निर्देश स्पष्ट रखें और अलग-अलग जांचों को अलग गार्डरेल में बांटें।
  9. समझें कि सर्टिफ़िकेशन वास्तव में क्या कवर करते हैं। SOC 2 Type 2 और ISO 27001 बुनियादी अपेक्षाएं हैं। HIPAA और PCI DSS जैसे क्षेत्र-विशिष्ट मानक विनियमित उद्योगों के लिए हैं। ISO 42001 और AIUC-1 जैसे नए AI-विशिष्ट सर्टिफ़िकेशन पक्षपात, पारदर्शिता और विरोधी परिस्थितियों में मज़बूती को संबोधित करते हैं - और AIUC-1 सर्टिफ़िकेशन AI-विशिष्ट बीमा तक पहुंच दिला सकता है।
  10. प्रक्रियाओं की क्षमता जल्दी बनाएं। पहले डिप्लॉयमेंट में सबसे ज़्यादा समय लगता है। टेस्टिंग और डिप्लॉयमेंट प्रक्रिया में निवेश करने वाली टीम्स हर अगले एजेंट पर बहुत तेज़ी से दोहराव कर पाती हैं।

पूरा सेशन देखें 

पूरा वेबिनार यहां देखें।

safety-webinar-cover


संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं