कंटेंट पर जाएं

RAG क्या है? Retrieval-Augmented Generation कैसे काम करता है

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

AI मॉडल प्रशिक्षण के दौरान सीखी जानकारी के आधार पर जवाब देते हैं। यानी वे किसी कंपनी की नीतियों, प्रोडक्ट्स या प्रशिक्षण के बाद बनाई गई अन्य जानकारी को अपने-आप नहीं जानते। RAG (Retrieval-Augmented Generation) जवाब देने से पहले प्रासंगिक बाहरी जानकारी ढूंढकर मॉडल को देता है, जिससे यह समस्या हल होती है।

RAG, AI के जवाबों को किसी व्यवसाय के वास्तविक दस्तावेज़ों पर आधारित रखता है। RAG इस्तेमाल करने वाला एक ग्राहक सहायता एजेंट जवाब देने से पहले मौजूदा रिटर्न पॉलिसी या प्रोडक्ट स्पेसिफिकेशन देख सकता है, जिससे हैलुसिनेशन का जोखिम कम होता है।

इस गाइड में बताया गया है कि AI में RAG का क्या मतलब है, रिट्रीवल और जनरेशन साथ मिलकर कैसे काम करते हैं, और RAG अकेले LLM से कैसे अलग है। हम RAG की सीमाएं, जेनरेटिव AI ऐप्लिकेशन्स में इसके प्रभावी उपयोग, और RAG AI एजेंट्स में नॉलेज रिट्रीवल को कैसे सपोर्ट करता है, यह भी कवर करेंगे।

ElevenLabs Conversational AI demo introducing Retrieval-Augmented Generation (RAG).

सारांश

  • RAG, रिट्रीवल सिस्टम को जेनरेटिव मॉडल के साथ जोड़ता है, ताकि मॉडल अपने प्रशिक्षण डेटा से आगे की जानकारी इस्तेमाल कर सके।
  • RAG जिस ज्ञान को रिट्रीव करता है, वह मॉडल के बाहर रहता है। इसलिए बिना कुछ दोबारा ट्रेन किए उसे अपडेट किया जा सकता है।
  • जब नॉलेज बेस इतना बड़ा हो कि सीधे मॉडल के कॉन्टेक्स्ट में न आ सके, तो ElevenAgents अपने-आप RAG इस्तेमाल करता है। इससे बड़े और जटिल नॉलेज बेस के लिए भी सटीकता बनाए रखते हुए जवाब तेज़ रहते हैं।

AI में RAG क्या है?

RAG एक सिस्टम आर्किटेक्चर है, जो LLM के आसपास बनाया जाता है और उसे ब्रांड गाइडलाइंस, प्रोडक्ट मैनुअल, नॉलेज बेस आर्टिकल्स या आंतरिक डेटाबेस जैसी बाहरी जानकारी देता है। इससे AI व्यवसाय-विशेष जानकारी के साथ काम कर पाता है और उसके जवाब मौजूदा नीतियों, निजी ज्ञान व कंपनी की उन जानकारियों को दर्शा सकते हैं जिन पर मॉडल को कभी प्रशिक्षित नहीं किया गया था।

LLM भी एक समय में सीमित मात्रा में ही जानकारी पर विचार कर सकता है, जिसे उसका कॉन्टेक्स्ट विंडो कहा जाता है। एक बड़ा संगठनात्मक नॉलेज बेस जल्दी ही इस सीमा से आगे निकल सकता है। इसलिए RAG जानकारी को LLM के बाहर रखता है और मौजूदा सवाल के लिए केवल जरूरी अंश रिट्रीव करता है।

इस नाम से पता चलता है कि सिस्टम में जानकारी कैसे आगे बढ़ती है:

  • रिट्रीवल: यूज़र के अनुरोध से मेल खाने वाले कंटेंट के लिए कनेक्टेड सोर्सेज़, जैसे पॉलिसी दस्तावेज़, हेल्प डेस्क लॉग या इन्वेंट्री फाइल्स, खोजता है।
  • ऑगमेंटेड: रिट्रीव किए गए सबसे प्रासंगिक अंशों को प्रॉम्प्ट कॉन्टेक्स्ट में जोड़ता है।
  • जनरेशन: जवाब बनाने के लिए यूज़र के अनुरोध और रिट्रीव किए गए कॉन्टेक्स्ट का उपयोग करता है।

RAG, ग्राउंडिंग को भी सपोर्ट करता है—यानी AI के जवाब को खास स्रोत जानकारी से जोड़ने की प्रक्रिया। जवाब बनाते समय इस्तेमाल के लिए LLM को प्रासंगिक सामग्री देकर यह संभव होता है। उदाहरण के लिए, अगर कोई ग्राहक वारंटी पॉलिसी के बारे में पूछता है, तो RAG सिस्टम कंपनी के दस्तावेज़ों से संबंधित शर्तें रिट्रीव कर LLM को जवाब देने के लिए देता है।

RAG retrieves relevant sources, augments prompts with context, and generates answers.

Retrieval-Augmented Generation कैसे काम करता है?

RAG सिस्टम बाहरी ज्ञान को खोज के लिए तैयार करता है, यूज़र के सवाल के लिए सबसे प्रासंगिक जानकारी रिट्रीव करता है और जवाब जनरेट करने से पहले वह जानकारी LLM को कॉन्टेक्स्ट के तौर पर देता है।

RAG इम्प्लीमेंटेशन की जटिलता अलग-अलग होती है। बेसिक RAG में सीधी रिट्रीव-एंड-जनरेट प्रक्रिया होती है, जबकि ज़्यादा उन्नत तरीकों में क्वेरी री-राइटिंग, फ़िल्टरिंग, री-रैंकिंग या अन्य रिट्रीवल तकनीकें शामिल हो सकती हैं। 

RAG प्रक्रिया आमतौर पर पांच चरणों में पूरी होती है:

  1. ज्ञान तैयार करें: दस्तावेज़ों को छोटे अंशों में बांटा जाता है (इसे “चंकिंग” कहते हैं), एम्बेडिंग्स नामक गणितीय रूपों में बदला जाता है और सर्च किए जा सकने वाले इंडेक्स या वेक्टर डेटाबेस में स्टोर किया जाता है।

  2. क्वेरी प्रोसेस करें: सिस्टम यूज़र के सवाल को समझता है और अधिक उन्नत RAG सिस्टम में खोजने से पहले उसे री-राइट या बेहतर बनाता है।

  3. प्रासंगिक अंश रिट्रीव करें: रिट्रीवर इंडेक्स किए गए नॉलेज बेस में उन टेक्स्ट चंक्स को खोजता है जो अनुरोध से सबसे अच्छी तरह मेल खाते हैं।

  4. मॉडल अनुरोध में कॉन्टेक्स्ट जोड़ें: चुने गए अंश यूज़र के सवाल, प्रासंगिक निर्देशों और बातचीत के इतिहास के साथ LLM को भेजे जाते हैं।

  5. जवाब जनरेट करें: LLM रिट्रीव की गई सामग्री को अपने कॉन्टेक्स्ट के हिस्से के रूप में इस्तेमाल करके जवाब बनाता है।

कई RAG सिस्टम रिट्रीवल को चुनिंदा रूप से बाहरी टूल की तरह ट्रिगर करते हैं। ElevenAgents टीम्स को एजेंट सेटिंग्स में सीधे किसी नॉलेज बेस के लिए RAG चालू करने देता है। बातचीत के फ़ॉलो-अप में सिस्टम क्वेरी री-राइटिंग से पिछली बातचीत और अस्पष्ट संदर्भों को सटीक, स्वतंत्र सर्च क्वेरी में बदल देता है।

समय पर जवाब सुनिश्चित करने के लिए ElevenLabs ने मॉडल रेसिंग आर्किटेक्चर भी विकसित किया है, जो हर क्वेरी को समानांतर रूप से कई री-राइटिंग मॉडल्स को भेजता है और पहला वैध जवाब इस्तेमाल करता है। इस तरीके ने औसत RAG लेटेंसी आधी कर दी, 326 ms से 155 ms तक। इससे रिट्रीवल इतना तेज़ रहता है कि बड़ा नॉलेज बेस ट्रिगर होने पर भी बातचीत का स्वाभाविक प्रवाह बना रहे।

Five-step RAG workflow; model racing cuts median latency from 326 ms to 155 ms.

LLM और RAG मॉडल्स में क्या अंतर है?

LLM एक ऐसा मॉडल है जो भाषा को समझता और जनरेट करता है। RAG, LLM के आसपास की एक आर्किटेक्चर है, जो ऐप्लिकेशन को जरूरत होने पर बाहरी जानकारी रिट्रीव करती है।

LLM को RAG के साथ जोड़ने पर ये बदलाव होते हैं:

विशेषता

केवल LLM

RAG के साथ LLM

ज्ञान

प्रशिक्षण डेटा और मौजूदा कॉन्टेक्स्ट

प्रशिक्षण डेटा, मौजूदा कॉन्टेक्स्ट और रिट्रीव की गई कंपनी जानकारी, जैसे नीतियां, प्रोडक्ट दस्तावेज़ या नॉलेज बेस कंटेंट

अपडेट्स

नई जानकारी कॉन्टेक्स्ट में या मॉडल अपडेट्स के माध्यम से देनी होगी

बाहरी ज्ञान को मॉडल से अलग अपडेट किया जा सकता है

निजी जानकारी

दिए जाने तक उपलब्ध नहीं

मंज़ूरशुदा निजी स्रोतों से रिट्रीव कर सकता है

रिट्रीवल

बेस मॉडल का हिस्सा नहीं

आसपास का RAG सिस्टम जोड़ता है

“RAG मॉडल” शब्द का इस्तेमाल कभी-कभी RAG सिस्टम के अंदर उपयोग किए गए LLM के संक्षिप्त नाम के रूप में होता है। उदाहरण के लिए, कोई कंपनी ग्राहक सहायता के लिए “RAG मॉडल” इस्तेमाल करने की बात कह सकती है, जबकि असल सेटअप ऐसा LLM होता है जो जवाब जनरेट करने से पहले संबंधित सहायता केंद्र या पॉलिसी कंटेंट रिट्रीव करता है। 

LLM alone vs. RAG: retrieval adds private company information without changing model weights.

वास्तविक ऐप्लिकेशन्स में RAG मॉडल्स की सीमाएं

RAG, LLM के बाहर स्टोर किए गए प्रासंगिक व्यावसायिक ज्ञान तक पहुंच बेहतर बनाता है, लेकिन रिट्रीवल की अपनी सीमाएं हैं और यह सही जवाब की गारंटी नहीं देता। मुख्य सीमाएं इस बात में दिखती हैं कि सिस्टम क्या रिट्रीव करता है, मॉडल को क्या भेजता है और मॉडल कैसे जवाब देता है: 

  • रिट्रीवल क्वालिटी: अगर सिस्टम सबसे प्रासंगिक अंश को छोड़ देता है, तो LLM अधूरे या कमजोर कॉन्टेक्स्ट से शुरू करता है। खराब ढंग से लिखी क्वेरी, कमजोर सेमांटिक मैच या अस्पष्ट शब्दावली रिट्रीवल को गलत दिशा में ले जा सकती है। 
  • सोर्स क्वालिटी: पुराने, परस्पर विरोधी या अधूरे दस्तावेज़ अविश्वसनीय जवाब दे सकते हैं।
  • कॉन्टेक्स्ट चयन: गलत चंकिंग या रिट्रीवल विकल्प जरूरी जानकारी हटा सकते हैं या असंबंधित जानकारी जोड़ सकते हैं।
  • अतिरिक्त लेटेंसी: जनरेशन से पहले रिट्रीवल और क्वेरी प्रोसेसिंग होती है, जिससे रियल-टाइम ऐप्लिकेशन्स में जवाब धीमे हो सकते हैं।
  • जनरेशन में त्रुटियां: LLM अब भी रिट्रीव की गई जानकारी का गलत अर्थ निकाल सकता है या बिना समर्थन वाले दावे जोड़ सकता है।

RAG हैलुसिनेशन का जोखिम कम कर सकता है, लेकिन उसे पूरी तरह खत्म नहीं करता। सटीक नतीजे अब भी अच्छी तरह रखे गए स्रोतों, प्रभावी रिट्रीवल और अंतिम जवाब पर नियंत्रणों पर निर्भर करते हैं।

Slide lists five RAG limitations and says it reduces, but does not eliminate, hallucinations.

जेनरेटिव AI में RAG: व्यावहारिक उपयोग और फायदे

RAG तब सबसे उपयोगी होता है, जब किसी AI ऐप्लिकेशन को ऐसी जानकारी चाहिए जो अक्सर बदलती हो, संगठन की हो या हर मॉडल अनुरोध में शामिल करने के लिए बहुत बड़ी हो। 

यहां RAG सबसे बड़ा फर्क लाता है:

अक्सर अपडेट होने वाली जानकारी के साथ बने रहना

RAG टीम्स को AI जवाबों को मौजूदा प्रोडक्ट विवरण, कीमतों, नीतियों और इन्वेंट्री के अनुरूप रखने में मदद करता है। टीम्स स्रोत जानकारी को स्वतंत्र रूप से अपडेट कर सकती हैं और सवाल पूछे जाने पर RAG संबंधित वर्जन रिट्रीव करता है। उदाहरण के लिए, एक लीड क्वालिफिकेशन एजेंट इनबाउंड कॉलर को क्वालिफाई करते समय नई कीमत या प्लान की जानकारी रिट्रीव कर सकता है।

निजी या विशेष ज्ञान का उपयोग

कुछ ज्ञान सार्वजनिक होने के बजाय निजी या विशेष होता है, जैसे आंतरिक नीतियां, तकनीकी दस्तावेज़ या किसी खास टीम के लिए बनाया गया सहायता कंटेंट। RAG एजेंट को केवल सार्वजनिक रूप से उपलब्ध या मॉडल में मौजूद जानकारी पर निर्भर रहने के बजाय इन स्रोतों से सीधे रिट्रीव करने देता है। 

उदाहरण के लिए, एक आंतरिक IT या HR हेल्पडेस्क एजेंट कर्मचारी लाभों से जुड़े सवालों के जवाब देने के लिए HR-विशेष नॉलेज बेस से जानकारी रिट्रीव कर सकता है, बजाय ऐसे सार्वजनिक दस्तावेज़ों में खोजने के जिनमें यह जानकारी नहीं होगी।

बड़े नॉलेज बेस में खोज

RAG तब मदद करता है जब किसी कंपनी के पास इतना अधिक दस्तावेज़ीकरण हो कि LLM उसे एक अनुरोध में नहीं देख सके। यह पूरा कलेक्शन मॉडल को भेजने के बजाय केवल मौजूदा सवाल से संबंधित अंश रिट्रीव करता है। सेल्स के संदर्भ में, एक तकनीकी सहायक कॉल के दौरान प्रासंगिक आवश्यकताएं खोजने के लिए प्रोडक्ट मैनुअल खोज सकता है।

उन्नत RAG समाधान के लिए ElevenAgents के साथ शुरुआत करें

ElevenAgents टीम्स को कनेक्टेड नॉलेज सोर्सेज़ के साथ RAG इस्तेमाल करने वाले AI वॉइस और चैट एजेंट्स बनाने का तरीका देता है—चाहे नो-कोड वेब प्लेटफ़ॉर्म से या उन टीम्स के लिए API के ज़रिए, जो एजेंट्स को सीधे अपने प्रोडक्ट्स में एम्बेड करना चाहती हैं। 

RAG-सक्षम एजेंट्स के लिए टीम्स नॉलेज बेस में दस्तावेज़, URLs या टेक्स्ट जोड़ सकती हैं और हर क्वेरी के लिए केवल प्रासंगिक जानकारी रिट्रीव कर सकती हैं।

ElevenLabs ने रियल-टाइम बातचीत के लिए रिट्रीवल को भी ऑप्टिमाइज़ किया है और अपनी ElevenAgents आर्किटेक्चर में औसत RAG लेटेंसी 326 ms से घटाकर 155 ms कर दी है। ElevenAgents के साथ बनाने वाली टीम्स को ये रिट्रीवल क्षमताएं सीधे मिलती हैं, चाहे वे डैशबोर्ड से एजेंट कॉन्फ़िगर करें या API के ज़रिए उसके ऊपर डेवलप करें।

बनाना शुरू करें ElevenAgents के साथ या हमारी टीम से संपर्क करें ताकि अपने ऐप्लिकेशन के लिए सही सेटअप पर बात कर सकें।

RAG FAQ

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं