कंटेंट पर जाएं

टूल कॉलिंग क्या है? AI इंटीग्रेशन की पूरी गाइड

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

AI मॉडल यूज़र्स को जवाब देने के लिए अपने ट्रेनिंग डेटा से जानकारी लेते हैं और उसका विस्तार करते हैं। लेकिन जब कोई अनुरोध उस शुरुआती जानकारी के दायरे से बाहर हो, तो क्या होता है?

टूल कॉलिंग ऐसी क्षमता है जो जानकारी और फ़ंक्शन से जुड़ी इन कमियों को दूर करती है। इससे मॉडल बाहरी टूल और सिस्टम से अतिरिक्त मदद मांग सकता है—चाहे किसी अपडेट को भेजने जैसी कार्रवाई शुरू करनी हो या डेटा डैशबोर्ड से जानकारी लेनी हो।

इस लेख में हम जानेंगे कि टूल कॉलिंग क्या है, यह फ़ंक्शन कॉलिंग से कैसे अलग है और ElevenAgents कैसे कन्वर्सेशनल AI वर्कफ़्लो के लिए टूल कॉलिंग का इस्तेमाल करता है।

सारांश

  • टूल कॉलिंग, AI मॉडल को कार्रवाइयां शुरू करने और बाहरी टूल व API से जानकारी मांगने देती है।
  • AI मॉडल खुद किसी टूल को नहीं चलाता। इसके बजाय, एप्लिकेशन लेयर अनुरोध चलाती है।
  • टूल कॉलिंग पांच चरणों वाली प्रक्रिया है, जिसमें एक ही अनुरोध में कई अलग-अलग टूल सक्रिय हो सकते हैं।
  • टूल कॉलिंग का उपयोग जानकारी पाने, कोड चलाने, डिवाइस कंट्रोल या वर्कफ़्लो और प्रक्रियाओं के साथ इंटरैक्ट करने के लिए किया जा सकता है।
  • ElevenAgents वॉइस एजेंट में टूल कॉलिंग सपोर्ट करता है, जिससे आपका कन्वर्सेशनल AI असिस्टेंट आपकी ओर से काम पूरे कर सकता है।

टूल कॉलिंग क्या है?

टूल कॉलिंग, AI मॉडल की वह क्षमता है जिससे वह किसी दूसरे सिस्टम के साथ इंटरैक्ट कर सकता है। यह सिस्टम डेटाबेस, API, सॉफ़्टवेयर या ऐसी कोई भी चीज़ हो सकती है जो उसे अपने ट्रेनिंग डेटा से आगे का कोई फ़ंक्शन करने दे। 

टूल कॉलिंग किसी काम को करने के लिए थर्ड-पार्टी सिस्टम को अनुरोध भेजती है, जो आमतौर पर JSON फ़ॉर्मैट में होता है। AI सिस्टम टूल कॉलिंग का इस्तेमाल बाहरी सिस्टम से क्वेरी करने, रियल-टाइम जानकारी पाने, कमांड चलाने या ऑपरेशन करने के लिए करता है। टूल कॉल करने की क्षमता एजेंटिक AI को बाहरी संसाधनों तक पहुंचकर और थर्ड-पार्टी सिस्टम का डायनामिक रूप से इस्तेमाल करके अधिक जटिल या कई चरणों वाले काम पूरे करने देती है।

टूल कॉल करने की क्षमता ही एजेंटिक AI असिस्टेंट को उन LLM से अलग करती है, जो केवल पहले से ज्ञात जानकारी के आधार पर जवाब दे सकते हैं।

टूल कॉलिंग क्यों ज़रूरी है?

लार्ज लैंग्वेज मॉडल अपनी क्षमताएं विकसित करने के लिए बहुत अधिक ऐतिहासिक डेटा पर ट्रेन होते हैं। इससे वे यूज़र्स को जवाब देने और जानकारी देने के लिए शक्तिशाली सिस्टम बनते हैं, लेकिन अपने शुरुआती ट्रेनिंग संदर्भ और जानकारी के संग्रह से आगे जाना उनके लिए मुश्किल होता है। अगर आप LLM से ऐसी जानकारी मांगते हैं जो उनके दायरे या क्षमता से बाहर हो, तो उन्हें बाहरी मदद चाहिए होती है।

टूल कॉलिंग वही बाहरी मदद है। यह LLM को दूसरे स्रोतों से नया डेटा लेने या कंपनी के मौजूदा लाइव सिस्टम—जैसे थर्ड-पार्टी API या आंतरिक डेटाबेस—से इंटीग्रेट होने देती है।

AI सिस्टम के लिए टूल कॉलिंग के कई फ़ायदे हैं:

  • कम हैलुसिनेशन: जानकारी की पुष्टि के लिए सीधे टूल कॉल पर निर्भर सिस्टम, जानकारी गढ़ने या ट्रेनिंग डेटा के आधार पर अनुमान लगाने के बजाय प्रमाण और डेटा पर काम करता है।
  • ज़्यादा स्वायत्तता और दायरा: टूल-कॉलिंग LLM सिर्फ जानकारी देने से आगे बढ़कर कार्रवाइयां पूरी कर सकता है। 
  • रियल-टाइम जवाब: लाइव स्रोतों से डेटा लेकर LLM डेटाबेस या API कॉल से रियल-टाइम जानकारी पा सकता है। इससे आपको वह अप-टू-डेट जानकारी मिलती है जो केवल ट्रेनिंग डेटा से काम करने पर उपलब्ध नहीं होती।
  • ऑटोमेटेड मल्टी-स्टेप प्रोसेस: जिस काम के लिए आपको कई अलग-अलग सिस्टम के साथ इंटरैक्ट करना पड़ता, उसे टूल कॉलिंग वाले LLM में एक प्रॉम्प्ट से किया जा सकता है। यह दूसरे सिस्टम से क्वेरी करके आपके लिए जानकारी ला सकता है, और आपको इंटरैक्शन विंडो छोड़ने की ज़रूरत नहीं पड़ती।

Gartner का अनुमान है कि 40% एंटरप्राइज़ एप्लिकेशन 2026 के अंत तक काम-विशेष AI एजेंट के साथ इंटीग्रेट हो जाएंगे, जो 2025 में 5% से भी कम था। किसी काम के लिए सही टूल कॉल कर सकने वाला मॉडल अपनी क्षमता बढ़ाता है और यूज़र्स को प्राकृतिक भाषा के प्रॉम्प्ट से ज़्यादा काम करने देता है।

टूल कॉलिंग बनाम रिट्रीवल-ऑगमेंटेड जनरेशन (RAG)

रिट्रीवल-ऑगमेंटेड जनरेशन और टूल कॉलिंग, दोनों ही मॉडल के ट्रेनिंग डेटा से मिले संदर्भ से बाहर की जानकारी खोजने से जुड़ी हैं, लेकिन इनका फ़ोकस अलग है। RAG मुख्य रूप से स्टैटिक कंटेंट के लिए है, जिसमें लेख, दस्तावेज़ और मॉडल से कनेक्ट किए गए नॉलेज बेस जैसी जानकारी शामिल है। यह LLM को अतिरिक्त संदर्भ देता है, जिससे वह अधिक व्यापक जवाब बना सके।

टूल कॉलिंग का उपयोग डायनामिक जानकारी तक पहुंचने के लिए होता है, जिसमें लगातार बदलने वाले रियल-टाइम सिस्टम शामिल हैं। RAG किसी खास साल की कीमतों वाली PDF ला सकता है, जबकि टूल कॉलिंग कनेक्टेड सिस्टम से तुरंत लाइव कीमतें ले सकती है। ज़्यादातर LLM सिस्टम इन क्षमताओं को साथ में इस्तेमाल करते हैं, क्योंकि कई उपयोग मामलों में नॉलेज बेस और लाइव टूल, दोनों ज़रूरी होते हैं।

RAG retrieves static knowledge; tool calling accesses live systems; most systems use both.

टूल कॉलिंग कैसे काम करती है?

चाहे AI एजेंट किसी आंतरिक ऐप को कॉल कर रहा हो या बाहरी मॉडल को, टूल कॉलिंग आमतौर पर एक मानक पैटर्न का पालन करती है। 

टूल कॉलिंग कैसे काम करती है, इसका एक उच्च-स्तरीय सारांश यहां है:

  1. पहचानें कि टूल कॉल की ज़रूरत कब है
  2. कनेक्टेड सिस्टम से सही टूल चुनें
  3. अनुरोध बनाएं और भेजें
  4. अनुरोध चलाया जाता है और परिणाम लौटाया जाता है
  5. मॉडल जवाब देता है या आगे कार्रवाई करता है

आइए इन्हें विस्तार से समझते हैं।

Five-step tool-calling flow from prompt to action; model requests, application executes.

चरण 1: पहचानें कि टूल कॉल की ज़रूरत कब है

जब आप प्राकृतिक भाषा में अनुरोध लिखते हैं, तो मॉडल आपका प्रॉम्प्ट पढ़ता है और जांचता है कि उसे किसी टूल से बाहरी मदद की ज़रूरत होगी या नहीं। जो सवाल उसके ट्रेनिंग डेटा से मेल खाता है, उसके लिए बाहरी मदद नहीं चाहिए होगी, लेकिन मॉडल के संदर्भ से बाहर के कुछ सवालों के लिए चाहिए होगी।

“Salesforce में Q2 के हमारे बिक्री आंकड़े क्या थे?” और “हमारे Shopify स्टोर पर अभी कितने सक्रिय यूज़र हैं?” जैसे सवालों के लिए टूल कॉल की ज़रूरत होगी।

चरण 2: कनेक्टेड सिस्टम से सही टूल चुनें

मॉडल को उपलब्ध हर टूल का एक स्कीमा होता है: नाम, वह क्या करता है इसका प्राकृतिक भाषा में विवरण, और वे पैरामीटर जिन्हें वह स्वीकार करेगा। मॉडल सही टूल खोजने के लिए आपके अनुरोध की तुलना इन सभी विवरणों से करता है। खासकर जब एजेंट के पास टूल का बड़ा कैटलॉग हो, तो वह प्रासंगिक टूल छांटने के लिए आंतरिक प्रक्रिया चलाता है, क्योंकि सैकड़ों टूल को मैन्युअली खंगालने से सही टूल ढूंढने में बहुत समय लगेगा।

चरण 3: अनुरोध बनाएं और भेजें

सही टूल चुनने के बाद मॉडल एक स्ट्रक्चर्ड कॉल बनाता है, जो अक्सर JSON फ़ॉर्मैट में होती है। इस कॉल में वह टूल और अनुरोध में शामिल जानकारी तय होती है। उदाहरण के लिए, बोगोटा का मौसम जानने का अनुरोध ऐसा दिख सकता है: {"name": "get_weather", "arguments": {"city": "Bogota"}}। मॉडल यह कॉल आउटपुट करता है और अगले चरण में एप्लिकेशन लेयर इसे चलाती है।

चरण 4: अनुरोध चलाया जाता है और परिणाम लौटाया जाता है 

एप्लिकेशन लेयर मॉडल का अनुरोध पाती है और अनुरोध पूरा करने के लिए टूल चलाती है या API कॉल करती है। फिर जवाब को अतिरिक्त संदर्भ के रूप में मूल मॉडल को भेजा जाता है, जो इसके आधार पर यूज़र को जवाब देता है। 

चरण 5: मॉडल जवाब देता है या आगे कार्रवाई करता है

टूल कॉल से मिले डेटा या जानकारी के साथ मॉडल या तो सामान्य भाषा में यूज़र को जवाब देता है या पुष्टि करता है कि कोई खास कार्रवाई की गई है। दूसरा जवाब तब आता है, जब यूज़र का काम कार्रवाई-आधारित हो, जैसे किसी खास प्लेटफ़ॉर्म पर संदेश पोस्ट करना या डेटाबेस में डेटा दर्ज करना।

अगर काम में और चरण चाहिए हों, तो मॉडल उसी अनुसार चरण 1-4 दोहराएगा। अधिक जटिल अनुरोधों में यूज़र को अंतिम जवाब देने से पहले कई टूल कॉल करने पड़ सकते हैं। उदाहरण के लिए, अगर कोई यूज़र मौजूदा विनिमय दर जानकर मुद्राएं बदलना चाहता है, तो मॉडल को यह लक्ष्य पूरा करने के लिए क्रम से कई चरण चलाने होंगे। 

टूल कॉलिंग के प्रकार

टूल कॉलिंग उस हर स्थिति को बताती है, जब मॉडल अपने मूल ट्रेनिंग से आगे के डेटा के लिए किसी बाहरी सिस्टम को कॉल करता है। इस प्रक्रिया में कई अलग-अलग सिस्टम इस्तेमाल हो सकते हैं और अलग-अलग उपयोग मामलों में अलग तरह के टूल काम आते हैं।

  • जानकारी प्राप्त करना: इसमें मॉडल के मूल ट्रेनिंग संदर्भ से बाहर के सवाल का जवाब देने के लिए API, कनेक्टेड कंपनी डेटाबेस या सर्च इंडेक्स जैसे बाहरी स्रोत से डेटा लेना शामिल है।
  • कोड एक्ज़ीक्यूशन: कोड एनवायरनमेंट के ज़रिए किसी स्क्रिप्ट, डेटा ट्रांसफ़ॉर्मेशन प्रक्रिया या कैलकुलेशन को चलाना। इसका इस्तेमाल आमतौर पर यह बताने के बजाय डेटा का विश्लेषण करने के लिए होता है कि विश्लेषण व्यवहार में कैसे काम कर सकता है।
  • प्रोसेस ऑटोमेशन: यह उस स्थिति को बताता है जब API कॉल किसी दूसरे सिस्टम में खास वर्कफ़्लो शुरू करती है, जैसे CMS के साथ इंटरैक्ट करना, मीटिंग शेड्यूल करना, रिकॉर्ड अपडेट करना, नोटिफ़िकेशन भेजना या अनुरोधों को पूरे हुए काम में बदलना। यह खासकर ऐसे एजेंटिक सिस्टम में आम है जो व्यक्ति के लिए काम करते हैं।
  • डिवाइस और सिस्टम कंट्रोल: दूसरे डिवाइस, टेलीफ़ोनी सिस्टम, स्मार्ट होम असिस्टेंट आदि के साथ इंटरैक्ट करने वाली टूल कॉल इस श्रेणी में आती हैं।

अक्सर टूल कॉलिंग इन श्रेणियों में से सिर्फ एक में साफ़ तौर पर नहीं आती। आपके पास कई चरणों वाली और चेन की गई कॉल हो सकती हैं, जो ऊपर की कई श्रेणियों को लगातार क्रम में जोड़ती हैं। उदाहरण के लिए, आप ग्राहक के ऑर्डर की स्थिति पा सकते हैं, फिर रिफ़ंड शुरू कर सकते हैं, फिर अपना आंतरिक CRM अपडेट कर सकते हैं और यह जानकारी किसी लाइव एजेंट को दे सकते हैं।

Four types of tool calling: retrieval, code, automation, and device control, often chained.

टूल कॉलिंग बनाम फ़ंक्शन कॉलिंग: मुख्य अंतर

टूल कॉलिंग, फ़ंक्शन कॉलिंग से व्यापक श्रेणी है। इसका दायरा बड़ा है और इसमें संभावित क्षमताओं की अधिक विविध रेंज शामिल है। फ़ंक्शन कॉलिंग तब होती है, जब मॉडल किसी पहले से तय फ़ंक्शन के लिए आर्ग्युमेंट के साथ एक स्ट्रक्चर्ड कॉल बनाता है।

यहां टूल कॉल और फ़ंक्शन कॉल के अंतर समझाने वाली एक तालिका है। 

Function calling
Overall scope
A model that can generate a function call for a specific predetermined action
Origin
OpenAI introduced the term back in 2023
Relationship
A narrow subset of tool calling
Commonly found
Within older API documentation or legacy parameters
Tool calling
Overall scope
A wide capability that relates to calling APIs, executing code, and interacting with external systems
Origin
The wider industry term that has now become popularized, stemming from a model’s ability to interact with multiple external tools
Relationship
A broad concept that includes function calling
Commonly found
Modern documentation used by most AI companies
Function calling is a narrow subset of tool calling; terms are often used interchangeably.

टूल कॉलिंग कितनी भरोसेमंद है? 

टूल कॉलिंग की विश्वसनीयता पूरी तरह कॉल करने वाले मॉडल पर निर्भर करती है। अलग-अलग सिस्टम में विफलता भी अलग तरह से दिख सकती है। उदाहरण के लिए, टूल कॉल विफल होने पर एक AI मॉडल केवल जवाब गढ़ सकता है, जबकि दूसरा यूज़र को फिर से कोशिश करने के लिए कह सकता है। 

Berkeley Function Calling Leaderboard एक आम तौर पर संदर्भित लीडरबोर्ड है, जो टूल कॉलिंग के मामले में अलग-अलग मॉडल के प्रदर्शन की तुलना करता है। इसे फ़ंक्शन कॉलिंग लीडरबोर्ड कहा जाता है, लेकिन व्यवहार में यह मॉडल को API कॉल, डेटाबेस क्वेरी से जानकारी जुटाने, पैरेलल कॉल चलाने या मल्टी-टर्न बातचीत में जवाब देने पर जांचकर टूल कॉलिंग की दक्षता मापता है।

मॉडल को कुल लागत, वेब सर्च करने की क्षमता, मल्टी-टर्न बातचीत की सटीकता, हैलुसिनेशन मापने, लेटेंसी आदि पर परखा जाता है। अगर आप जटिल या कई चरणों वाले वर्कफ़्लो चलाने वाले हैं, तो यह जानना उपयोगी है कि किन मॉडल की टूल कॉलिंग क्षमताएं अधिक व्यापक हैं। 

टूल कॉलिंग के लिए ElevenAgents से शुरुआत करें

ElevenAgents में आप कई मॉडल में से चुन सकते हैं, जिससे आप अपने वर्कलोड को सबसे उपयुक्त अंतर्निहित मॉडल से मिला सकते हैं। वॉइस एजेंट टूल कॉल करते हैं, ऑर्डर खोजते हैं, रिकॉर्ड जांचते हैं, डेटाबेस अपडेट करते हैं और API से जानकारी जुटाते हैं।

आप कई तरह के टूल इस्तेमाल कर सकते हैं, जिनमें बाहरी API कॉल करने के लिए वेबहुक टूल, एप्लिकेशन या ब्राउज़र में कार्रवाई शुरू करने के लिए क्लाइंट टूल, कस्टम सर्वर-साइड लॉजिक के लिए कोड टूल, बाहरी टूल सर्वर से कनेक्ट होने वाले MCP टूल और मानव एजेंट को ट्रांसफ़र करने जैसी बिल्ट-इन कार्रवाइयों के लिए सिस्टम टूल शामिल हैं।

ElevenLabs पहले से बने नेटिव कनेक्टर भी देता है, जो Zendesk, HubSpot, Salesforce और कई अन्य सेवाओं के लिए उपलब्ध हैं। इससे आपको कस्टम सेटअप कॉन्फ़िगर करने की ज़रूरत नहीं पड़ती। ElevenAgents के बारे में और जानें या साइन अप करें और आज ही टूल कॉलिंग के साथ वॉइस एजेंट बनाना शुरू करें।

अक्सर पूछे जाने वाले सवाल

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं