पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

ElevenAgents में इमेज और डॉक्युमेंट्स प्रोसेस करना

प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

एक साइट सुपरवाइज़र को काम की जगह पर सामग्री की कमी दिखती है। वह उसकी तस्वीर लेता है, उसे WhatsApp पर खरीद एजेंट को भेजता है और आवाज़ से डिलीवरी का पता कन्फ़र्म करता है। एजेंट फोटो को प्रोसेस करता है, पता लगाता है कि क्या कमी है और तुरंत ऑर्डर दे देता है—वह भी एक ही बातचीत में। एंटरप्राइज़ वर्कफ़्लो में अक्सर ऐसा संदर्भ होता है जिसे सिर्फ़ शब्द नहीं बता सकते। किसी अनुरोध को पूरा करने के लिए ज़रूरी जानकारी किसी खराब वस्तु की फोटो या किसी पॉलिसी के PDF के रूप में दी जा सकती है। इसे सीधे एजेंट को भेजने से बातचीत छोटी होती है और समाधान तेज़ होता है। जब ग्राहक बताने के बजाय दिखा सकता है, तो एजेंट बिना चैनल बदलवाए तेज़ी से समस्या हल कर सकता है। Rohlik, जो यूरोप के सबसे बड़े ऑनलाइन ग्रॉसरी प्लेटफ़ॉर्म्स में से एक है, फोन, वेब, ऐप और WhatsApp पर छह भाषाओं में अपने एजेंट को चलाता है और ग्राहकों के 90% सवालों को अपने-आप हल करता है। मल्टीमॉडल इनपुट इसी समाधान दर को उन स्थितियों तक बढ़ाता है जहाँ ग्राहक को बताने के बजाय कुछ दिखाना होता है। ElevenAgents, आवाज़, WhatsApp, वेब और मोबाइल संभाल रहे उसी एजेंट के लिए फ़ाइलों को भी प्रथम-स्तरीय इनपुट मानता है। फ़ाइलें मूल मैसेज के रूप में अंतर्निहित मॉडल तक पहुँचती हैं, इसलिए एक ही एजेंट एक बातचीत थ्रेड में हर तरह का इनपुट संभालता है। 

इस पोस्ट में बताया गया है कि प्लेटफ़ॉर्म पर मल्टीमॉडैलिटी का क्या मतलब है, फ़ाइलें ग्राहक के डिवाइस से मॉडल के संदर्भ तक कैसे पहुँचती हैं, हर चैनल क्या सपोर्ट करता है और ग्राहक के लौटने पर सेशंस के बीच संदर्भ कैसे बनाए रखें।

चैनल और इनपुट 

ElevenAgents उन चैनलों के आधार पर बना है जिनका इस्तेमाल एंटरप्राइज़ पहले से ग्राहकों तक पहुँचने के लिए करते हैं: वेब और मोबाइल ऐप्लिकेशन, उनका सपोर्ट प्लेटफ़ॉर्म, फोन, SMS, ईमेल, WhatsApp और अन्य। एजेंट कॉन्फ़िगरेशन (प्रॉम्प्ट, मॉडल, टूल्स, नॉलेज बेस और वॉइस) एक बार तय किया जाता है और सभी चैनलों पर साझा होता है। हर चैनल पर दो चीज़ें बदलती हैं: ट्रांसपोर्ट लेयर और उसके सपोर्ट किए जाने वाले इनपुट प्रकार। वेब और मोबाइल ऐप्लिकेशन एम्बेड किए जा सकने वाले विजेट, किसी SDK या Agents WebSocket के ज़रिए कनेक्ट होते हैं। टेलीफोनी बातचीत नेटिव Twilio, SIP ट्रंकिंग या नेटिव websocket-आधारित इंटीग्रेशन्स के ज़रिए कनेक्ट होती हैं। SMS नेटिव Twilio इंटीग्रेशन के ज़रिए कनेक्ट होता है। WhatsApp Business अकाउंट इंपोर्ट करके और एजेंट पर इंटीग्रेशन चालू करके WhatsApp कनेक्ट होता है। एक ही एजेंट को इन सभी ट्रांसपोर्ट्स पर एक साथ डिप्लॉय किया जा सकता है।

Sequence diagram showing a flow for attaching and sending files in a customer conversation using ElevenLabs API.

फ़ाइल इनपुट (इमेज और PDF) फ़िलहाल वेब, मोबाइल और WhatsApp पर सपोर्ट किए जाते हैं। इनपुट हैंडलिंग चैनल-आधारित नहीं, बल्कि प्रकार-आधारित है: एक ही WhatsApp सेशन में आने वाली फोटो और वॉइस नोट, मॉडल तक पहुँचने से पहले पूरी तरह अलग पाइपलाइनों से प्रोसेस होती हैं। चैनल या इनपुट प्रकार चाहे जो हो, सभी इनपुट मॉडल को नेटिव संदर्भ के रूप में भेजने से पहले एक ही प्री-प्रोसेसिंग लेयर पर मिलते हैं, जहाँ वे दो में से किसी एक पथ का अनुसरण करते हैं।

इनपुट का स्वरूप: फ़ाइल-आधारित बनाम इनलाइन

इनपुट प्रकार या चैनल चाहे जो हो, प्लेटफ़ॉर्म हर इनपुट को मॉडल तक भेजने से पहले दो में से किसी एक आंतरिक स्वरूप में नॉर्मलाइज़ करता है। यह वर्गीकरण तय करता है कि मॉडल की कॉन्टेक्स्ट विंडो में इनपुट कैसे एन्कोड होगा और आपकी इंटीग्रेशन को पहले क्या संभालना होगा।

फ़ाइल-आधारित इनपुट

इमेज और PDF को टेक्स्ट सारांश के रूप में नहीं, बल्कि नेटिव फ़ाइल रेफरेंस के रूप में मॉडल को भेजा जाता है। प्लेटफ़ॉर्म फ़ाइल स्टोर करता है, उसे एक file_id देता है और उस आइडेंटिफ़ायर को यूज़र के टर्न से जोड़ देता है। विज़न-सक्षम या डॉक्यूमेंट-सक्षम मॉडल को किसी व्युत्पन्न स्वरूप के बजाय अपनी कॉन्टेक्स्ट विंडो में मूल फ़ाइल मिलती है। इंटीग्रेशन की ज़रूरत सीधी है: अपलोड एंडपॉइंट से मिलने वाले file_id को कैप्चर करें और उसे मैसेज पेलोड में शामिल करें। अगर मैसेज file_id के बिना भेजा जाता है, तो अपलोड सफल होने पर भी मॉडल के पास फ़ाइल का कोई रेफरेंस नहीं होता। फ़ाइल स्टोरेज बातचीत तक सीमित है। यानी सेशन के बाद भी जिन चीज़ों को बनाए रखना हो—खुद फ़ाइल, निकाले गए फ़ील्ड्स या स्ट्रक्चर्ड आउटपुट—उन्हें आपकी इंटीग्रेशन को साफ़ तौर पर संभालना होगा। इसका तरीका चैनल और इस्तेमाल के मामले के अनुसार बदलता है।

इनलाइन

दूसरा स्वरूप इनलाइन है, जिसमें बाकी सब कुछ शामिल है। आवाज़ और वॉइस नोट्स को ट्रांसक्राइब किया जाता है। मॉडल चलने से पहले टाइप किए गए टेक्स्ट, ट्रांसक्राइब की गई स्पीच, WhatsApp लोकेशन पिन और कॉन्टैक्ट कार्ड—सभी को ट्रांसक्रिप्ट में सादे टेक्स्ट में नॉर्मलाइज़ किया जाता है। लोकेशन पिन कोऑर्डिनेट्स और एक वैकल्पिक पते में बदल जाता है; कॉन्टैक्ट नाम और फोन नंबर में बदल जाता है। इनमें से कोई भी फ़ाइल के रूप में स्टोर नहीं होता या फ़ाइल रेफरेंस नहीं बनाता। ये इनपुट सीधे ट्रांसक्रिप्ट में रहते हैं।

यह अंतर क्यों मायने रखता है

यह विभाजन तय करता है कि आपकी इंटीग्रेशन की कोशिश कहाँ लगेगी। इनलाइन पथ में बातचीत के दौरान आपको कुछ करने की ज़रूरत नहीं होती: प्लेटफ़ॉर्म इन इनपुट्स को टेक्स्ट में नॉर्मलाइज़ करता है और वे सीधे ट्रांसक्रिप्ट में रहते हैं। फ़ाइल-आधारित पथ का इंटीग्रेशन सरफ़ेस अलग है। मॉडल चलने से पहले फ़ाइल की सामग्री को टेक्स्ट में बदलने के बजाय, ऑर्केस्ट्रेटर मूल फ़ाइल को सीधे मॉडल की कॉन्टेक्स्ट विंडो में भेजता है। मॉडल किसी व्युत्पन्न टेक्स्ट स्वरूप या विवरण के बजाय फ़ाइल की संरचना पर काम करता है, जिससे स्थानिक संबंध, विज़ुअल लेआउट और डॉक्यूमेंट फ़ॉर्मैटिंग सुरक्षित रहती है, जो वरना खो जाती। इस अंतर को ध्यान में रखते हुए, इस पोस्ट का बाकी हिस्सा इम्प्लीमेंटेशन पर है: एजेंट को कैसे कॉन्फ़िगर करें, फ़ाइलें हर चैनल से कैसे गुज़रती हैं और सेशंस के बीच संदर्भ कैसे बनाए रखें।

मल्टीमॉडल इनपुट सेट अप करना 

मल्टीमॉडल इनपुट चालू करने की शुरुआत वेब, मोबाइल और WhatsApp पर एक ही एजेंट कॉन्फ़िगरेशन से होती है। इसके बाद फ़ाइल कैसे अपलोड होती है और बाद में उसे कैसे प्राप्त किया जाता है, यह चैनल पर निर्भर करता है।

फ़ाइल इनपुट चालू करना

फ़ाइल इनपुट काम करने से पहले एजेंट कॉन्फ़िगरेशन में दो सेटिंग्स होना ज़रूरी हैं। पहले conversation_config.conversation.file_input.enabled को True पर सेट करें—एजेंट बनाते समय API के ज़रिए या डैशबोर्ड में सेटिंग्स > एडवांस्ड सेटिंग्स > फ़ाइल इनपुट के तहत। दूसरा, एजेंट को विज़न और डॉक्यूमेंट-सक्षम मॉडल के साथ कॉन्फ़िगर किया जाना चाहिए। अगर अंतर्निहित मॉडल इमेज या डॉक्यूमेंट ब्लॉक्स को प्रोसेस नहीं कर सकता, तो सिर्फ़ फ़्लैग से कुछ नहीं होगा; टेस्ट करने से पहले दोनों सेट होने चाहिए।

SDK और WebSocket

वेब या मोबाइल पर फ़ाइल इनपुट के लिए SDK पर बना कस्टम चैट क्लाइंट या रॉ Agents websocket कनेक्शन चाहिए। तीनों में फ़्लो एक जैसा है और क्रम का पालन करना ज़रूरी है: मैसेज भेजने से पहले फ़ाइल अपलोड होनी चाहिए, क्योंकि मैसेज पेलोड अपलोड से मिले आइडेंटिफ़ायर को रेफरेंस करता है।

पहले फ़ाइल अपलोड करें:

from elevenlabs import ElevenLabs

client = ElevenLabs(api_key="YOUR_API_KEY")

response = client.conversational_ai.conversations.files.create(
    conversation_id="your_conversation_id",
    file=open("example_file.jpg", "rb"),
)

file_id = response.file_id  

पूरे रिक्वेस्ट और रिस्पॉन्स के लिए फ़ाइल अपलोड देखें:

फिर कनेक्शन के ज़रिए ऐसा मैसेज भेजें जो मिले हुए file_id को रेफरेंस करे:

{ 
	"type": "multimodal_message",
	"text": { 
		"type": "user_message", 
		"text": "What does this show?" 
	 },
	"file": { 
		"type": "file_input", 
		"file_id": "<file_id>" 
 	}
}

SDKs अपलोड और रेफरेंस के चरणों को एक कॉल में शामिल कर देते हैं और फ़ाइल आइडेंटिफ़ायर को अंदर ही संभालते हैं। पूरे मैसेज फ़ॉर्मैट के लिए multimodal_message स्पेसिफ़िकेशन देखें। चूँकि आपकी ऐप्लिकेशन अपलोड करती है, इसलिए उस समय फ़ाइल आपके पास पहले से होती है। अगर आपको यह सिर्फ़ मौजूदा बातचीत के लिए चाहिए, तो उसे अपलोड करना और आइडेंटिफ़ायर को रेफरेंस करना काफ़ी है। अगर इसे सेशन के बाद भी बनाए रखना है, तो सबसे साफ़ तरीका अपलोड के समय अपनी ऐप्लिकेशन से इसे स्टोर करना है। सेशंस के बीच संदर्भ वाले सेक्शन में बताए गए पोस्ट-कॉल webhook के ज़रिए इसे बाद में भी प्राप्त किया जा सकता है।

WhatsApp

WhatsApp पर आपकी ऐप्लिकेशन अपलोड में कोई भूमिका नहीं निभाती। जब ग्राहक कोई इमेज, डॉक्यूमेंट या स्टिकर भेजता है, तो फ़ाइल पहले Meta के इन्फ़्रास्ट्रक्चर पर जाती है। Meta, WhatsApp Business API webhook के ज़रिए ElevenLabs को सूचित करता है और ElevenLabs आपके कनेक्टेड WhatsApp Business अकाउंट के क्रेडेंशियल्स का उपयोग करके सर्वर-टू-सर्वर फ़ाइल डाउनलोड करता है, अपनी कॉपी स्टोर करता है और उसे वेब या SDK अपलोड की तरह ही बातचीत से जोड़ देता है। एजेंट इसे मल्टीमॉडल इनपुट के रूप में पाता है और ट्रांसक्रिप्ट में file_input इवेंट दर्ज होता है।

क्योंकि आपकी ऐप्लिकेशन अपलोड को कभी नहीं संभालती, इसलिए फ़ाइल सीधे उसके पास कभी नहीं होती। वेब और मोबाइल की तरह अपलोड के समय इसे कैप्चर करने का कोई रास्ता नहीं है। फ़ाइल आपके सिस्टम तक पोस्ट-कॉल webhook में मौजूद file_url के ज़रिए पहुँचती है, जो ElevenLabs की स्टोर की गई कॉपी की ओर इशारा करता है। Meta का मीडिया URL सिर्फ़ इनजेशन के लिए इस्तेमाल होता है और कभी बाहरी रूप से एक्सपोज़ नहीं किया जाता। डाउनलोड के समय की सीमाओं सहित, इसे प्राप्त करने का तरीका सेशंस के बीच संदर्भ वाले सेक्शन में बताया गया है।

Sequence diagram showing media handling from customer to ElevenLabs via WhatsApp.

WhatsApp पर ग्राहक चैट में फ़ाइल भेजता है। ElevenLabs उसे Meta से प्राप्त करता है, स्टोर करता है और प्लेटफ़ॉर्म की तरफ़ file_id जोड़ देता है। यानी क्लाइंट-साइड अपलोड का कोई चरण नहीं है। वेब और मोबाइल के विपरीत, आपकी ऐप्लिकेशन POST /v1/convai/conversations/{id}/files कॉल नहीं करती या WebSocket पर multimodal_message नहीं भेजती। ElevenLabs डिलीवरी, स्टोरेज और एजेंट टर्न संभालता है।

सेशंस के बीच संदर्भ बनाए रखना

ElevenAgents हर बातचीत को अलग से प्रोसेस करता है। ग्राहक जो भी भेजता है और एजेंट बातचीत के दौरान जो भी हल करता है, वह अपने-आप अगली बातचीत में नहीं जाता। एजेंट पोस्ट-कॉल webhook के ज़रिए पूरी हुई बातचीत की हर चीज़ आपके सिस्टम को देता है, लेकिन बातचीतों के बीच बनी रहने वाली मेमरी ElevenLabs की सीमा के बाहर रहती है। उसकी निरंतरता आपकी ज़िम्मेदारी है।

इस आर्किटेक्चरल सीमा को ध्यान में रखकर सोच-समझकर डिज़ाइन करना चाहिए। जिन बातचीतों में मल्टीमॉडल इनपुट सबसे ज़्यादा मायने रखता है—जैसे ग्राहक का खराब वस्तु की फोटो लेना, पॉलिसी डॉक्यूमेंट अपलोड करना या लोकेशन शेयर करना—वे अक्सर एक ही सेशन में हल नहीं होतीं। टूटा हुआ पार्ट की फोटो भेजकर कॉलबैक शेड्यूल करने वाला ग्राहक उम्मीद करता है कि दोबारा कॉल करने पर एजेंट को वह फोटो याद होगी। स्पष्ट संदर्भ प्रबंधन के बिना, एजेंट हर बार शून्य से शुरू करता है और ग्राहक को खुद को दोहराना पड़ता है। इसे हल करने वाले पैटर्न के दो हिस्से हैं। बातचीत खत्म होने पर पोस्ट-कॉल webhook ट्रांसक्रिप्ट, विश्लेषण के नतीजे, आपके तय किए गए स्ट्रक्चर्ड डेटा-कलेक्शन फ़ील्ड्स और सेशन से गुज़री सभी फ़ाइलों के URL भेजता है। आपका बैकएंड ज़रूरी जानकारी को किसी स्थायी ग्राहक आइडेंटिफ़ायर, जैसे फोन नंबर, यूज़र ID या अकाउंट की, के साथ स्टोर करता है। ग्राहक के लौटने पर आपकी ऐप्लिकेशन सेशन शुरू होने पर डायनेमिक वेरिएबल्स के ज़रिए स्टोर किया हुआ संदर्भ इंजेक्ट करती है, ताकि एजेंट पहले से ज्ञात जानकारी के साथ बातचीत शुरू करे। खास तौर पर फ़ाइल-आधारित इनपुट्स के लिए, webhook पेलोड में मौजूद फ़ाइल URL ElevenLabs की स्टोर की गई कॉपी की ओर इशारा करता है और बातचीत बंद होने के बाद उसे पाने का यही एकमात्र तरीका है। प्लेटफ़ॉर्म की कॉपी सेशन तक सीमित है, इसलिए अगर आपको फ़ाइल किसी भविष्य की बातचीत या अपने सिस्टम में चाहिए, तो यह अवधि खत्म होने से पहले उसे webhook पेलोड से डाउनलोड करना होगा। आपको कितनी जल्दी काम करना है, यह रिटेंशन पॉलिसी पर निर्भर करता है, जिसका विवरण रेफरेंस डॉक्यूमेंटेशन में है। webhook स्टेट को बाहर भेजता है। डायनेमिक वेरिएबल्स उसे वापस लाते हैं। इनके बीच की हर चीज़ आपके सिस्टम की ज़िम्मेदारी है, और ग्राहकों के लौटने, एस्केलेट करने या समाधान के बीच से आगे बढ़ाने वाले हर इस्तेमाल के मामले में असली इंटीग्रेशन का काम यहीं होता है।

संदर्भ इंजेक्ट करना चैनल पर निर्भर करता है

इंजेक्शन का तरीका चैनल के अनुसार बदलता है, लेकिन मूल पैटर्न एक जैसा रहता है। टेलीफोनी के लिए, कॉल कनेक्ट होने से पहले ElevenLabs आपके सर्वर को कॉल करता है। इससे आपको नंबर से कॉलर को खोजने और एजेंट के बोलने से पहले नाम, ऑर्डर ID या अकाउंट टियर जैसे डायनेमिक वेरिएबल्स लौटाने का मौका मिलता है। WhatsApp पर हर इनबाउंड मैसेज के लिए एक प्री-मैसेज webhook ट्रिगर होता है, जिससे एजेंट के प्रोसेस करने से पहले आप अपने सिस्टम की पहचान और बिज़नेस संदर्भ जानकारी से उसे समृद्ध कर सकते हैं। अन्य मामलों में, वही फ़ील्ड्स conversation_initiation_client_data में सेशन खुलने पर भेजे जाते हैं। ElevenAgents अलग-अलग चैनलों के सेशंस को एक थ्रेड में मर्ज नहीं करता। एक WhatsApp बातचीत और एक वेब बातचीत, एक ही ग्राहक की होने पर भी अलग सेशन हैं। लेकिन webhook आउटपुट और डायनेमिक वेरिएबल इंजेक्शन सभी चैनलों पर एक जैसे काम करते हैं, इसलिए एक ही पर्सिस्टेंस लेयर इन सभी को संभालती है। इसे एक बार बनाइए और यह एजेंट के चलने वाले हर चैनल को कवर कर लेगी। कॉन्टेक्स्ट इंजेक्शन टेक्स्ट-जैसे डेटा—नाम, ऑर्डर IDs, सारांश और स्ट्रक्चर्ड फ़ील्ड्स—को संभालता है। फ़ाइलें अलग मामला हैं और इनके लिए अलग तरीका चाहिए।

फ़ाइलों को आगे ले जाना

फ़ाइलें एक बातचीत तक सीमित रहती हैं और अपने-आप पर्सिस्ट नहीं होतीं। आगे क्या ले जाना है, यह इस पर निर्भर करता है कि अगली बातचीत को फ़ाइल की जानकारी चाहिए या फ़ाइल खुद। ज़्यादातर मामलों में सिर्फ़ जानकारी चाहिए होती है। एजेंट अपलोड की गई फ़ाइल आने वाले टर्न पर उसकी व्याख्या करता है, लेकिन उस व्याख्या को अपने-आप कहीं स्थायी रूप से लिखता नहीं है। स्ट्रक्चर्ड आउटपुट पोस्ट-कॉल डेटा से मिलता है: ट्रांसक्रिप्ट, ट्रांसक्रिप्ट सारांश और आपके तय किए गए डेटा-कलेक्शन रिज़ल्ट फ़ील्ड्स। अगर कोई ग्राहक दरवाज़े की टूटी सील की फोटो भेजता है और एक हफ़्ते बाद क्लेम पर फ़ॉलो-अप करने लौटता है, तो एजेंट को दोबारा फोटो की ज़रूरत नहीं होती। उसे यह पता होना चाहिए कि क्लेम दरवाज़े की टूटी सील से जुड़ा है। आप इसे पोस्ट-कॉल डेटा से निकालते हैं, ग्राहक आइडेंटिफ़ायर के साथ स्टोर करते हैं और ग्राहक के लौटने पर डायनेमिक वेरिएबल के रूप में इंजेक्ट करते हैं। आम तौर पर एक छोटा सारांश या कुछ स्ट्रक्चर्ड फ़ील्ड्स काफ़ी होते हैं।

जब आपको मूल फ़ाइल की ज़रूरत हो—अपने रिकॉर्ड्स, अनुपालन या डाउनस्ट्रीम सिस्टम्स के लिए—तो पोस्ट-कॉल webhook ही उसे पाने का तरीका है। हर अपलोड की गई फ़ाइल ट्रांसक्रिप्ट में एक file_input इवेंट के रूप में दिखाई देती है, जिसमें साइन किया गया फ़ाइल URL होता है। वह URL पंद्रह मिनट तक वैध रहता है, इसलिए webhook आने पर ही फ़ाइल डाउनलोड और स्टोर करें, उसे बाद के लिए न टालें। अगर बातचीत मौजूद रहते हुए भी आप यह अवधि चूक जाते हैं, तो GET conversation API फ़ॉलबैक के तौर पर नए URL जारी कर सकता है। यह मानकर योजना बनाएं कि कुछ मामलों में—जैसे ज़ीरो-रिटेंशन मोड में— file_input मौजूद नहीं हो सकता, न कि यह मानें कि हर फ़ाइल-आधारित टर्न में URL होगा।

इससे पूरा लाइफ़साइकल कवर हो जाता है: फ़ाइल सेशन में आती है, मॉडल उस पर नेटिव रूप से काम करता है, स्ट्रक्चर्ड आउटपुट webhook से बाहर जाता है और आपकी पर्सिस्टेंस लेयर तय करती है कि अगली बार एजेंट को क्या पता होगा।

निष्कर्ष

एक ही एजेंट कॉन्फ़िगरेशन अलग-अलग चैनलों के लिए अलग बिल्ड किए बिना वेब, मोबाइल और WhatsApp पर इमेज और PDF स्वीकार करता है। फ़ाइलों को नॉर्मलाइज़ किया जाता है, टर्न से जोड़ा जाता है और टेक्स्ट सारांशों के बजाय नेटिव ब्लॉक्स के रूप में मॉडल को भेजा जाता है। इसलिए स्थानिक लेआउट, विज़ुअल संरचना और डॉक्यूमेंट फ़ॉर्मैटिंग बिना बदले मॉडल तक पहुँचते हैं। सेशंस के बीच संदर्भ हर चैनल पर एक ही पैटर्न का पालन करता है: पोस्ट-कॉल webhook स्टेट को बाहर ले जाता है और डायनेमिक वेरिएबल्स उसे वापस लाते हैं।

अगर आप ElevenLabs Agents पर बना रहे हैं और चाहते हैं कि आपका एजेंट आवाज़ और टेक्स्ट के साथ इमेज और डॉक्यूमेंट्स पर भी काम करे, तो मल्टीमॉडल इनपुट चालू करें और हमें बताएं कि आपको यह कैसा लगा।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं