पेश है Eleven v4पेश है Eleven v4, हमारा अब तक का सबसे भावपूर्ण मॉडल। 12 अक्टूबर तक Creator+ के साथ 3 गुना क्रेडिट शामिल हैं

कंटेंट पर जाएं

वेबिनार सारांश: अपने टेक्स्ट चैटबोट को इंसानों जैसी आवाज़ दें

प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

चैट एजेंट अब एंटरप्राइज़ सॉफ़्टवेयर स्टैक का सामान्य हिस्सा बन गए हैं। ज़्यादातर कंपनियों के पास एक है या वे एक बना रही हैं। लेकिन कम लोगों ने यह समझा है कि जब यूज़र सिर्फ़ बात करना चाहे, तब क्या होता है।

वॉइस, बातचीत को सिर्फ़ सुविधा से कहीं ज़्यादा मायनों में बदल देती है। यूज़र अपनी आवाज़ के लहजे से झुंझलाहट, तात्कालिकता और उलझन व्यक्त करते हैं—ऐसी बातें जो टेक्स्ट पूरी तरह हटा देता है। जो ग्राहक "मेरा ऑर्डर नहीं आया है" टाइप करता है और जो ग्राहक सुनाई देने वाली बेचैनी के साथ यही बात कहता है, वे अलग-अलग संकेत दे रहे हैं—और जो एजेंट सिर्फ़ ट्रांसक्रिप्ट पढ़ सकता है, उसके पास केवल आधी जानकारी होती है।

अब ज़्यादातर टीमें यह नहीं पूछ रही हैं कि वॉइस जोड़नी चाहिए या नहीं, बल्कि यह कि जो पहले से काम कर रहा है उसे फिर से बनाए बिना इसे कैसे जोड़ा जाए।

हमारे लाइव वर्कशॉप: अपने टेक्स्ट चैटबॉट को इंसानों जैसी आवाज़ दें में, पॉल ऐस्जेस (डेवलपर एक्सपीरियंस), भार्गवी भट्ट (कस्टमर एक्सपीरियंस) और फर्गल बर्नेट (प्रोडक्ट मार्केटिंग, ElevenAPI) ने मौजूदा एजेंट में वॉइस जोड़ने की तकनीकी वास्तविकताओं और एक काम करने वाला इंटीग्रेशन वास्तव में कैसा दिखता है, इस पर बात की।

वॉइस के साथ बनाना दिखने से ज़्यादा मुश्किल क्यों है

मुख्य चुनौतियों में से एक है बारी-बारी से बोलना। इंसान स्वर, लय और संदर्भ से समझ लेते हैं कि कोई व्यक्ति बोलना कब खत्म कर चुका है। लेकिन वॉइस एक्टिविटी डिटेक्शन (मानक तरीका) केवल खामोशी पहचानता है।

अक्सर नतीजा ऐसा सिस्टम होता है जो हर विराम को बोलने का निमंत्रण समझता है: वह बीच में टोकता है, विचार पूरा होने से पहले काट देता है और स्वाभाविक हिचकिचाहट को पूरा वाक्य मानकर जवाब देता है।

तकनीकी रूप से यह काम करता है, लेकिन बातचीत के लिहाज़ से टूटा हुआ है।

संदर्भ इस समस्या का दूसरा हिस्सा है। हर टर्न पर बातचीत का इतिहास LLM को भेजना ज़रूरी है, लेकिन काफ़ी नहीं। एक ही शब्द कहने के तरीके के आधार पर अलग अर्थ रखते हैं—राहत के साथ कहा गया "मैं ठीक हूँ" और झुंझलाहट के साथ कहा गया "मैं ठीक हूँ", ट्रांसक्रिप्ट में एक जैसे हैं, लेकिन बातचीत अलग है। जो वॉइस सिस्टम इस पहलू को नज़रअंदाज़ करता है, वह अलग-अलग मॉडल कितने भी अच्छे हों, हमेशा थोड़ा अस्वाभाविक लगेगा।

इंजीनियरिंग ओवरहेड भी होता है। जो टीमें अपना वॉइस ऑर्केस्ट्रेशन खुद संभालती हैं, उन्हें टर्न-टेकिंग लॉजिक, इंटरप्शन हैंडलिंग और लेटेंसी प्रोफाइलिंग को लगातार बनाए रखना पड़ता है। यह एक बार का काम नहीं है।

मौजूदा एजेंट में वॉइस कैसे जोड़ें

सबसे साफ़ तरीका डुअल WebSocket आर्किटेक्चर है। 

  1. एक कनेक्शन क्लाइंट और ElevenLabs API के बीच चलता है, और दूसरा आपके सर्वर और ElevenLabs API के बीच
  2. यूज़र अपने माइक्रोफ़ोन में बोलता है, ऑडियो ElevenLabs API को भेजा जाता है, जहाँ उसे ट्रांसक्राइब करके आपके सर्वर पर भेज दिया जाता है
  3. आपका सर्वर ElevenLabs API से मिली पूरी बातचीत की हिस्ट्री LLM को देता है, और स्ट्रीम किया गया जवाब ऑडियो सिंथेसिस के लिए वापस भेजा जाता है
  4. यह LLM के जनरेशन पूरा करने से पहले शुरू हो सकता है—जिससे फर्स्ट-बाइट लेटेंसी कम रहती है 

मुख्य इंटीग्रेशन पॉइंट onTranscript मेथड है, जो हर टर्न के अंत में चलता है और पूरी बातचीत की हिस्ट्री LLM को भेजता है। 

सेशन की शुरुआत में contextualUpdate यूज़र के वॉइस पर स्विच करने से पहले बातचीत के टेक्स्ट हिस्से में हुई हर बात को आगे ले जाता है—जिससे एक ही एजेंट संदर्भ खोए बिना दोनों माध्यमों में काम कर सकता है।

speech-engine

बनाते समय कुछ बातें ध्यान में रखें:

  1. चैट की तुलना में वॉइस में LLM का चुनाव ज़्यादा मायने रखता है। डीप रीजनिंग मॉडल ऐसे विराम लाते हैं जो ऑडियो में अस्वाभाविक हिचकिचाहट जैसे लगते हैं, भले ही जवाब की गुणवत्ता बेहतर हो। रियल-टाइम वॉइस में, तेज़ मॉडल लगभग हमेशा महसूस होने वाली गुणवत्ता में बेहतर होते हैं।
  2. ऑडियो के लिए WebSockets के बजाय WebRTC इस्तेमाल करें। WebRTC में इको और नॉइज़ कैंसलेशन पहले से मौजूद होते हैं, जो मोबाइल या शोर वाले माहौल में खास तौर पर ज़रूरी हैं। ऑडियो ट्रांसपोर्ट के लिए WebSockets इस्तेमाल करने का मतलब है कि आपको यह सब खुद संभालना होगा।
  3. यूज़र्स से भाषा चुनने के लिए न कहें। इससे बातचीत का प्रवाह टूटता है। बोलने के शुरुआती कुछ सेकंड से भाषा पहचानकर उसे लॉक करना बेहतर तरीका है—और इससे यूज़र को कुछ किए बिना आसानी से भाषा बदली जा सकती है।
  4. अपने टर्न-टेकिंग मॉडल को LLM से अलग रखें। यूज़र ने बोलना कब खत्म किया, यह तय करने के लिए LLM का इस्तेमाल हर टर्न में लेटेंसी और लागत बढ़ाता है। एक समर्पित टर्न-टेकिंग मॉडल इसे तेज़ी और ज़्यादा सटीकता से संभालता है, और आर्किटेक्चर में इसे अलग कंपोनेंट मानना ज़रूरी है।

कितना इन्फ्रास्ट्रक्चर खुद संभालें

सही जवाब इस पर निर्भर करता है कि आपके पास पहले से क्या मौजूद है। अगर आपके पास काम करने वाला चैट एजेंट है, तो उसके ऊपर वॉइस लेयर जोड़ना (अपने LLM, ऑर्केस्ट्रेशन और बिज़नेस लॉजिक को बरकरार रखते हुए) आमतौर पर सबसे तेज़ और सबसे कम जोखिम वाला रास्ता है। 

आपको कुछ भी फिर से बनाने की ज़रूरत नहीं है। आप पहले से काम कर रही चीज़ में बस एक ऑडियो इंटरफ़ेस जोड़ रहे हैं।

अगर ज़रूरतें टेलीफ़ोनी, डिप्लॉयमेंट चैनल मैनेजमेंट, बिल्ट-इन टेस्टिंग और एनालिटिक्स तक बढ़ती हैं, तो स्टैक का ज़्यादा हिस्सा वॉइस एजेंट प्लेटफ़ॉर्म को सौंपना समझदारी हो सकती है। ये दोनों तरीके एक-दूसरे के विकल्प नहीं हैं—टीमें हल्की वॉइस लेयर से शुरुआत कर सकती हैं और उपयोग का मामला परिपक्व होने पर प्लेटफ़ॉर्म की क्षमताएँ जोड़ सकती हैं।

डेमो: मौजूदा चैटबॉट में वॉइस जोड़ना

इस डेमो में एक यूज़र टेक्स्ट-आधारित ट्रैवल-प्लानिंग चैटबॉट के साथ बातचीत के बीच में है और जापान की यात्रा के लिए इलाकों और खाने की सिफ़ारिशें पूछ रहा है।

हमने क्या कवर किया:

  • अंदर मौजूद एजेंट में कोई बदलाव किए बिना चैटबॉट में वॉइस लेयर जोड़ी गई।
  • यूज़र ने बातचीत के बीच में टाइपिंग से बोलने पर स्विच किया—एजेंट ने दोनों माध्यमों का पूरा संदर्भ बनाए रखा।
  • यूज़र ने डच में बात की; एजेंट ने भाषा में बदलाव को अपने-आप पहचान लिया
  • जब एजेंट को बीच में रोका गया और वाक्य के बीच में वापस अंग्रेज़ी में स्विच करने को कहा गया, तो उसने ऐसा किया—और बिना कहे जवाब को हल्के डच लहजे के साथ पूरा किया।
  • पूरी बातचीत के दौरान, इंटरप्शन डिटेक्शन ने यूज़र को एजेंट के बीच में स्वाभाविक रूप से बोलने दिया, बिना एजेंट के अपना टर्न पूरा किए।

यह क्यों मायने रखता है: 

यह डेमो किसी खास तौर पर बनाए गए वॉइस एजेंट को नहीं दिखा रहा था। इसमें पहले से काम कर रहा एक टेक्स्ट एजेंट दिखाया गया, जिसके ऊपर वॉइस लेयर जोड़ी गई थी। संदर्भ हैंडलिंग, भाषा पहचान और इंटरप्शन व्यवहार—ये सभी वॉइस लेयर से आए थे; अंदर मौजूद टेक्स्ट एजेंट में कोई बदलाव नहीं हुआ था। 

पूरा सेशन देखें

पूरा वेबिनार यहाँ देखें।

अपने मौजूदा एजेंट में बड़े पैमाने पर वॉइस जोड़ें

कुछ और चाहिए? देखें हमारा सहायता केंद्र

ElevenLabs workshop on human-like chatbot voices, hosted by Paul Asjes, Bhargavi Bhatt, and Fergal Burnett.

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं