टेक्स्ट टू डायलॉग क्विकस्टार्ट

टेक्स्ट से इमर्सिव डायलॉग बनाना सीखें।

यह गाइड आपको टेक्स्ट टू डायलॉग API का इस्तेमाल करके टेक्स्ट से इमर्सिव, प्राकृतिक लगने वाला डायलॉग बनाना सिखाएगी।

भरोसेमंद जनरेशन के लिए, हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 कैरेक्टर या उससे कम रखें। लंबी स्क्रिप्ट को हिस्सों में बांटें और ऑडियो को क्लाइंट-साइड पर जोड़ें।

टेक्स्ट टू डायलॉग API का इस्तेमाल

1

API key बनाएं

डैशबोर्ड में यहां API key बनाएं, जिसका इस्तेमाल आप API एक्सेस करने के लिए सुरक्षित रूप से करेंगे।

key को मैनेज्ड सीक्रेट के रूप में स्टोर करें और अपनी पसंद के अनुसार इसे SDKs को .env फ़ाइल के ज़रिए एनवायरनमेंट वेरिएबल के रूप में या सीधे अपने ऐप के कॉन्फ़िगरेशन में पास करें।

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

SDK इंस्टॉल करें

हम अपने API key को environment variable से लोड करने के लिए dotenv library का भी इस्तेमाल करेंगे।

pip install elevenlabs
pip install python-dotenv
3

API रिक्वेस्ट करें

अपनी पसंद की भाषा के आधार पर example.py या example.mts नाम की नई फ़ाइल बनाएं और इसमें यह कोड जोड़ें। हर text वैल्यू में उस स्पीकर की डिलीवरी निर्देशित करने के लिए ऑडियो टैग जोड़ें। voice_id उसी इनपुट आइटम के लिए स्पीकर वॉइस चुनता है।

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

फिर इसे चलाएं:

python example.py

आपको डायलॉग ऑडियो चलता हुआ सुनाई देना चाहिए।

WebSocket स्ट्रीमिंग

Eleven v3 मॉडल के साथ लंबे समय तक बने रहने वाले कनेक्शन पर इंक्रीमेंटल डायलॉग के लिए रीयलटाइम टेक्स्ट टू डायलॉग देखें। इस WebSocket की तुलना स्टैंडर्ड TTS WebSocket से करने के लिए टेक्स्ट टू स्पीच बनाम टेक्स्ट टू डायलॉग WebSockets देखें।

अगले चरण