कई अनुरोधों को जोड़ना

यह गाइड दिखाती है कि कई टेक्स्ट चंक्स/जनरेशन के बीच वॉइस प्रोसोडी कैसे बनाए रखें।

कैसे करें गाइड · मान लिया गया है कि आपने ElevenAPI क्विकस्टार्ट पूरा कर लिया है।

बड़े टेक्स्ट को ऑडियो में बदलते समय, आपको एक चंक से दूसरे चंक के बीच प्रोसोडी में अचानक बदलाव सुनाई दे सकते हैं। कई पैराग्राफ़ या सेक्शन वाले टेक्स्ट को बदलते समय यह खास तौर पर ध्यान देने योग्य होता है। कई चंक्स में वॉइस प्रोसोडी बनाए रखने के लिए, आप Request Stitching फीचर का इस्तेमाल कर सकते हैं।

इस फीचर से आप पहले से जनरेट किए गए और आगे जनरेट होने वाले टेक्स्ट का कॉन्टेक्स्ट दे सकते हैं, जिससे पूरे टेक्स्ट में वॉइस और प्रोसोडी एक जैसी बनी रहती है।

Request Stitching eleven_v3 मॉडल के लिए उपलब्ध नहीं है।

यहां Request Stitching के बिना एक उदाहरण है:

और Request Stitching के साथ वही उदाहरण:

Request Stitching का इस्तेमाल कैसे करें

ElevenLabs SDKs के साथ Request Stitching का इस्तेमाल करना सबसे आसान है।

यह गाइड मानकर चलती है कि आपने अपनी API key और SDK सेट अप कर ली है। अगर नहीं की है, तो पहले क्विकस्टार्ट पूरा करें।

1

कई रिक्वेस्ट को जोड़ें

अपनी पसंदीदा भाषा के अनुसार example.py या example.mts नाम की नई फ़ाइल बनाएं और इसमें यह कोड जोड़ें:

import os
from io import BytesIO
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
from dotenv import load_dotenv
load_dotenv()
ELEVENLABS_API_KEY = os.getenv("ELEVENLABS_API_KEY")
elevenlabs = ElevenLabs(
api_key=ELEVENLABS_API_KEY,
)
paragraphs = [
"The advent of technology has transformed countless sectors, with education ",
"standing out as one of the most significantly impacted fields.",
"In recent years, educational technology, or EdTech, has revolutionized the way ",
"teachers deliver instruction and students absorb information.",
"From interactive whiteboards to individual tablets loaded with educational software, ",
"technology has opened up new avenues for learning that were previously unimaginable.",
"One of the primary benefits of technology in education is the accessibility it provides.",
]
request_ids = []
audio_buffers = []
for paragraph in paragraphs:
# Usually we get back a stream from the convert function, but with_raw_response is
# used to get the headers from the response
with elevenlabs.text_to_speech.with_raw_response.convert(
text=paragraph,
voice_id="T7QGPtToiqH4S8VlIkMJ",
model_id="eleven_multilingual_v2",
previous_request_ids=request_ids
) as response:
request_ids.append(response._response.headers.get("request-id"))
# response._response.headers also contains useful information like 'character-cost',
# which shows the cost of the generation in characters.
audio_data = b''.join(chunk for chunk in response.data)
audio_buffers.append(BytesIO(audio_data))
combined_stream = BytesIO(b''.join(buffer.getvalue() for buffer in audio_buffers))
play(combined_stream)
2

कोड चलाएं

python example.py

आपको जुड़ा हुआ ऑडियो चलता हुआ सुनाई देना चाहिए।

अक्सर पूछे जाने वाले सवाल

कंडीशनिंग के लिए पिछली रिक्वेस्ट के request IDs इस्तेमाल करने से पहले, उस रिक्वेस्ट का पूरी तरह प्रोसेस होना ज़रूरी है। स्ट्रीमिंग के मामले में, इसका मतलब है कि रिस्पॉन्स बॉडी से ऑडियो को पूरी तरह पढ़ना होगा।

फ़र्क इस्तेमाल किए गए मॉडल, वॉइस और वॉइस सेटिंग्स पर निर्भर करता है।

request IDs दो घंटे से ज़्यादा पुराने नहीं होने चाहिए।

हां, जब तक आप ज़्यादा प्राइवेसी ज़रूरतों वाले एंटरप्राइज़ यूज़र नहीं हैं।

अगले चरण