उच्चारण शब्दकोशों का उपयोग

यह गाइड दिखाती है कि उच्चारण शब्दकोशों को प्रोग्रामेटिक रूप से कैसे मैनेज करें।

कैसे करें गाइड · मानकर चलता है कि आपने ElevenAPI क्विकस्टार्ट पूरा कर लिया है।

ओवरव्यू

उच्चारण शब्दकोश से आप यह कस्टमाइज़ कर सकते हैं कि आपका AI एजेंट किसी खास शब्द या वाक्यांश का उच्चारण कैसे करे। यह खास तौर पर इन कामों के लिए उपयोगी है:

  • नामों, स्थानों या तकनीकी शब्दों का उच्चारण ठीक करना
  • बातचीत के दौरान एक जैसा उच्चारण सुनिश्चित करना
  • क्षेत्रीय उच्चारण विविधताओं को कस्टमाइज़ करना

ElevenLabs IPA और CMU दोनों अल्फ़ाबेट को सपोर्ट करता है।

उच्चारण शब्दकोश के फ़ोनीम टैग केवल eleven_flash_v2 और eleven_v3 मॉडल्स के साथ काम करते हैं।

अन्य मॉडल्स शब्दकोश फ़ोनीम टैग को छोड़ देते हैं और डिफ़ॉल्ट उच्चारण का इस्तेमाल करते हैं। अन्य मॉडल्स के लिए, वर्तनी या वाक्यांश बदलने के लिए इसके बजाय alias टैग का उपयोग करें, ताकि आपको ज़रूरी उच्चारण मिल सके।

अगर आप अंग्रेज़ी के अलावा दूसरी भाषाओं में IPA और CMU उच्चारण इस्तेमाल करना चाहते हैं, तो आपको eleven_v3 मॉडल पर स्विच करना होगा।

क्विकस्टार्ट

यह गाइड मानकर चलती है कि आपने अपनी API कुंजी और SDK सेट अप कर ली है। अगर नहीं किया है, तो पहले क्विकस्टार्ट पूरा करें।

1

उच्चारण शब्दकोश फ़ाइल बनाएं

इस उदाहरण में, हम tomato शब्द के लिए एक उच्चारण शब्दकोश फ़ाइल बनाएंगे।

यह नियम “IPA” अल्फ़ाबेट का इस्तेमाल करेगा और tomato और Tomato का उच्चारण अलग उच्चारण से अपडेट करेगा। PLS फ़ाइलें केस-सेंसिटिव होती हैं, इसलिए हम इसे बड़े “T” के साथ और उसके बिना, दोनों तरह से शामिल करते हैं।

खास शब्दों के लिए IPA या CMU नोटेशन जनरेट करने में मदद के लिए आप Claude या ChatGPT जैसे AI टूल्स इस्तेमाल कर सकते हैं।

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

SDK के ज़रिए फ़ाइल से उच्चारण शब्दकोश बनाएं

अपनी चुनी हुई भाषा के अनुसार example.py या example.mts नाम से एक नई फ़ाइल बनाएं और इसमें यह कोड जोड़ें:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

कोड चलाएं

python example.py

आपको अपने स्पीकर्स से ऑडियो के दो वर्ज़न सुनाई देंगे, एक उच्चारण शब्दकोश के साथ और दूसरा उसके बिना।

अगले कदम