発音辞書の使用

このガイドでは、発音辞書をプログラムで管理する方法を説明します。

ハウツーガイド · ElevenAPI クイックスタートを完了していることを前提としています。

概要

発音辞書を使うと、AIエージェントによる特定の単語やフレーズの発音をカスタマイズできます。特に、次のような場合に便利です。

  • 名前、地名、技術用語の発音を修正する
  • 会話全体で一貫した発音を維持する
  • 地域ごとの発音の違いをカスタマイズする

ElevenLabsは、IPAとCMUの両方のアルファベットに対応しています。

発音辞書の音素タグは、eleven_flash_v2およびeleven_v3モデルでのみ機能します。

その他のモデルでは辞書の音素タグはスキップされ、デフォルトの発音が使用されます。その他のモデルでは、 必要な発音になるスペルやフレーズに置き換えるため、代わりにエイリアスタグを使用してください。

英語以外の言語でIPAおよびCMUの発音を使用する場合は、 eleven_v3モデルに切り替える必要があります。

クイックスタート

このガイドは、APIキーとSDKを設定済みであることを前提としています。まだの場合は、 先にクイックスタートを完了してください。

1

発音辞書ファイルを作成する

この例では、tomatoという単語の発音辞書ファイルを作成します。

このルールでは「IPA」アルファベットを使用し、tomatoとTomatoの発音を別の発音に更新します。PLSファイルでは大文字と小文字が区別されるため、大文字の「T」がある形式とない形式の両方を含めます。

ClaudeやChatGPTなどのAIツールを使うと、特定の単語のIPAまたはCMU表記を作成できます。

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

SDKでファイルから発音辞書を作成する

使用する言語に応じて、example.pyまたはexample.mtsという新しいファイルを作成し、次のコードを追加します。

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

コードを実行する

python example.py

発音辞書あり/なしの2種類のオーディオが、スピーカーから再生されます。

次のステップ