Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

発音辞書ガイド:Eleven v4のTTSであらゆる単語の発音を修正

執筆者
Jack Limebear
公開日

聴くこの記事を聴く

Eleven v4は、略語、専門用語、名前、複数言語が混在するテキストを、これまでのどのモデルよりも正確に処理し、テキスト読み上げモデルの発音性能に新たな基準を打ち立てます。それでも、独自のプロダクト名から業界特有の専門用語まで、ブランドごとに固有の語彙があります。そのため、単語をどのように発音するかを完全にコントロールしたくなるでしょう。

Eleven v4 には、モデルの発話を細かくコントロールできる、発音修正のためのさまざまな方法があります。TTSアプリで作成するすべてのスクリプトに適用される、包括的な発音辞書を作成できます。または、一度だけ修正するためにテキストへ直接IPAを書き込むこともできます。

難しい用語が詰まったスクリプトをEleven v4が処理する例をご紹介します:

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

このガイドでは、TTS発音辞書の作成・使用方法と、イメージどおりの音声に近づけるために使える関連戦略をすべて解説します。

概要

  • 発音辞書は、テキスト読み上げモデル に特定の単語やフレーズの読み方を指示するために作成するルールセットです。
  • TTSの発音ルールには、別のテキストに置き換えるエイリアスベースと、発音表記を使う音素ベースがあります。
  • Eleven v4は音素ルールとインラインIPA(国際音声記号)に対応しています。
  • SSMLのphonemeタグとbreakタグはEleven v4では使えませんが、発音辞書またはAudio Tagsを自然言語による代替手段として使用できます。
  • ElevenAPIでは、リクエストごとに最大3つの発音辞書を適用できます。

発音辞書とは?

発音辞書は、テキスト読み上げモデルが特定の単語をどのように発音するかを正確に設定できるツールです。発音辞書に特定の単語やフレーズを追加すると、TTSスクリプト内に登場するたびにその読み方を定義できます。

発音辞書は通常、次のような用途で使われます:

  • ブランド名:独自のスペルや珍しいスペルを持つブランド名は、発音辞書によく登録されます。
  • 頭字語: 特定の頭字語には決まった読み方があります。たとえば、AEOは/eɪˈjoʊ/(「エイヨー」)ではなく、/ˌeɪ.iːˈoʊ/(「A-E-O」)と発音する必要があります。辞書に明確なルールを設定すれば、書くたびにモデルが正しく発音します。
  • 地名とその他の固有名詞: 地名のなかには、表記から想像する読み方とは大きく異なるものがあります。Worcestershireは、発音ガイドによって問題を避けられる代表例です。
  • 業界用語:たとえば医療や法律分野の業界用語・専門用語は、モデルがその分野のデータで明示的に学習していない場合、発音辞書が役立ちます。

テキスト読み上げ以外では、発音辞書は通常、ネイティブスピーカーによる音声クリップをクラウドソーシングで集めたリポジトリを指し、学習者はそこで特定の単語の発音を聞けます。

Different uses of pronunciation dictionaries in TTS apps

Eleven v4でTTSの発音をコントロールする方法

Eleven v4は、Artificial AnalysisのProvider Voice Arenaで最高品質のテキスト読み上げモデルとして評価されています。1 Eleven v4が市場をリードする理由の一つは、複雑なテキストを処理しながらも自然な音声出力を実現できることです。

Eleven v4で最高の体験を提供するため、このモデルには発音をカスタマイズするさまざまな方法が用意されており、すべての出力を求める精度に合わせられます。

Eleven v4で発音をコントロールする方法は次のとおりです:

  • インラインIPA: 発音辞書を使わずに、スクリプト内でスラッシュの間にIPAを書くことで発音を指定できます。詳しい方法は後ほど説明します。
  • 辞書内の音素ルール: 発音辞書に音素ベースのルールを記述し、繰り返し登場する単語の発音をコントロールします。
  • 言語をまたぐ自然な発音:Eleven v4は90以上の言語で自然な音声を生成できます。同じ音声を使いながら各言語のネイティブな発音を維持し、一貫したソニックブランディングを実現できます。

ElevenLabsの各TTSモデルにおける発音コントロール機能の比較は次のとおりです:

モデル

エイリアスルール(辞書)

音素ルール(辞書)

インラインIPA(/.../)

SSML音素タグ(<phoneme>)

Eleven v4

対応

対応

対応

非対応

Eleven v4 Turbo

対応

対応

対応

非対応

Eleven v3

対応

対応

対応

非対応

Eleven Flash v2

対応

対応

非対応

対応(英語のみ)

Eleven Turbo v2

対応

非対応

非対応

対応(英語のみ)

Eleven Multilingual v2

対応

非対応

非対応

非対応

Pronunciation dictionary guide on ElevenLabs across different models

発音辞書のエイリアスルールと音素ルールの違いは?

エイリアス発音ルールは、モデルが単語を発話する前に、あるテキストを別のテキストへ置き換えます。これはモデルが音声を生成するたびにバックグラウンドで行われ、単語やフレーズの音を発音辞書に登録した内容に置き換えます。

エイリアス発音ルールの例:

  • 「SaaS」を「sass」に置き換える
  • 「UN」を「United Nations」に置き換える
  • 「OAuth」を「oh auth」に置き換える

一方、音素ルールではモデルが使用する正確な発音表記を指定します。IPA転写を自分で書くか生成して辞書に入力する必要があるため、作成はより難しくなります。たとえば、「Kubernetes」は/ˌkuː.bərˈnɛt.iːz/になります。

TTSモデルでブランド名の発音を修正する方法

ブランド名は必ずしも実在する単語ではないため、発音辞書に最もよく登録される項目の一つです。企業が造語や独自のスペルをブランド名に使っている場合、その特定の発音を含む利用可能な学習データは非常に少ないため、TTSモデルが正しく発音できないことがあります。

Eleven v4でブランド名の発音を修正する方法:

  1. デフォルトの音を確認する: テキスト読み上げアプリを開き、ブランド名を入力します。クリップを生成して、どのように聞こえるかを確認してください。発音エラーがある場合は、次のステップに進みます。
  2. エイリアスルールを試す: ブランド名の発音エラーを修正する最も簡単な方法は、エイリアスルールを作成することです。すばやく作成でき、直感的に使えます。
  3. 音素ルールに切り替える: エイリアスルールでうまくいかない場合は、IPAを使います。ブランド名をIPAで転写し、テキスト読み上げの発音辞書内にルールを作成して発音を修正します。
  4. すべての大文字・小文字表記をカバーする: ブランド名で小文字版と大文字版の両方を使う場合は、両方のIPA転写を必ず含めてください。
  5. 一度だけの変更にはインラインIPAを使う: 一度だけの生成をすばやく修正したい場合は、辞書エントリを設定する代わりに、IPAを直接スクリプトに追加できます。

ブランド名のルールを設定すると、AIエージェント内でも、API経由でも、以後すべての共有プロジェクトで利用できます。

ElevenLabsで発音辞書を作成する方法

発音辞書は、テキスト読み上げアプリでルールを追加するか、.plsファイルをアップロードするか、ElevenAPIを通じて作成できます。このガイドでは、数ステップで完了する最初の方法を説明します。

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

発音辞書を作成する手順は次のとおりです:

  1. 発音辞書パネルを開く: テキスト読み上げページで上部の検索バーをクリックし、「Pronunciation dictionary」と入力して、Actionsの下にあるPronunciation dictionariesを選択します。
  2. 辞書を作成または選択する: Newをクリックして新しい辞書を作成するか、左側のリストから既存の辞書を選択します。
  3. ルールを追加する: Add ruleをクリックして新しい行を作成します。修正したい単語を入力します。スクリプトに表示されるとおりの単語またはフレーズをInputフィールドに入力してください。ルールでは大文字・小文字が区別されるため、使用する表記と一致させます。
  4. ルールタイプを選択する: 別のテキストに置き換えるにはAliasを、IPAまたはCMU表記を入力するにはPhonemeを選択します。
  5. 置換内容を入力する: Outputフィールドにエイリアスまたは発音表記を入力します。パネル上部の音声セレクターを使うと、作業中の音声でルールを確認できます。
  6. 変更を保存する: パネル下部のSave changesをクリックします。

発音ガイドをエージェントに紐付ける、またはAPI経由で適用するには、発音辞書のドキュメントをご覧ください。

Eleven v4のテキスト読み上げでIPAを使う方法

小さな変更や一般的でない単語の場合、間違いを修正するためにTTS発音辞書へ新しいエントリを作成する必要はありません。代わりに、インラインIPAを使ってモデルが単語をどのように発音すべきかを正確に指定できます。

Eleven v4では、スラッシュを使ってインラインIPAを有効にできます。Audio Tagsと同様、これらはスクリプトに直接入力できるため、できるだけ簡単に使えます。Eleven v4でのIPAの例:

  • 専門用語: 「/ˌbaɪoʊˈkemɪstri/」は化学プロセスの研究を指す用語です。
  • 医療用語: 「/ɡluːˈkoʊs/」と「/ˈɪnsjəlɪn/」は、「/ˌdaɪəˈbiːtiːz/」のような疾患の管理によく使われます。
  • ブランド名とプロダクト名: トラフィック急増に対応するため、サーバーは「/ˌɛndʒɪnˈɛks/」上で稼働しています。

補足として、言語学の学位を持たない方には、IPAコンバーターを使うと、自然言語で入力した内容からスクリプトに貼り付ける正しいIPAを取得しやすくなります。

SSML音素タグがEleven v4で使えない理由

Eleven v4はSSMLに対応していません。その代わりに、Audio Tagsや発音辞書など、最終的なオーディオ制作をより細かくコントロールできる柔軟な機能を提供しています。

SSMLの各機能には、v4で直接対応する代替機能があります:

SSMLタグ

機能

Eleven v4での代替手段

<phoneme>

発音表記を設定

インラインIPA(/…/)または辞書の音素ルール

<sub alias>

発話前にテキストを置き換え

辞書のエイリアスルール

<break>

一時停止を追加

[pause]のようなAudio Tags、三点リーダー、または改行

<prosody rate>

話す速度を変更

[slowly]や[rushed]のようなペーシング用Audio Tags

<emphasis>

単語を強調

大文字または話し方を指定するAudio Tag

Eleven v4で自然なテキスト読み上げの発音を始める

Eleven v4には発音精度を高めるためのさまざまなツールがあるため、詳細なスクリプトを書き、イメージどおりにモデルに読み上げさせることができます。

ElevenLabsのテキスト読み上げアプリで発音辞書を作成し、ElevenAPIで大規模に適用できます。

登録して始めるか、Eleven v4の詳細をご覧ください。

よくある質問

  1. Artificial Analysis、Provider Voice Arena Preference Elo、2026年9月30日

関連記事

最高品質のAIオーディオで創造する