テキスト読み上げ

ElevenLabsでテキストを音声に変換する方法のガイド

概要

ElevenLabsのテキスト読み上げ技術は、提供するサービスの中核を担い、世界中のさまざまなアプリケーションで高品質なAI生成音声を実現しています。すでに、自然なオーディオ体験を提供する音声を耳にしたことがあるかもしれません。

テキスト読み上げを使った最初のオーディオ生成はとても簡単です。ただし、この機能を最大限に活用するために、いくつか覚えておくべき点があります。

ガイド

テキスト読み上げのデモ

1

テキスト入力

テキスト読み上げページの入力ボックスにテキストを入力または貼り付けます。

2

音声を選択

画面左下の「音声」から使用する音声を選択します。

3

設定を調整(任意)

目的の出力に合わせて音声設定を変更します。
4

生成

「生成」ボタンをクリックしてオーディオファイルを作成します。

設定

高品質な音声を作成するための音声、モデル、設定を確認しましょう。

使用する設定、特に音声とモデルは出力に大きく影響します。これらに慣れ、ベストプラクティスを理解することは非常に重要です。ほかの設定も出力に影響しますが、選択する音声やモデルほど大きな影響はありません。

重要度の順序は次のとおりです。最も重要なのは音声の選択で、次にモデルの選択、そしてモデルの設定が続きます。これらすべてとその組み合わせが、出力に影響します。

音声

テキスト読み上げの音声
選択

厳選されたデフォルト音声、ほぼあらゆる音声を想像できるほど豊富なボイスライブラリ w、ボイスデザインツールで作成した完全合成音声、そして2つの技術であるインスタントボイスクローンとプロフェッショナルボイスクローンを使用して作成できる独自のクローン音声コレクションなど、多様な音声を提供しています。

すべての音声が同じ品質ではなく、作成に使用された元のオーディオに大きく左右されます。より人間らしいパフォーマンスや話し方を実現する音声もあれば、より安定した音声もあります。

**コンテンツに適した音声を選ぶことが重要です。**これは、最終的な出力に最も大きな影響を与える、最も重要な決定となる可能性があります。性別、トーン、アクセント、リズム、話し方を決定します。最適な音声を選び、一貫性があり期待に応えることを確認するために、十分な時間をかけてテストする価値があります。

特定の言語で音声を生成する場合は、ボイスライブラリのネイティブ音声を使うか、その言語を正しいアクセントで話す音声をクローンすると、最良の結果が得られます。技術的にはどの音声でもどの言語も話せますが、元のアクセントは保持されます。たとえば、ネイティブの英語音声でフランス語の音声を生成した場合、AIは学習していない言語でその音声がどのように聞こえるかを一般化する必要があるため、出力はフランス語でも英語アクセントになる可能性が高くなります。

音声について詳しく見る

気に入った音声があるものの話し方を変えたい場合は、ボイスリミキシングツールが役立ちます。自然言語のプロンプトを使って、音声の話し方、リズム、トーン、性別、さらにはアクセントまで変更できます。アクセントを変更する場合は、ベースとなる音声と対象アクセントが非常に重要です。結果はさまざまで、完璧に機能する場合もあれば、うまくいくまで数回試す必要がある場合もあります。

ボイスリミキシングでは非常に良い結果が得られることもありますが、通常は適切にクローンしたプロフェッショナルボイスクローンほどの品質にはなりません。インスタントボイスクローンに近い品質になります。

ボイスリミキシングは特定の音声でのみ機能する点にご注意ください。たとえば、ボイスライブラリの音声はリミックスできず、自分で作成した音声またはデフォルト音声のみリミックスできます。

モデル

テキスト読み上げのモデル
選択

モデルには、Standard(高品質)モデルと、極めて低いレイテンシー向けに最適化されたFlashモデルの2つのファミリーがあります。ほとんどのファミリーには、英語専用版と多言語版の両方があります。

Eleven v3モデルは現在、標準の多言語版のみ提供されています。

モデルの選択は、音声の選択に次いで最終的なオーディオ出力に大きく影響します。選んだ音声でさまざまなモデルを試し、最適な組み合わせを見つけることをおすすめします。すべてのモデルには長所と短所があり、相性のよい音声も異なるため、適切な組み合わせを見つけることが重要です。

出力が英語のみの場合は、英語専用モデルのいずれかを強くおすすめします。これらは多くの場合扱いやすく、より安定しており、英語専用コンテンツで全般的に優れたパフォーマンスを提供します。コンテンツがほかの言語の場合、または多言語になる可能性がある場合は、多言語モデルのいずれかを使用する必要があります。

モデルについて詳しく見る

音声設定

テキスト読み上げの音声
設定

一般的には、安定性を50前後、類似性を75前後、スタイルを0に設定し、その後の変更は最小限に抑えます。もちろん、これはすべて元の音声と目指すパフォーマンスのスタイルによって異なります。

AIは非決定的であるため、スライダーを特定の値に設定しても毎回同じ結果が保証されるわけではない点に注意してください。スライダーはむしろ範囲として機能し、生成ごとにどの程度のランダム性を許容するかを決定します。

速度

速度設定では、生成される音声の速度を速くしたり遅くしたりできます。デフォルト値は1.0で、速度は調整されません。1.0未満の値では音声が遅くなり、最小値は0.7です。1.0を超える値では音声が速くなり、最大値は1.2です。極端な値は、生成される音声の品質に影響する可能性があります。

Eleven v3モデルでは速度を利用できません。

安定性

安定性スライダーは、音声の安定性と生成ごとのランダム性を決定します。このスライダーを下げると、音声の感情表現の幅が広がります。前述のとおり、これは元の音声からも大きな影響を受けます。スライダーを低くしすぎると、過度にランダムな不自然なパフォーマンスになり、キャラクターが速すぎる速度で話す可能性があります。一方、高くしすぎると、感情表現が限られた単調な音声になる可能性があります。

より生き生きとしたドラマチックなパフォーマンスにするには、安定性スライダーを低めに設定し、気に入ったパフォーマンスが見つかるまで数回生成することをおすすめします。

一方、より真剣なパフォーマンスが必要な場合、非常に高い値では単調に近くなりますが、安定性スライダーを高めに設定することをおすすめします。一貫性と安定性が高いため、通常は目的の結果を得るために多くのサンプルを生成する必要はありません。最適な設定を見つけるために試してみてください。

類似性

類似性スライダーは、AIが元の音声を再現しようとする際に、どの程度忠実に元の音声に従うかを決定します。元のオーディオの品質が低く、類似性スライダーが高すぎる場合、元の録音にアーティファクトやバックグラウンドノイズが含まれていると、AIが音声を模倣しようとしてそれらも再現する可能性があります。

Eleven v3モデルでは類似性を利用できません。

スタイルの誇張

新しいモデルの導入に伴い、スタイルの誇張設定も追加しました。この設定は、元の話者のスタイルを強調しようとします。追加の計算リソースを消費し、0以外に設定するとレイテンシーが増加する可能性があります。この設定を使用すると、元の音声のスタイルを強調・模倣しようとするため、モデルの安定性がやや低下することが確認されています。

一般的には、この設定は常に0のままにすることをおすすめします。

話者ブースト

この設定は、元の話者との類似性を高めます。ただし、この設定を使用すると計算負荷がやや高くなり、その結果レイテンシーが増加します。この設定による差異は、一般的にかなり微妙です。

Eleven v3モデルでは話者ブーストを利用できません。

生成

音声を選択し、モデルを選び、設定を構成したら、生成プロセスはシンプルです。テキストを入力して「音声を生成」を押すと、オーディオが生成されます。

手順自体は非常に簡単ですが、目的の出力を得るには入力するテキストが極めて重要です。珍しい名前、一般的でない略語、記号、絵文字など、AIがトレーニング中にほとんど見たことがない「分布外」の単語を使用すると、AIが混乱して出力が不安定になるおそれがあります。特に絵文字や一部の記号は、AIが正しく解釈するのが困難です。

UIでテキスト読み上げを使用する場合、テキストの読みやすさを高め、AIが処理しやすくするために、入力内容に自動正規化のステップを実行します。通常、このステップでは記号や数字を文章として書き出したテキストに変換し、AIが正しく発音できるようにします。

特に多言語モデルを使用する場合(英語専用モデルにも当てはまります)は、数字を桁で書いたり記号を使ったりしないことを強くおすすめします。数字や記号は多くの言語で同じように表記される一方、発音は異なるため、桁表記に頼るとAIにとって曖昧になります。たとえば数字の「1」は、英語やほかの多くの言語で同じように書かれますが、発音は異なります。「one」のように数字をテキストで書き出すと、AIが何をすべきかを解釈する必要がなくなります。

現在、オーディオタグと呼ばれる機能を使ってAIの話し方やパフォーマンスに影響を与えられる、より高度なワークフローを開発しています。この機能はEleven v3モデルで利用できます。詳しくは、Eleven v3ドキュメントをご覧ください。

よくある質問

最初の、そして最も重要な要素の一つは、良質で一貫性のある入力が、良質で一貫性のある出力につながることです。

たとえば、ノイズが多い音声、明瞭な音声にリバーブがかかっているもの、複数の話者がいるもの、音量やパフォーマンス、話し方にばらつきがあるものなど、理想的とは言えないオーディオをAIに提供すると、AIは不安定になり、出力も予測しにくくなります。

自分の声をクローンする予定がある場合は、適切なボイスクローンを作成するためのドキュメントのガイドラインを確認することを強くおすすめします。これにより、最良の土台から始められます。インスタントボイスクローンのみを使用する場合でも、プロフェッショナルボイスクローンのセクションも読むことをおすすめします。これら二つの技術では要件が多少異なりますが、このセクションにはボイスクローンの作成に役立つ情報が含まれています。

次に考慮すべき要素は、選択する声が出力に大きな影響を与えることです。最初の要素で述べたように、そのクローンの作成に使われたサンプルの品質と一貫性は非常に重要です。また、声の言語やトーンも重要です。

明るく楽しそうな声が必要なら、そのようなサンプルでクローンされた声を使うべきです。逆に、内省的で陰鬱な声が必要なら、その特徴を持つ声を選んでください。

ただし、適切な言語でトレーニングされた声を使うことも重要です。たとえば、デフォルトの声として提供しているプロフェッショナルボイスクローンはすべて英語の声であり、英語のサンプルでトレーニングされています。そのため、別の言語を話させた場合、その言語でのパフォーマンスは予測しにくくなることがあります。AIに話させたい言語を話しているサンプルからクローンされた声を使用することが不可欠です。

少し些細に思えるかもしれませんが、大きな違いを生むことがあります。AIは、使われている単語だけでなく、単語の組み合わせ方、句読点の使い方、文法、テキスト全体の形式など、テキスト自体の文脈に基づいて読み方を理解しようとします。

これはAIの話し方に小さいながらも大きな影響を与えることがあります。単語のスペルを間違えても、AIは修正せず、書かれたとおりに読もうとします。

AIの設定は非決定的です。つまり、同じ初期条件(声、設定、モデル)でも、ボイスアクターが毎回少し異なる演技をするのと同様に、出力はわずかに異なります。

この変動は、前述の声、設定、モデルなど、さまざまな要因によって生じます。一般に、変動の幅は安定性スライダーで制御できます。安定性を低く設定すると、生成間の変動幅は広がりますが、世代間の変動も生じ、AIのパフォーマンスはより表現豊かになる場合があります。

安定性を高く設定しすぎると、AIがより変化に富んだコンテンツを生成する余地が減り、特定の声が単調に聞こえることがあるため、変動幅を広くすることが望ましい場合もあります。ただし、安定性を低くしすぎると、特にクローン作成プロセスで理想的ではないオーディオが使われた可能性のある声では、生成が不安定になるなど、別の問題が発生することもあります。

デフォルト設定の50は、ほとんどの用途で優れた開始点です。

Eleven v3は、最新かつ最も表現力豊かなテキスト読み上げモデルで、次の特長があります。

  • より人間らしく、全体的に高品質な生成
  • オーディオタグのサポート
    • 感情:[sad] [angry] [happily]
    • 話し方の指示:[whispers] [shouts]
    • 非言語的な反応:[laughs] [clears throat] [sighs]
  • 複数話者による自然な音声をサポートするDialogueモード
  • 70以上の言語に対応

驚くほど優れた出力を生成できますが、一貫性にばらつきがありレイテンシーも高いため、リアルタイムまたは会話型のユースケースには適していません。これらの用途には、Flash v2(英語)またはv2.5(Multilingual)をおすすめします。現在、Eleven v3のリアルタイム版を開発中です。

APIでは、Create speechおよびStream speechエンドポイントでモデルID eleven_v3を指定すると、v3を使用して生成できます。

Create dialogueおよびStream dialogueエンドポイントを使用して、複数話者による自然なダイアログを作成することもできます。

詳細は以下のリソースをご覧ください。

音声速度の調整は、音声合成、Studio、ElevenAgents、APIを介したテキスト読み上げで利用できます。

Speed設定で音声の速度を調整できます。

設定可能な値は0.7~1.2です。1未満の値では音声が遅くなり、1を超える値では速くなります。極端な値を設定すると、生成される音声の品質に影響する場合があります。 

この設定は、すべての音声とすべてのモデルで利用できます。音声設定から確認できます。

API使用時の音声制御については、APIリファレンスをご覧ください。

どの音声でも、対応しているすべての言語を話すことができます。

現在のモデルでは、特定の言語を選択するのではなく、AIに話させたい言語で入力します。AIが自動的に理解します。ただし、異なる言語間では、似た単語や語彙を使用していても発音やアクセントが大きく異なる場合があります。そのため、正しいアクセントの言語を話している音声を使ってクローンした音声を使用してください。

言語はテキストによって決まり、アクセントと発音は音声自体によって決まります。最適に機能するには、両方のコンテキストが必要です。

言語選択を容易にする新技術の開発を進めていますが、AIの構造上、すべてはまだ開発中です。

生成したファイルは、次の2つの方法でダウンロードできます:

コンテンツを生成した直後に、右下のダウンロードボタンをクリックしてダウンロードできます。

以前に生成したファイルは、履歴からダウンロードできます。 

履歴にアクセスするには、アカウントにログインし、サイドバーでテキスト読み上げを選択します。次に、画面右側のパネルにある履歴タブをクリックします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3(128kbps)またはWAVファイルとしてダウンロードするオプションが表示されます。 

Advancedをクリックすると、追加のファイル形式でダウンロードすることもできます:

  • MP3(192kbps)
  • MP3(256kbps)
  • M4A
  • FLAC

はい。Eleven v3では、[sighs]や[exhales]などのオーディオタグを使用して、生成される音声に呼吸音や同様の反応を追加できます。

オーディオタグとデリバリー制御の詳細については、Eleven v3プロンプトガイドをご覧ください。

FlashおよびTurboモデルは、低レイテンシーのアプリケーション向けに特別に開発されています。

Flash v2とFlash v2.5は、75ms未満でオーディオを生成する超低レイテンシーモデルです。Flash v2は英語のみ対応し、Flash v2.5は32言語に対応しています。対応言語の一覧は こちらをご覧ください。

Turboモデルも低レイテンシーですが、Flashモデルは非常によく似た結果を提供するため、TurboよりFlashモデルの使用をおすすめします。Turbo v2は英語のみ対応し、Turbo v2.5は32言語に対応しています。また、Turbo v2より25%高速で、約300msでオーディオを生成します。

FlashとTurboはいずれも高度に最適化されたモデルで、モデルに期待される品質基準を維持しながら、音声品質を損なうことなく低レイテンシーアプリケーション向けに特別に設計されています。

どちらのモデルも、API経由で生成すると割引が適用されます。詳細はAPI料金をご覧ください。

カスタマイズされたインタラクティブな音声エージェントを展開するプラットフォーム、ElevenAgentsも提供しています。詳しくはElevenAgentsのドキュメントをご覧ください。

ポーズや間を加え、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。

オーディオタグ(Eleven v3のみ)

Eleven v3では、オーディオタグと句読点を使って話すペースや話し方を制御します。Eleven v3はSSMLのbreakタグには対応していません。

v3でポーズや話し方を指示する方法については、Eleven v3プロンプトガイドをご覧ください。

Breakタグ(Multilingual v2、Flash v2、Flash v2.5)

Multilingual v2、Flash v2、Flash v2.5でポーズを追加する最も一貫した方法は、SSMLのbreakタグ構文<break time="1.5s" />を使用することです。これにより、発話に正確で自然なポーズが生まれます。単に単語の間に無音を挿入するだけではありません。モデルが構文を理解し、自然なポーズを加えます。

これらのポーズの処理方法は、モデルによって異なる場合があります。使用する音声が出力に重要な役割を果たします。「えー」や「あー」が含まれるデータで学習した音声は、実際の話者のように、ポーズ中にそうした発声の癖を挿入することがあります。

たとえば、次のようになります:

「少し考えさせてください。」<break time="1.0s" />「はい、それで大丈夫です。」

breakの時間は秒単位で指定してください。AIは最大3秒のポーズを処理でき、テキスト読み上げとAPIで使用できます。

テキスト内でSSMLのbreakを過度に使用すると、問題が発生する場合があります。発話速度が速くなったり、オーディオにノイズなどのアーティファクトが増えたりすることがあります。この問題は解決に取り組んでいます。

句読点

これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、話すペースに影響を与えることはできます。

単純なハイフン-やダッシュ—は、よく機能します。より長いポーズには、-- --のように複数のハイフンを追加できます。

「もう - 遅く - なってきました。」

省略記号...は単語の間にポーズを加えることがありますが、通常は声にためらいや緊張感も加わるため、常に適しているとは限りません。

「私…うん、そうだと思う…」

Eleven v3は国際音声記号(IPA)をネイティブでサポートしています。詳しくはEleven v3でのIPAをご覧ください。

SSML phonemeタグ(Flash v2およびTurbo v2のみ)

Flash v2およびTurbo v2では、SSML phonemeタグを使用して特定の発音を指定できます。IPAとCMUの両方をサポートしています。現在の実装では、CMUのほうがやや予測しやすく、一貫性があります。詳しくは発音ガイドをご覧ください。

代替スペル

別の方法として、代替スペルを見つけ、単語をより発音に近い形で記述する方法があります。大文字、ハイフン、アポストロフィ、あるいは単一の文字や複数の文字をシングルクォーテーションで囲むなど、さまざまな工夫ができます。

たとえば、「trapezii」のような単語は、「ii」をより強調するために「trapezIi」と表記できます。

Eleven v3はオーディオタグに対応しており、生成するオーディオをこれまでにないほど細かく制御できます:

  • 感情:[curious] [crying] [mischievously]
  • 話し方の指示:[whispers] [shouts]
  • 人間らしい反応:[laughs] [clears throat] [sighs]

詳しくは、Eleven v3のプロンプトガイドをご覧ください。

モデルIDにeleven_v3を指定すると、Create speechおよびStream speechエンドポイントを使用して、API経由でv3による生成を行えます。

また、Create dialogueおよびStream dialogueエンドポイントを使用して、複数の話者による自然な会話を作成することもできます。

詳しくは、以下のリソースをご覧ください:

テキスト読み上げまたはボイスチェンジャーで生成したファイルは、MP3、WAV、M4A、FLACファイルとしてダウンロードできます。WAV、M4A、FLACファイルは履歴からダウンロードする必要があります。   

WAVファイルをダウンロードする方法

サイドバーでテキスト読み上げまたはボイスチェンジャーを選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。

FLACまたはM4Aファイルをダウンロードする方法

サイドバーでテキスト読み上げまたはボイスチェンジャーを選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。FLACやM4Aを含む追加のファイル形式にアクセスするには、Advancedをクリックして希望の形式を選択してください。

ウェブサイトで生成する場合の言語

ElevenLabsのウェブサイトでオーディオを生成する場合、AIはプロンプト内のテキストの文脈に基づいて言語を自動的に検出します。そのため、1つのプロンプトで複数の言語を使用することは避けるのが最適です。どの言語を使用すべきか混乱する可能性があります。現在、ウェブサイトで生成する際に言語を指定することはできません。 

API経由で生成する場合の言語

APIを通じてオーディオを生成する場合は、language_codeパラメータを使用してプロンプトの言語を手動で指定できます。これはISO 639-1言語コードを受け取る任意のパラメータです。 

これは、テキストに数字しか含まれていない場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定することで、正規化機能がその言語に適したルールを適用できます。

正規化について詳しくは、こちらの記事をご覧ください。

アクセント

生成で使用されるアクセントは、使用する音声に由来します。生成する言語で学習していない音声を使用すると、その音声の元の言語のアクセントがわずかに出ることがあります。

最適な結果を得るには、生成する言語のオーディオで学習され、希望するアクセントを持つ音声を使用することをおすすめします。これにより、AIは発音とイントネーションをより正確に理解できます。

これは、似ている言語や共通する単語が多い言語では特に重要です。正しい言語で学習された音声を選ぶことで、AIが正しい発音とアクセントを使用できるようになります。

次のことができます:

  • 希望する言語とアクセントのオーディオを使用して、クローン音声を作成する。
  • ボイスライブラリを閲覧する。検索フィルターを使用して、ニーズに合った適切な音声を見つけられます。

Eleven v3での生成コストは、ウェブサイトでは1文字あたり1クレジットです。APIでの生成には割引が適用されます。詳細はAPI料金をご覧ください。 

詳しくは、以下のリソースをご覧ください:

Eleven v3では、[laughs]などのオーディオタグを使用して、生成する発話に笑い声やその他の反応を追加できます。詳しくはEleven v3プロンプトガイドをご覧ください。

その他のモデルでは、感情表現は文脈、句読点、音声設定に左右されます。感情を表現するには?をご覧ください。

モデルは各発話を取り巻く広い状況に敏感で、前後のテキストとのつながりから内容に意味があるかを判断します。この俯瞰的な視点により、複数の文にまたがる一連の思考に統一された感情パターンを重ね、長いフレーズにも適切なイントネーションを付けられます。

感情を表現するためのヒント:

  • 特定の感情を生成するには、文脈が重要です。笑いやユーモアのあるテキストを入力すると、明るい出力になることがあります。怒り、悲しみ、その他の感情についても同様で、文脈を設定することが重要です。
  • 出力の話し方には、句読点と音声設定が最も大きく影響します。
  • 関連する単語やフレーズを引用符で囲むと、強調できます。
  • クローン音声で生成した発話では、クローン用にアップロードしたサンプルの話し方が出力にも反映されます。アップロードしたサンプルの発話が単調な場合、モデルは表現力豊かな出力を生成しにくくなります。

Eleven v3では、オーディオタグを使用して、感情や話し方をより直接的に制御することもできます。たとえば、[happy]、[sad]、[angry]、[whispers]、[laughs]が使用できます。詳しくはEleven v3プロンプトガイドをご覧ください。

これらのヒントは感情的な話し方を導くのに役立ちますが、特定の結果を保証するものではありません。

残念ながら現時点では、生成時のクォータ消費に代わる、ダウンロード時の消費は提供していません。クォータを消費せずに生成結果をプレビューする方法は現在ありません。

ウェブサイトで「生成」を押すと、サーバーの起動とオーディオの生成が必要になるため、クレジットが消費されます。クレジットを使わずに、自分のテキストで音声をテストまたはプレビューすることはできません。

ウェブサイトのテキスト読み上げでは、以下の条件を満たす場合に2回まで無料で再生成できます。

  • プロンプト(テキスト読み上げの場合)またはファイル(ボイスチェンジャーの場合)、音声、モデルが同一であること。音声設定のスライダーは変更できます。
  • 最初の生成から2時間以内であること。
  • 元のオーディオを生成してからページを更新していないこと。

この場合、「音声を再生成」と表示されます。「音声を再生成」ボタンにカーソルを合わせると、残りの無料再生成回数が表示されます。

無料再生成を使い切ると、ボタンは「音声を生成」に戻り、生成に使用されるクレジット数が表示されます。

無料再生成は、ウェブサイトのテキスト読み上げでのみ利用できます。APIでは利用できません。

価格やコストを上げずに、この品質でプレビューを実現する方法を検討しています。また、AIの制御性を高め、プレビューなしでも、できれば最初の試行で期待どおりの結果を得られるようにする方法も模索しています。

Eleven v3にはDialogueモードがあり、会話の文脈に応じて、自然なテンポで割り込み、口調の変化、感情的な合図を処理する、動的な複数話者の会話を生成できます。

Dialogueモードは、ウェブサイトで複数の話者を使用する場合に利用できます。 

複数話者のやり取りを生成するための新しいテキストtoダイアログAPIエンドポイントも用意しています。詳細はAPIドキュメントをご覧ください。

詳細は以下のリソースをご覧ください。

どの音声でも、AIが現在サポートしているすべての言語を話せます。ただし、AIに話させたい言語を母語とする音声を使用しない場合、たとえば生成された音声や英語を話す音声からクローンした音声を使用すると、わずかに英語アクセントが出たり、類似した言語の間を行き来したりすることがあります。

サポートされているすべての言語の一覧については、こちらの記事をご覧ください:対応している言語は何ですか?

現在のモデルでは、特定の言語を選択する必要はありません。AIに話させたい言語で文章を書けば、AIが自動的に理解します。ただし、類似した単語や語彙を使いながら発音やアクセントが大きく異なる言語もあるため、正しいアクセントでその言語を話してクローンした音声を使用することをおすすめします。これにより、AIは何をどの言語で話すべきかを判断するための十分な文脈を得られます。

言語はテキストによって決まり、アクセントと発音は音声そのものによって決まります。

言語選択を可能にする新技術を開発中ですが、AIの仕組み上、現時点ではまだ開発途上です。

ウェブサイトのテキスト読み上げでは、有料プランなら1回の生成で最大5,000文字、無料プランなら最大2,500文字を生成できます。

ただし、数千文字を超える長文コンテンツを生成する場合は、書籍や小説などの非常に長いコンテンツを簡単に生成できるStudioの使用を強くおすすめします。詳細はこちらをご覧ください。

APIで生成する場合、入力の最大長は使用するモデルによって異なります。

テキスト読み上げ

Flash v2.5 - 最大40,000文字(約40分のオーディオ)

Turbo v2.5 - 最大40,000文字(約40分のオーディオ)

Flash v2 - 最大30,000文字(約30分のオーディオ)

Turbo v2 - 最大30,000文字(約30分のオーディオ)

Multilingual v2 - 最大10,000文字(約10分のオーディオ)

ボイスチェンジャー

Multilingual v2 - 最大10分のオーディオ

既製の音声と生成された音声はすべて英語です。そのため、他の言語を話す際には、正しいアクセントや発音にならない場合があります。

ボイスライブラリのプロフェッショナルカテゴリでは、コミュニティが共有した音声を見つけられます。これらは、それぞれの話者自身の音声をプロフェッショナルボイスクローンしたものです。通常、クローン作成時に話していた言語を示す言語タグが付いているため、その言語のネイティブ音声です。特定の言語で絞り込むには、言語検索フィルターも使用できます。

数字、日付、記号、頭字語は、正しく読み上げる方法が複数あることが多いため、AIにとって難しい場合があります。これは使用されている言語にも依存します。たとえば「11」は「Eleven」と読めますが、スペイン語では「Once」、ドイツ語では「Elf」と読むこともできます。  

数字、日付、頭字語、記号を正しく読み上げるための方法はいくつかあります。

単語で完全に書く

最良の結果を得るには、数字、頭字語、日付、記号を、AIに読み上げてほしい形式で完全に単語として書くことをおすすめします。これによりAIは十分な文脈を得られ、正しい出力を提供できます。たとえば「$100」の場合、期待どおりの結果を得るために、「a hundred dollars」または「one hundred dollars」と書くことをおすすめします。  

LLMの使用

たとえばElevenAgentsを使用する際など、大規模言語モデルでテキストプロンプトを生成している場合は、AIに読み上げてほしい形式で、数字、日付、記号、頭字語を常に単語として書くようモデルにプロンプトで指示できます。

正規化

API経由で生成する場合は、apply_text_normalizationパラメーターを使用してテキスト正規化を適用するかどうかを指定できます。テキスト正規化では、より正確に発音できるよう数字や日付を単語に展開します。このオプションでは、正規化処理に追加の処理時間が必要になるため、レイテンシーが増加します。

apply_text_normalizationパラメーターには3つのモードがあります。

  • on:常に適用されます
  • off:適用されません
  • auto:AIがテキスト正規化を適用するタイミングを自動的に判断します

language_codeパラメーターを使用して、プロンプトの言語を指定することもできます。これはISO 639-1言語コードを受け付けるオプションのパラメーターです。 

これは、テキストに数字や記号のみが含まれる場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定すると、正規化機能がその言語に適したルールを適用できます。

詳細は、APIリファレンスをご覧ください。

ウェブサイトのテキスト読み上げで生成する場合、正規化はデフォルトで有効になっています。  

Studioでは、デフォルトで正規化が自動適用されます。つまり、AIがテキスト正規化を適用するタイミングを判断します。正規化を常に適用する設定も可能です。このオプションは、詳細設定タブのプロジェクト設定にあります。

誤発音にはいくつかの原因があります。最も一般的なのは、単語のスペルミスです。AIはスペルミスのある単語を修正しようとはせず、書かれたとおりに読み上げようとします。そのため、AIに読み上げさせる前に、テキストを校正し、完成していることを必ず再確認することが重要です。

特定の発音を指定したい場合は、Flash v2モデルでSSML音素タグを使用できます。詳細は発音ガイドをご覧ください。

AIが予期しない単語を誤発音したり、期待とは異なるアクセントで話したりすることがあります。これにはいくつかの理由があり、多くの場合、使用する音声と言語に大きく依存します。正しいアクセントと発音を確保する最善の方法は、正しいアクセントと発音で話す音声をクローンすることです。これにより、AIはオーディオ生成時に最も多くの文脈を得られます。

言語はテキストで指定され、アクセントは音声で指定されます。そのため、多くの共通単語を共有する言語や、別の言語とかなり近い関係にある言語で書いている場合、AIが特定の単語の発音を理解したり、アクセントを切り替えたりするのが難しいことがあります。

ただし、特定の状況では、英語であっても正しく書かれた単語をAIが誤発音することがあります。これは使用する音声とテキストに大きく依存するようですが、まれなケースです。

No results