良い入力が良い出力につながる 最初の、そして最も重要な要素の一つは、良質で一貫性のある入力が、良質で一貫性のある出力につながることです。
たとえば、ノイズが多い音声、明瞭な音声にリバーブがかかっているもの、複数の話者がいるもの、音量やパフォーマンス、話し方にばらつきがあるものなど、理想的とは言えないオーディオをAIに提供すると、AIは不安定になり、出力も予測しにくくなります。
自分の声をクローンする予定がある場合は、適切なボイスクローンを作成するためのドキュメントのガイドラインを確認することを強くおすすめします。これにより、最良の土台から始められます。インスタントボイスクローンのみを使用する場合でも、プロフェッショナルボイスクローンのセクションも読むことをおすすめします。これら二つの技術では要件が多少異なりますが、このセクションにはボイスクローンの作成に役立つ情報が含まれています。
適切な声を使う 次に考慮すべき要素は、選択する声が出力に大きな影響を与えることです。最初の要素で述べたように、そのクローンの作成に使われたサンプルの品質と一貫性は非常に重要です。また、声の言語やトーンも重要です。
明るく楽しそうな声が必要なら、そのようなサンプルでクローンされた声を使うべきです。逆に、内省的で陰鬱な声が必要なら、その特徴を持つ声を選んでください。
ただし、適切な言語でトレーニングされた声を使うことも重要です。たとえば、デフォルトの声として提供しているプロフェッショナルボイスクローンはすべて英語の声であり、英語のサンプルでトレーニングされています。そのため、別の言語を話させた場合、その言語でのパフォーマンスは予測しにくくなることがあります。AIに話させたい言語を話しているサンプルからクローンされた声を使用することが不可欠です。
適切な形式を使う 少し些細に思えるかもしれませんが、大きな違いを生むことがあります。AIは、使われている単語だけでなく、単語の組み合わせ方、句読点の使い方、文法、テキスト全体の形式など、テキスト自体の文脈に基づいて読み方を理解しようとします。
これはAIの話し方に小さいながらも大きな影響を与えることがあります。単語のスペルを間違えても、AIは修正せず、書かれたとおりに読もうとします。
非決定的 AIの設定は非決定的です。つまり、同じ初期条件(声、設定、モデル)でも、ボイスアクターが毎回少し異なる演技をするのと同様に、出力はわずかに異なります。
この変動は、前述の声、設定、モデルなど、さまざまな要因によって生じます。一般に、変動の幅は安定性スライダーで制御できます。安定性を低く設定すると、生成間の変動幅は広がりますが、世代間の変動も生じ、AIのパフォーマンスはより表現豊かになる場合があります。
安定性を高く設定しすぎると、AIがより変化に富んだコンテンツを生成する余地が減り、特定の声が単調に聞こえることがあるため、変動幅を広くすることが望ましい場合もあります。ただし、安定性を低くしすぎると、特にクローン作成プロセスで理想的ではないオーディオが使われた可能性のある声では、生成が不安定になるなど、別の問題が発生することもあります。
デフォルト設定の50は、ほとんどの用途で優れた開始点です。
Eleven v3(Alpha)とは? Eleven v3は、最新かつ最も表現力豊かなテキスト読み上げモデルで、次の特長があります。
より人間らしく、全体的に高品質な生成
オーディオタグのサポート
感情:[sad] [angry] [happily]
話し方の指示:[whispers] [shouts]
非言語的な反応:[laughs] [clears throat] [sighs]
複数話者による自然な音声をサポートするDialogueモード
70以上の言語に対応
驚くほど優れた出力を生成できますが、一貫性にばらつきがありレイテンシーも高いため、リアルタイムまたは会話型のユースケースには適していません。これらの用途には、Flash v2(英語)またはv2.5(Multilingual)をおすすめします。現在、Eleven v3のリアルタイム版を開発中です。
APIでは、Create speech およびStream speech エンドポイントでモデルID eleven_v3を指定すると、v3を使用して生成できます。
Create dialogue およびStream dialogue エンドポイントを使用して、複数話者による自然なダイアログを作成することもできます。
詳細は以下のリソースをご覧ください。
声の速さは変更できますか? 音声速度の調整は、音声合成、Studio、ElevenAgents、APIを介したテキスト読み上げで利用できます。
Speed設定で音声の速度を調整できます。
設定可能な値は0.7~1.2です。1未満の値では音声が遅くなり、1を超える値では速くなります。極端な値を設定すると、生成される音声の品質に影響する場合があります。
この設定は、すべての音声とすべてのモデルで利用できます。音声設定から確認できます。
API使用時の音声制御については、APIリファレンス をご覧ください。
同じクローン/デザインされた声を複数の言語で使用できますか? どの音声でも、対応しているすべての言語を話すことができます。
現在のモデルでは、特定の言語を選択するのではなく、AIに話させたい言語で入力します。AIが自動的に理解します。ただし、異なる言語間では、似た単語や語彙を使用していても発音やアクセントが大きく異なる場合があります。そのため、正しいアクセントの言語を話している音声を使ってクローンした音声を使用してください。
言語はテキストによって決まり、アクセントと発音は音声自体によって決まります。最適に機能するには、両方のコンテキストが必要です。
言語選択を容易にする新技術の開発を進めていますが、AIの構造上、すべてはまだ開発中です。
テキスト読み上げで生成したファイルをダウンロードするには? 生成したファイルは、次の2つの方法でダウンロードできます:
コンテンツを生成した直後に、右下のダウンロードボタンをクリックしてダウンロードできます。
以前に生成したファイルは、履歴からダウンロードできます。
履歴にアクセスするには、アカウントにログインし、サイドバーでテキスト読み上げ を選択します。次に、画面右側のパネルにある履歴タブをクリックします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3(128kbps)またはWAVファイルとしてダウンロードするオプションが表示されます。
Advanced をクリックすると、追加のファイル形式でダウンロードすることもできます:
MP3(192kbps)
MP3(256kbps)
M4A
FLAC
声で呼吸音を出すことはできますか? はい。Eleven v3では、[sighs]や[exhales]などのオーディオタグを使用して、生成される音声に呼吸音や同様の反応を追加できます。
オーディオタグとデリバリー制御の詳細については、Eleven v3プロンプトガイド をご覧ください。
会話やチャットボット向けのAIモデルはありますか? FlashおよびTurboモデルは、低レイテンシーのアプリケーション向けに特別に開発されています。
Flash v2とFlash v2.5は、75ms未満でオーディオを生成する超低レイテンシーモデルです。Flash v2は英語のみ対応し、Flash v2.5は32言語に対応しています。対応言語の一覧は
こちら をご覧ください。
Turboモデルも低レイテンシーですが、Flashモデルは非常によく似た結果を提供するため、TurboよりFlashモデルの使用をおすすめします。Turbo v2は英語のみ対応し、Turbo v2.5は32言語に対応しています。また、Turbo v2より25%高速で、約300msでオーディオを生成します。
FlashとTurboはいずれも高度に最適化されたモデルで、モデルに期待される品質基準を維持しながら、音声品質を損なうことなく低レイテンシーアプリケーション向けに特別に設計されています。
どちらのモデルも、API経由で生成すると割引が適用されます。詳細はAPI料金をご覧ください。
カスタマイズされたインタラクティブな音声エージェントを展開するプラットフォーム、ElevenAgentsも提供しています。詳しくはElevenAgentsのドキュメントをご覧ください。
間を追加するには? ポーズや間を加え、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。
オーディオタグ(Eleven v3のみ) Eleven v3では、オーディオタグと句読点を使って話すペースや話し方を制御します。Eleven v3はSSMLのbreakタグには対応していません。
v3でポーズや話し方を指示する方法については、Eleven v3プロンプトガイド をご覧ください。
Breakタグ(Multilingual v2、Flash v2、Flash v2.5) Multilingual v2、Flash v2、Flash v2.5でポーズを追加する最も一貫した方法は、SSMLのbreakタグ構文<break time="1.5s" />を使用することです。これにより、発話に正確で自然なポーズが生まれます。単に単語の間に無音を挿入するだけではありません。モデルが構文を理解し、自然なポーズを加えます。
これらのポーズの処理方法は、モデルによって異なる場合があります。使用する音声が出力に重要な役割を果たします。「えー」や「あー」が含まれるデータで学習した音声は、実際の話者のように、ポーズ中にそうした発声の癖を挿入することがあります。
たとえば、次のようになります:
「少し考えさせてください。」<break time="1.0s" />「はい、それで大丈夫です。」
breakの時間は秒単位で指定してください。AIは最大3秒のポーズを処理でき、テキスト読み上げとAPIで使用できます。
テキスト内でSSMLのbreakを過度に使用すると、問題が発生する場合があります。発話速度が速くなったり、オーディオにノイズなどのアーティファクトが増えたりすることがあります。この問題は解決に取り組んでいます。
句読点 これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、話すペースに影響を与えることはできます。
単純なハイフン-やダッシュ—は、よく機能します。より長いポーズには、-- --のように複数のハイフンを追加できます。
「もう - 遅く - なってきました。」
省略記号...は単語の間にポーズを加えることがありますが、通常は声にためらいや緊張感も加わるため、常に適しているとは限りません。
「私…うん、そうだと思う…」
単語や名前の発音を指定するには? Eleven v3は国際音声記号(IPA)をネイティブでサポートしています。詳しくはEleven v3でのIPA をご覧ください。
SSML phonemeタグ(Flash v2およびTurbo v2のみ) Flash v2およびTurbo v2では、SSML phonemeタグを使用して特定の発音を指定できます。IPAとCMUの両方をサポートしています。現在の実装では、CMUのほうがやや予測しやすく、一貫性があります。詳しくは発音ガイド をご覧ください。
代替スペル 別の方法として、代替スペルを見つけ、単語をより発音に近い形で記述する方法があります。大文字、ハイフン、アポストロフィ、あるいは単一の文字や複数の文字をシングルクォーテーションで囲むなど、さまざまな工夫ができます。
たとえば、「trapezii」のような単語は、「ii」をより強調するために「trapezIi」と表記できます。
Eleven v3(Alpha)でオーディオタグはどのように機能しますか? Eleven v3はオーディオタグに対応しており、生成するオーディオをこれまでにないほど細かく制御できます:
感情:[curious] [crying] [mischievously]
話し方の指示:[whispers] [shouts]
人間らしい反応:[laughs] [clears throat] [sighs]
詳しくは、Eleven v3のプロンプトガイド をご覧ください。
モデルIDにeleven_v3を指定すると、Create speech およびStream speech エンドポイントを使用して、API経由でv3による生成を行えます。
また、Create dialogue およびStream dialogue エンドポイントを使用して、複数の話者による自然な会話を作成することもできます。
詳しくは、以下のリソースをご覧ください:
WAV、M4A、FLACファイルをダウンロードするには? テキスト読み上げまたはボイスチェンジャーで生成したファイルは、MP3、WAV、M4A、FLACファイルとしてダウンロードできます。WAV、M4A、FLACファイルは履歴からダウンロードする必要があります。
WAVファイルをダウンロードする方法 サイドバーでテキスト読み上げ またはボイスチェンジャー を選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。
FLACまたはM4Aファイルをダウンロードする方法 サイドバーでテキスト読み上げ またはボイスチェンジャー を選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。FLACやM4Aを含む追加のファイル形式にアクセスするには、Advanced をクリックして希望の形式を選択してください。
言語とアクセントを選択するには? ウェブサイトで生成する場合の言語 ElevenLabsのウェブサイトでオーディオを生成する場合、AIはプロンプト内のテキストの文脈に基づいて言語を自動的に検出します。そのため、1つのプロンプトで複数の言語を使用することは避けるのが最適です。どの言語を使用すべきか混乱する可能性があります。現在、ウェブサイトで生成する際に言語を指定することはできません。
API経由で生成する場合の言語 APIを通じてオーディオを生成する場合は、language_codeパラメータを使用してプロンプトの言語を手動で指定できます。これはISO 639-1言語コードを受け取る任意のパラメータです。
これは、テキストに数字しか含まれていない場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定することで、正規化機能がその言語に適したルールを適用できます。
正規化について詳しくは、こちらの記事をご覧ください。
アクセント 生成で使用されるアクセントは、使用する音声に由来します。生成する言語で学習していない音声を使用すると、その音声の元の言語のアクセントがわずかに出ることがあります。
最適な結果を得るには、生成する言語のオーディオで学習され、希望するアクセントを持つ音声を使用することをおすすめします。これにより、AIは発音とイントネーションをより正確に理解できます。
これは、似ている言語や共通する単語が多い言語では特に重要です。正しい言語で学習された音声を選ぶことで、AIが正しい発音とアクセントを使用できるようになります。
次のことができます:
希望する言語とアクセントのオーディオを使用して、クローン音声を作成する 。
ボイスライブラリを閲覧する 。検索フィルターを使用して、ニーズに合った適切な音声を見つけられます。
Eleven v3(Alpha)での生成にはいくらかかりますか? Eleven v3での生成コストは、ウェブサイトでは1文字あたり1クレジットです。APIでの生成には割引が適用されます。詳細はAPI料金 をご覧ください。
詳しくは、以下のリソースをご覧ください:
感情を表現するには? モデルは各発話を取り巻く広い状況に敏感で、前後のテキストとのつながりから内容に意味があるかを判断します。この俯瞰的な視点により、複数の文にまたがる一連の思考に統一された感情パターンを重ね、長いフレーズにも適切なイントネーションを付けられます。
感情を表現するためのヒント:
特定の感情を生成するには、文脈が重要です。笑いやユーモアのあるテキストを入力すると、明るい出力になることがあります。怒り、悲しみ、その他の感情についても同様で、文脈を設定することが重要です。
出力の話し方には、句読点と音声設定が最も大きく影響します。
関連する単語やフレーズを引用符で囲むと、強調できます。
クローン音声で生成した発話では、クローン用にアップロードしたサンプルの話し方が出力にも反映されます。アップロードしたサンプルの発話が単調な場合、モデルは表現力豊かな出力を生成しにくくなります。
Eleven v3では、オーディオタグ を使用して、感情や話し方をより直接的に制御することもできます。たとえば、[happy]、[sad]、[angry]、[whispers]、[laughs]が使用できます。詳しくはEleven v3プロンプトガイド をご覧ください。
これらのヒントは感情的な話し方を導くのに役立ちますが、特定の結果を保証するものではありません。
ダウンロード前にクォータを消費せず、オーディオをプレビューする方法はありますか? 残念ながら現時点では、生成時のクォータ消費に代わる、ダウンロード時の消費は提供していません。クォータを消費せずに生成結果をプレビューする方法は現在ありません。
ウェブサイトで「生成」を押すと、サーバーの起動とオーディオの生成が必要になるため、クレジットが消費されます。クレジットを使わずに、自分のテキストで音声をテストまたはプレビューすることはできません。
ウェブサイトのテキスト読み上げでは、以下の条件を満たす場合に2回まで無料で再生成できます。
プロンプト(テキスト読み上げの場合)またはファイル(ボイスチェンジャーの場合)、音声、モデルが同一であること。音声設定のスライダーは変更できます。
最初の生成から2時間以内であること。
元のオーディオを生成してからページを更新していないこと。
この場合、「音声を再生成」と表示されます。「音声を再生成」ボタンにカーソルを合わせると、残りの無料再生成回数が表示されます。
無料再生成を使い切ると、ボタンは「音声を生成」に戻り、生成に使用されるクレジット数が表示されます。
無料再生成は、ウェブサイトのテキスト読み上げでのみ利用できます。APIでは利用できません。
価格やコストを上げずに、この品質でプレビューを実現する方法を検討しています。また、AIの制御性を高め、プレビューなしでも、できれば最初の試行で期待どおりの結果を得られるようにする方法も模索しています。
ダイアログモードとは? Eleven v3にはDialogueモードがあり、会話の文脈に応じて、自然なテンポで割り込み、口調の変化、感情的な合図を処理する、動的な複数話者の会話を生成できます。
Dialogueモードは、ウェブサイトで複数の話者を使用する場合に利用できます。
複数話者のやり取りを生成するための新しいテキストtoダイアログAPIエンドポイントも用意しています。詳細はAPIドキュメント をご覧ください。
詳細は以下のリソースをご覧ください。
AIはどの言語を話せますか? どの音声でも、AIが現在サポートしているすべての言語を話せます。ただし、AIに話させたい言語を母語とする音声を使用しない場合、たとえば生成された音声や英語を話す音声からクローンした音声を使用すると、わずかに英語アクセントが出たり、類似した言語の間を行き来したりすることがあります。
サポートされているすべての言語の一覧については、こちらの記事をご覧ください:対応している言語は何ですか?
現在のモデルでは、特定の言語を選択する必要はありません。AIに話させたい言語で文章を書けば、AIが自動的に理解します。ただし、類似した単語や語彙を使いながら発音やアクセントが大きく異なる言語もあるため、正しいアクセントでその言語を話してクローンした音声を使用することをおすすめします。これにより、AIは何をどの言語で話すべきかを判断するための十分な文脈を得られます。
言語はテキストによって決まり、アクセントと発音は音声そのものによって決まります。
言語選択を可能にする新技術を開発中ですが、AIの仕組み上、現時点ではまだ開発途上です。
生成できる文字数とテキスト量の上限は? ウェブサイトのテキスト読み上げ では、有料プランなら1回の生成で最大5,000文字、無料プランなら最大2,500文字を生成できます。
ただし、数千文字を超える長文コンテンツを生成する場合は、書籍や小説などの非常に長いコンテンツを簡単に生成できるStudio の使用を強くおすすめします。詳細はこちら をご覧ください。
APIで生成する場合、入力の最大長は使用するモデルによって異なります。
テキスト読み上げ Flash v2.5 - 最大40,000文字(約40分のオーディオ)
Turbo v2.5 - 最大40,000文字(約40分のオーディオ)
Flash v2 - 最大30,000文字(約30分のオーディオ)
Turbo v2 - 最大30,000文字(約30分のオーディオ)
Multilingual v2 - 最大10,000文字(約10分のオーディオ)
ボイスチェンジャー Multilingual v2 - 最大10分のオーディオ
ボイスライブラリ内で特定の言語を母語とする声はどれですか? 既製の音声と生成された音声はすべて英語です。そのため、他の言語を話す際には、正しいアクセントや発音にならない場合があります。
ボイスライブラリのプロフェッショナルカテゴリでは、コミュニティが共有した音声を見つけられます。これらは、それぞれの話者自身の音声をプロフェッショナルボイスクローン したものです。通常、クローン作成時に話していた言語を示す言語タグが付いているため、その言語のネイティブ音声です。特定の言語で絞り込むには、言語検索フィルターも使用できます。
数字、日付、記号、頭字語が正しく発音されない、または正しい言語で読み上げられないのはなぜですか? 数字、日付、記号、頭字語は、正しく読み上げる方法が複数あることが多いため、AIにとって難しい場合があります。これは使用されている言語にも依存します。たとえば「11」は「Eleven」と読めますが、スペイン語では「Once」、ドイツ語では「Elf」と読むこともできます。
数字、日付、頭字語、記号を正しく読み上げるための方法はいくつかあります。
単語で完全に書く 最良の結果を得るには、数字、頭字語、日付、記号を、AIに読み上げてほしい形式で完全に単語として書くことをおすすめします。これによりAIは十分な文脈を得られ、正しい出力を提供できます。たとえば「$100」の場合、期待どおりの結果を得るために、「a hundred dollars」または「one hundred dollars」と書くことをおすすめします。
LLMの使用 たとえばElevenAgents を使用する際など、大規模言語モデルでテキストプロンプトを生成している場合は、AIに読み上げてほしい形式で、数字、日付、記号、頭字語を常に単語として書くようモデルにプロンプトで指示できます。
正規化 API経由で生成する場合は、apply_text_normalizationパラメーターを使用してテキスト正規化を適用するかどうかを指定できます。テキスト正規化では、より正確に発音できるよう数字や日付を単語に展開します。このオプションでは、正規化処理に追加の処理時間が必要になるため、レイテンシーが増加します。
apply_text_normalizationパラメーターには3つのモードがあります。
on:常に適用されます
off:適用されません
auto:AIがテキスト正規化を適用するタイミングを自動的に判断します
language_codeパラメーターを使用して、プロンプトの言語を指定することもできます。これはISO 639-1言語コードを受け付けるオプションのパラメーターです。
これは、テキストに数字や記号のみが含まれる場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定すると、正規化機能がその言語に適したルールを適用できます。
詳細は、APIリファレンス をご覧ください。
ウェブサイトのテキスト読み上げで生成する場合、正規化はデフォルトで有効になっています。
Studioでは、デフォルトで正規化が自動適用されます。つまり、AIがテキスト正規化を適用するタイミングを判断します。正規化を常に適用する設定も可能です。このオプションは、詳細設定 タブのプロジェクト設定 にあります。
声が特定の単語を誤って発音するのはなぜですか? 誤発音にはいくつかの原因があります。最も一般的なのは、単語のスペルミスです。AIはスペルミスのある単語を修正しようとはせず、書かれたとおりに読み上げようとします。そのため、AIに読み上げさせる前に、テキストを校正し、完成していることを必ず再確認することが重要です。
特定の発音を指定したい場合は、Flash v2モデルでSSML音素タグを使用できます。詳細は発音ガイド をご覧ください。
AIが予期しない単語を誤発音したり、期待とは異なるアクセントで話したりすることがあります。これにはいくつかの理由があり、多くの場合、使用する音声と言語に大きく依存します。正しいアクセントと発音を確保する最善の方法は、正しいアクセントと発音で話す音声をクローンすることです。これにより、AIはオーディオ生成時に最も多くの文脈を得られます。
言語はテキストで指定され、アクセントは音声で指定されます。そのため、多くの共通単語を共有する言語や、別の言語とかなり近い関係にある言語で書いている場合、AIが特定の単語の発音を理解したり、アクセントを切り替えたりするのが難しいことがあります。
ただし、特定の状況では、英語であっても正しく書かれた単語をAIが誤発音することがあります。これは使用する音声とテキストに大きく依存するようですが、まれなケースです。