テキスト読み上げ
テキスト読み上げ
ElevenLabsでテキストを自然な話し声のオーディオに変換する方法を学びます。
概要
ElevenLabsのテキスト読み上げ(TTS)APIは、繊細なイントネーション、ペース、感情認識を備えた自然なオーディオへテキストを変換します。モデルは、32の言語と複数の音声スタイルにわたるテキスト上の手がかりに適応し、次の用途に使用できます。
- グローバルなメディアキャンペーンや広告のナレーション
- 複雑な感情表現を含む多言語オーディオブックの制作
- テキストからリアルタイムオーディオをストリーミング
サンプルを聞く:
プロジェクトに最適な音声を見つけるには、ボイスライブラリをご覧ください。
音声品質
リアルタイムアプリケーションでは、Flash v2.5が超低遅延の75msを提供します。一方、Multilingual v2は、より繊細な表現による最高品質のオーディオを提供します。
音声の選択肢
ElevenLabsでは、複数の作成方法により、32の言語で数千種類の音声を提供しています。
- コミュニティで共有された3,000以上の音声を収録したボイスライブラリ
- 最高精度のレプリカを作成するプロフェッショナルボイスクローン
- 素早く音声を複製するインスタントボイスクローン
- テキストの説明からカスタム音声を生成するボイスデザイン
詳しくは、音声の選択肢をご覧ください。
対応する出力形式
デフォルトのレスポンス形式はmp3ですが、pcmやulawなどの形式も利用できます。
- MP3
- サンプルレート:22.05kHz~44.1kHz
- ビットレート:32kbps~192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
- PCM(S16LE)
- サンプルレート:16kHz~44.1kHz
- ビットレート:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
- 16ビット深度
- μ-law
- 8kHzサンプルレート
- 電話アプリケーション向けに最適化
- A-law
- 8kHzサンプルレート
- 電話アプリケーション向けに最適化
- Opus
- サンプルレート:48kHz
- ビットレート:32kbps~192kbps
高品質なオーディオオプションは有料プランでのみ利用できます。詳しくは料金 ページをご覧ください。
対応言語
Multilingual v2モデルは、29言語に対応しています。
英語(米国、英国、オーストラリア、カナダ)、日本語、中国語、ドイツ語、ヒンディー語、フランス語(フランス、カナダ)、韓国語、ポルトガル語(ブラジル、ポルトガル)、イタリア語、スペイン語(スペイン、メキシコ)、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語(サウジアラビア、アラブ首長国連邦)、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。
Flash v2.5は、v2モデルのすべての言語に加え、以下を含む32言語に対応しています。
ハンガリー語、ノルウェー語、ベトナム語
対応言語のテキストを入力し、ボイスライブラリから一致する音声を選択するだけです。最も自然な結果を得るには、対象の言語と地域に合ったアクセントの音声を選んでください。
プロンプト
モデルは、テキスト入力から感情的な文脈を直接解釈します。たとえば、 「彼女は興奮して言った」のような説明文を加えたり、感嘆符を使ったりすると、発話の 感情に影響します。StabilityやSimilarityなどの音声設定は一貫性の制御に役立ちますが、 根底にある感情はテキスト上の手がかりから生まれます。
詳しくは、プロンプトガイドをご覧ください。
説明文もモデルによって読み上げられます。必要に応じて、オーディオから手動でトリミングまたは削除してください。
よくある質問
自分の声をクローンできますか?
はい。短いオーディオクリップから、自分の音声のインスタントボイスクローンを作成できます。 高精度なクローンについては、プロフェッショナルボイス クローン機能をご覧ください。
生成されたオーディオの所有権は保持できますか?
はい。生成したオーディオの所有権は保持されます。ただし、商用利用権は有料プランでのみ 利用できます。有料サブスクリプションでは、入力コンテンツのIP権利を所有している場合、生成したオーディオを商用利用し、 出力を収益化できます。
無料再生成の対象となる条件は?
以下の条件を満たす場合、追加費用なしで同じテキスト読み上げコンテンツを再生成できます。
- 各コンテンツは最大2回まで無料で再生成できます
- コンテンツは前回の生成と完全に同一でなければなりません。テキスト、音声設定、その他のパラメータを変更すると、新たな有料生成が必要になります
無料再生成は、オーディオ出力にわずかな歪みがある場合に便利です。ElevenLabsの社内ベンチマークによると、再生成により品質上の問題のおよそ半分は解決され、残りの問題は通常、トレーニングデータの品質不足に起因します。
リアルタイム用途でレイテンシーを減らすには?
ほぼリアルタイムの会話型またはインタラクティブなシナリオ向けに最適化された、低レイテンシーのFlashモデル(Flash v2またはv2.5)を使用してください。 詳しくは、レイテンシー最適化 ガイドをご覧ください。
出力に一貫性がないことがあるのはなぜですか?
モデルは非決定的です。一貫性を高めるには、任意のseed パラメータを使用してください。ただし、わずかな 差異が生じる場合があります。
長文テキストの変換におけるベストプラクティスは?
長いテキストをセグメントに分割し、リアルタイム再生と効率的な処理にはストリーミングを使用してください。 チャンク間で自然な韻律の流れを維持するには、前後のテキストまたは前後の リクエストIDパラメータを含めてください。
主なポイント
- 決定性:出力は非決定的です。一貫性を高めるには
seedパラメータを使用してください - 無料再生成:生成ごとに最大2回まで無料再生成可能(同一コンテンツと同一パラメータの場合のみ)
- 所有権:生成したオーディオの所有権は保持されます。商用利用には有料プランが必要です
- 低レイテンシーのユースケース:Flashモデル(
eleven_flash_v2またはeleven_flash_v2_5)を使用してください。詳しくはレイテンシー最適化ガイドをご覧ください - 長文テキスト:長いテキストをセグメントに分割し、
previous_text/next_textパラメータを使用してチャンク間で自然な韻律を維持してください