Eleven v3とは何ですか?
Eleven v3とは何ですか?
Eleven v3は、最新かつ最も表現力豊かなテキスト読み上げモデルで、次の特長があります。
- より人間らしく、全体的に高品質な生成
- オーディオタグのサポート
- 感情:
[sad][angry][happily] - 話し方の指示:
[whispers][shouts] - 非言語的な反応:
[laughs][clears throat][sighs]
- 感情:
- 複数話者による自然な音声をサポートするDialogueモード
- 70以上の言語に対応
驚くほど優れた出力を生成できますが、一貫性にばらつきがありレイテンシーも高いため、リアルタイムまたは会話型のユースケースには適していません。これらの用途には、Flash v2(英語)またはv2.5(Multilingual)をおすすめします。現在、Eleven v3のリアルタイム版を開発中です。
APIでは、Create speechおよびStream speechエンドポイントでモデルID eleven_v3を指定すると、v3を使用して生成できます。
Create dialogueおよびStream dialogueエンドポイントを使用して、複数話者による自然なダイアログを作成することもできます。
詳細は以下のリソースをご覧ください。