Eleven v3とは何ですか?

Eleven v3は、最新かつ最も表現力豊かなテキスト読み上げモデルで、次の特長があります。

  • より人間らしく、全体的に高品質な生成
  • オーディオタグのサポート
    • 感情:[sad] [angry] [happily]
    • 話し方の指示:[whispers] [shouts]
    • 非言語的な反応:[laughs] [clears throat] [sighs]
  • 複数話者による自然な音声をサポートするDialogueモード
  • 70以上の言語に対応

驚くほど優れた出力を生成できますが、一貫性にばらつきがありレイテンシーも高いため、リアルタイムまたは会話型のユースケースには適していません。これらの用途には、Flash v2(英語)またはv2.5(Multilingual)をおすすめします。現在、Eleven v3のリアルタイム版を開発中です。

APIでは、Create speechおよびStream speechエンドポイントでモデルID eleven_v3を指定すると、v3を使用して生成できます。

Create dialogueおよびStream dialogueエンドポイントを使用して、複数話者による自然なダイアログを作成することもできます。

詳細は以下のリソースをご覧ください。