適切なモデルの選び方
適切なモデルの選び方
このガイドでは、ユースケースに適したElevenLabsモデルの選び方を紹介します。
ElevenLabsは、さまざまな要件に最適化されたモデルを提供しています。適切な選択は、ユースケース、レイテンシー要件、品質への期待値によって異なります。詳細な仕様については、モデルリファレンスを参照してください。
適切なモデルの選び方
このガイドでは、ユースケースに適したElevenLabsモデルの選び方を紹介します。
ElevenLabsは、さまざまな要件に最適化されたモデルを提供しています。適切な選択は、ユースケース、レイテンシー要件、品質への期待値によって異なります。詳細な仕様については、モデルリファレンスを参照してください。
eleven_v3を使用
最高の忠実度、豊かな感情表現、幅広い言語サポートを備えたフラッグシップモデルです。
Flashモデル(eleven_flash_v2_5またはeleven_flash_v2)を使用
約75msのレイテンシーで、リアルタイムアプリケーション向けに最適化されています。
eleven_v3_conversationalを使用
約280msのレイテンシーと、きめ細かな制御のためのオーディオタグを備えた、リアルタイム音声合成向けの最も表現力豊かなモデルです。
eleven_v3またはeleven_v3_conversationalを使用
どちらも70以上の言語をサポートしています。
eleven_flash_v2_5またはeleven_v3_conversationalを使用
高品質な出力と低レイテンシーを両立した、最もバランスのよい選択です。
eleven_v3を使用
プロフェッショナルなコンテンツ、オーディオブック、ビデオナレーションに最適です。
最も表現力豊かな話し方にはeleven_v3_conversationalを、最小のレイテンシーにはeleven_flash_v2_5とeleven_flash_v2を使用します。
英語以外の言語をサポートするには、2.5モデルを使用してください。
リアルタイムの会話型アプリケーション向けに最適化されています。
バッチ文字起こしにはscribe_v2、医療・臨床オーディオにはscribe_v2_medical、
リアルタイム文字起こしにはscribe_v2_realtimeを使用します。
話者ダイアライゼーションと単語レベルのタイムスタンプに対応し、90以上の言語で最先端の精度を提供します。
eleven_multilingual_sts_v2を使用
スピーチtoスピーチ変換に特化しています。