適切なモデルの選び方

このガイドでは、ユースケースに適したElevenLabsモデルの選び方を紹介します。

ElevenLabsは、さまざまな要件に最適化されたモデルを提供しています。適切な選択は、ユースケース、レイテンシー要件、品質への期待値によって異なります。詳細な仕様については、モデルリファレンスを参照してください。

要件別

品質

eleven_v3を使用

最高の忠実度、豊かな感情表現、幅広い言語サポートを備えたフラッグシップモデルです。

低レイテンシー

Flashモデル(eleven_flash_v2_5またはeleven_flash_v2)を使用

約75msのレイテンシーで、リアルタイムアプリケーション向けに最適化されています。

表現力豊かなリアルタイム

eleven_v3_conversationalを使用

約280msのレイテンシーと、きめ細かな制御のためのオーディオタグを備えた、リアルタイム音声合成向けの最も表現力豊かなモデルです。

多言語

eleven_v3またはeleven_v3_conversationalを使用

どちらも70以上の言語をサポートしています。

バランス

eleven_flash_v2_5またはeleven_v3_conversationalを使用

高品質な出力と低レイテンシーを両立した、最もバランスのよい選択です。

ユースケース別

コンテンツ制作

eleven_v3を使用

プロフェッショナルなコンテンツ、オーディオブック、ビデオナレーションに最適です。

会話型エージェント

最も表現力豊かな話し方にはeleven_v3_conversationalを、最小のレイテンシーにはeleven_flash_v2_5とeleven_flash_v2を使用します。

英語以外の言語をサポートするには、2.5モデルを使用してください。

リアルタイムの会話型アプリケーション向けに最適化されています。

文字起こし

バッチ文字起こしにはscribe_v2、医療・臨床オーディオにはscribe_v2_medical、 リアルタイム文字起こしにはscribe_v2_realtimeを使用します。

話者ダイアライゼーションと単語レベルのタイムスタンプに対応し、90以上の言語で最先端の精度を提供します。

ボイスチェンジャー

eleven_multilingual_sts_v2を使用

スピーチtoスピーチ変換に特化しています。

次のステップ