LLMカスケーディング

Agents Platformがカスケード型フォールバックの仕組みにより、信頼性の高いLLM応答を実現する方法を説明します。

概要

Agents Platformは、テキスト生成機能の信頼性と回復性を高めるために、LLMカスケーディングの仕組みを採用しています。このシステムでは、設定されたプライマリLLMが失敗した場合にバックアップの大規模言語モデル(LLM)の使用を自動的に試み、よりスムーズで一貫したユーザー体験を提供します。

失敗には、APIエラー、タイムアウト、LLMプロバイダーからの空の応答などがあります。カスケードロジックは、これらの状況を適切に処理します。

仕組み

カスケード処理は、定義された次の順序に従います。

  1. 優先LLMの試行: システムはまず、エージェント設定で選択されたLLMを使用して応答の生成を試みます。

  2. バックアップLLMの順序: 優先LLMが失敗した場合、システムはあらかじめ定義されたバックアップLLMの順序に自動的にフォールバックします。この順序は、モデルのパフォーマンス、速度、信頼性に基づいて選定されています。現在のデフォルト順序(変更される場合があります)は次のとおりです。

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. HIPAA準拠: エージェントが厳格なデータプライバシーを必要とするモード(HIPAA準拠/データ保持なし)で動作する場合、バックアップリストは上記の順序にある準拠モデルのみに絞り込まれます。

  4. 再試行: システムは、利用可能なLLMの順序(優先LLM+バックアップ)にわたり、生成プロセスを複数回(少なくとも3回)再試行します。バックアップLLMも失敗した場合は、順序内の次のLLMに進みます。再試行上限内で一意のバックアップLLMがなくなった場合、以前に失敗したバックアップモデルを再試行することがあります。

  5. 遅延初期化: バックアップLLMへの接続は必要になった場合にのみ初期化されるため、リソース使用量を最適化できます。

バックアップLLMの具体的なリストと順序はElevenLabsが内部で管理し、パフォーマンスと可用性を最適化しています。 上記の順序は現在のデフォルトですが、予告なく 更新される場合があります。

カスタムLLM

カスタムLLMを設定すると、_他の_モデルへの標準的なカスケードロジックは適用されません。システムは指定したカスタムLLMの使用を試みます。

カスタムLLMが失敗した場合、システムはリクエストの失敗と判断する前に、_同じ_カスタムLLMで複数回(標準の最小再試行回数と同じ回数)再試行します。ElevenLabsでホストされているモデルにはフォールバックしないため、指定した設定が尊重されます。

メリット

  • 信頼性の向上: 特定のLLMプロバイダーで発生する一時的な問題の影響を軽減します。
  • 可用性の向上: LLMの一部で障害が発生している場合でも、応答を正常に生成できる可能性が高まります。
  • シームレスな運用: フォールバックの仕組みは自動で機能し、エンドユーザーには透過的です。

設定

LLMカスケーディングは自動バックグラウンドプロセスです。必要な設定は、エージェントの設定でPreferred LLMを選択することだけです。堅牢なパフォーマンスを確保するため、残りはシステムが処理します。