モデル

ユースケースに適したモデルの選び方を学ぶ

ElevenAgentsは、エージェントを複数のモデルやプロバイダーに接続するための統合インターフェースを提供し、柔軟性、信頼性、コスト最適化を実現します。

主な機能

  • 統合アクセス:最小限のコード変更でプロバイダーとモデルを切り替え
  • 高い信頼性:プロバイダーで障害が発生した場合、別のプロバイダーへ自動的に切り替え
  • 利用額のモニタリング:複数モデルにわたる利用額をモニタリング

対応モデル

現在、以下のモデルがネイティブでサポートされており、エージェント設定から構成できます。

プロバイダーモデル
ElevenLabsQwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

料金は、特に明記がない限り通常100万トークンあたりの米ドルで表示されます。トークンはLLMにおける テキストデータの基本単位で、平均しておよそ4文字に相当します。

カスタムLLM

リクエスト先エンドポイントを指定し、安全なシークレットストレージを通じて認証情報を提供することで、独自のカスタムLLMを利用できます。詳細はカスタムLLMインテグレーションをご覧ください。

EUデータレジデンシーが有効な場合、一部のモデルは利用できません。利用可否の詳細については、GDPRとデータ レジデンシーをご覧ください。

モデルの選択

アプリケーションに最も適したLLMを選ぶには、いくつかの要素を考慮する必要があります。

  • タスクの複雑さ:アプリケーションを代表するタスクでモデルを評価します
  • レイテンシー要件:ライブ音声会話では、低レイテンシーのモデルを選び、プロンプトとツールを使って応答時間を測定します
  • コンテキストウィンドウのサイズ:長時間の会話や大規模なドキュメントの情報を処理、理解、想起する必要がある場合は、より大きなコンテキストウィンドウを持つモデルを選択します
  • 費用対効果:必要なパフォーマンスと機能を予算と比較検討します。LLMの料金は大きく異なるため、想定利用パターンに照らして料金体系(入力、出力、キャッシュトークン)を分析してください
  • HIPAA準拠:アプリケーションが保護対象保健情報(PHI)を扱う場合は、HIPAA準拠に指定されたLLMを使用し、データ処理プロセス全体が規制基準を満たすことが重要です

システムプロンプトの最大サイズは2MBです。これにはエージェントの指示、ナレッジベースの コンテンツ、その他のシステムレベルのコンテキストが含まれます。

モデル設定

温度

温度はモデル応答のランダム性を制御します。低い値では一貫性があり焦点の定まった出力になり、高い値では創造性と変化が増します。

  • 低(0.0~0.3):構造化されたやり取り向けの決定的で一貫した応答
  • 中(0.4~0.7):創造性と一貫性のバランス
  • 高(0.8~1.0):動的な会話向けの創造的で多様な応答

バックアップLLMの設定

プライマリLLMで障害が発生した場合や利用できなくなった場合でも会話を継続できるよう、バックアップLLMを設定します。

設定オプション:

  • デフォルト:ElevenLabs推奨のフォールバック順序を使用
  • カスタム:バックアップモデルのカスケード順序を独自に定義
  • 無効:フォールバックなし(本番環境では強く非推奨)

バックアップLLMを無効にすると、プライマリLLMで障害が発生した場合や利用できなくなった場合に会話が 突然終了します。本番環境での利用は強く非推奨です。

詳細はLLMカスケーディングをご覧ください。

推論

推論により、エージェントはツールの選択、ポリシーの適用、複数ステップのワークフローの完了といった複雑な判断を処理できます。モデルに応じて、思考バジェットまたは推論努力レベルで、実行する推論量を制御できます。

思考バジェット

数値スライダーで推論トークンの最大数を設定します。バジェットを大きくすると応答時間が長くなることがあります。モデルが対応している場合、バジェットを0に設定すると思考を無効にできます。

推論努力

推論努力は、モデルが回答前に実行する推論量を制御します。利用可能なレベルは、選択したモデルによって異なります。

追加の思考によってターンテイキングが遅れる可能性があるため、ライブ音声エージェントでは低いバジェットまたは努力レベルから始めてください。 より複雑な判断が必要なワークフローステップでは増やしてください。

推論サマリー

応答、ツール呼び出し、ワークフローパスをデバッグする際に、モデルが返した推論を取得するには、推論サマリーを有効にします。エージェントのLLM設定で推論サマリーをオンにするか、APIでenable_reasoning_summaryを設定します。この設定はデフォルトでオフです。

カスタムエンドポイントについては、ElevenLabsによる推論のリクエストと保存方法をご覧ください。

推論コンテンツには、保持およびPIIマスキング設定が適用されます。以下のチャネルからアクセスできます。

送信先利用可否
会話履歴推論バッジから利用可能
会話取得APIトランスクリプト項目のreasoningフィールドで返却
OpenTelemetry通話後のagent-responseスパンにelevenlabs.reasoning_contentとして含まれる
クライアントイベントテキスト会話に限り、agent_reasoning_response_partとして利用可能

ゼロ保持モードでは、ElevenLabsは推論コンテンツを 保存しません。チャットクライアントと通話後のWebhookにのみ配信されます。

制限事項

  • 推論サマリーをリクエストすると、応答レイテンシーが増加する場合があります。レイテンシーの影響を受けやすい音声エージェントで有効にする前にテストしてください。
  • プロバイダーは、サマリー、思考テキスト、生の推論差分、または表示可能なコンテンツなしを返すことがあります。

料金について

  • トークン:LLMの利用料金は通常、処理されたトークン数に基づいて課金されます。英語テキストの一般的な目安では、100トークンは約75語に相当します
  • 入力と出力の料金:プロバイダーは、入力トークン(モデルに送信するデータ)と出力トークン(モデルが応答として生成するデータ)で料金を分けていることが多くあります
  • キャッシュ料金:
    • input_cache_read:以前に処理された入力データをキャッシュから取得する際のコストです。同一の入力を複数回処理する場合、キャッシュデータを利用するとコストを削減できます
    • input_cache_write:入力データをキャッシュに保存する際のコストです。一部のLLMプロバイダーはこの操作に料金を課す場合があります
  • このドキュメントに記載されている料金は100万トークンあたりであり、執筆時点で入手可能な情報に基づいています。これらの料金はLLMプロバイダーによって変更される場合があります

現在のモデル機能、料金、利用規約については、プロバイダーのドキュメントを参照してください。

HIPAA準拠

プラットフォームで利用できる一部のLLMは、HIPAA準拠が必要な環境での使用に適している場合があります。詳細はHIPAA準拠のドキュメントをご覧ください。

関連リソース

ElevenLabsがホストするモデル

ElevenLabsは、ElevenLabsがホストする一部のサードパーティモデルを含む、多様なAIモデルへのアクセスを提供しています。

モデルが「Hosted by ElevenLabs」と指定されている場合、そのモデルはElevenLabsが管理するインフラストラクチャ上でデプロイ・運用されています。これらのモデルは現在、米国またはエンタープライズデプロイメントのリージョンでホストされています。

ElevenLabsがホストするモデルを識別する方法

ElevenLabsがホストするモデルには、ElevenLabsインターフェース上で明確なラベルが付けられています。モデルを閲覧または選択する際は、「Hosted by ElevenLabs」の表示を確認してください。

データの取り扱い

ElevenLabsがホストするモデルでは、リクエストはElevenLabsが管理するインフラストラクチャ内で処理されます。つまり、元のモデルプロバイダーはElevenLabs経由で送信された入力と出力を受信、アクセス、処理しません。

これらのモデルをホストすることで、ElevenLabsはモデルリクエストの提供に使用するインフラストラクチャを管理しながら、一貫した体験を提供できます。

よくある質問

セルフホストモデルはどこでホストされていますか?

ElevenLabsがホストするモデルは現在、米国またはエンタープライズデプロイメントのリージョンにあるインフラストラクチャでホストされています。

元のモデルプロバイダーは、データまたは利用状況のメタデータにアクセスできますか?

ElevenLabsがホストするモデルでは、モデルの元の開発元が入力や出力を受け取ることはなく、それらを処理するデプロイメントに関するデータにもアクセスできません。

モデルがElevenLabsによってホストされているかは、どうすれば分かりますか?

ElevenLabsがホストするモデルは、ElevenLabsインターフェース上で「Hosted by ElevenLabs」と明確に表示されます。