LLM 级联

了解 Agents Platform 如何通过级联回退机制确保可靠的 LLM 响应。

概述

Agents Platform 使用 LLM 级联机制,提高文本生成能力的可靠性和韧性。若配置的主 Large Language Model(LLM)失败,系统会自动尝试使用备用 LLM,确保更流畅、更稳定的用户体验。

失败可能包括 API 错误、超时,或 LLM 提供商返回空响应。级联逻辑会妥善处理这些情况。

工作方式

级联流程遵循既定顺序:

  1. 首选 LLM 尝试: 系统首先尝试使用智能体配置中选定的 LLM 生成响应。

  2. 备用 LLM 顺序: 如果首选 LLM 失败,系统会自动回退到预定义的备用 LLM 序列。此序列根据模型性能、速度和可靠性精心选择。当前默认顺序(可能会变更)为:

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. HIPAA 合规性: 如果智能体以要求严格数据隐私的模式运行(HIPAA 合规性/零数据保留),备用列表将仅保留上述序列中合规的模型。

  4. 重试: 系统会在可用 LLM 序列(首选 LLM + 备用 LLM)中多次重试生成流程(至少 3 次)。如果某个备用 LLM 也失败,系统会继续尝试序列中的下一个模型。如果在重试次数限制内用尽不同的备用 LLM,可能会再次尝试之前失败的备用模型。

  5. 按需初始化: 仅在需要时初始化备用 LLM 连接,以优化资源使用。

备用 LLM 的具体列表和顺序由 ElevenLabs 内部管理,并针对性能和可用性进行优化。 上述序列为当前默认设置,但可能会在不另行通知的情况下更新。

自定义 LLM

配置自定义 LLM后,针对_其他_模型的标准级联逻辑将被绕过。系统会尝试使用指定的自定义 LLM。

如果自定义 LLM 失败,系统会使用_同一个_自定义 LLM 多次重试请求(与标准最低重试次数一致),之后才将请求视为失败。系统不会回退到 ElevenLabs 托管的模型,确保遵循你的特定配置。

优势

  • 更高可靠性: 降低特定 LLM 提供商暂时出现问题的影响。
  • 更高可用性: 即使 LLM 出现部分故障,也能提高成功生成响应的可能性。
  • 无缝运行: 回退机制自动运行,对最终用户透明。

配置

LLM 级联是自动执行的后台流程。唯一需要的配置是在智能体设置中选择首选 LLM。系统会处理其余部分,确保性能稳定。