模型

了解如何为使用场景选择合适的模型

ElevenAgents 提供统一界面,可将智能体连接到多个模型和提供商,兼顾灵活性、可靠性和成本优化。

主要功能

  • 统一访问:只需少量代码改动,即可切换提供商和模型
  • 高可靠性:当一个提供商失败时,自动切换到另一个提供商
  • 支出监控:监控不同模型的支出

支持的模型

目前,以下模型获得原生支持,可在智能体设置中配置:

提供商模型
ElevenLabsDeepSeek Flash 4.1
GLM 5.2
Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.8 Flash
Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-6.1 Sol
GPT-6 Astra
GPT-6 Sol
GPT-6 Luna
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 5.5
Claude Opus 5
Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5.5
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

除非另有说明,价格通常以每 100 万个 token 的美元计。Token 是 LLM 的基本文本数据单位, 平均约等于 4 个字符。

自定义 LLM

支持使用自定义 LLM:指定需要请求的端点,并通过安全的密钥存储提供凭据。详细了解自定义 LLM 集成。

启用欧盟数据驻留后,部分模型不可用。请参阅 GDPR 和数据 驻留,了解可用性详情。

选择模型

为应用选择最合适的 LLM 时,需要考虑以下因素:

  • 任务复杂度:根据应用中的代表性任务评估模型
  • 延迟要求:对于实时语音对话,选择低延迟模型,并使用提示词和工具测量响应时间
  • 上下文窗口大小:如果应用需要处理、理解或回忆长对话或大量文档中的信息,请选择上下文窗口更大的模型
  • 成本效益:在预期性能和功能与预算之间取得平衡。LLM 价格可能差异很大,因此应结合预期使用模式分析定价结构(输入、输出和缓存 token)
  • HIPAA 合规性:如果应用涉及受保护健康信息(PHI),务必使用指定为符合 HIPAA 要求的 LLM,并确保整个数据处理流程满足监管标准

系统提示词最大为 2MB,其中包括智能体指令、知识库内容和其他系统级上下文。

模型配置

温度

温度控制模型响应的随机性。较低的值会生成更一致、更聚焦的输出,较高的值则会增加创造性和变化性。

  • 低(0.0-0.3):适合结构化交互的确定性、一致响应
  • 中(0.4-0.7):平衡创造性和一致性
  • 高(0.8-1.0):适合动态对话的创意、多样响应

备用 LLM 配置

配置备用 LLM,确保主 LLM 发生故障或不可用时对话仍能继续。

配置选项:

  • 默认:使用 ElevenLabs 推荐的回退顺序
  • 自定义:定义自己的备用模型级联顺序
  • 已禁用:不使用回退(强烈不建议用于生产环境)

禁用备用 LLM 后,如果主 LLM 发生故障或不可用,对话将突然结束。强烈不建议在生产环境中使用此设置。

详细了解 LLM 级联。

推理

推理可帮助智能体处理复杂决策,例如在工具之间进行选择、应用政策或完成多步骤 workflow。根据模型不同,可以通过思考预算或推理强度级别控制其执行的推理量。

思考预算

使用数字滑块设置最大推理 token 数。更大的预算可能会增加响应时间。如果模型支持,可将预算设为 0 以禁用思考。

推理强度

推理强度控制模型在回答前执行的推理量。可用级别取决于所选模型。

对实时语音智能体,建议从较低的预算或强度开始,因为额外思考可能会延迟轮次切换。对于需要更复杂决策的 workflow 步骤,可提高该值。

推理摘要

启用推理摘要后,可在调试响应、工具调用或 workflow 路径时捕获模型返回的推理内容。在智能体的 LLM 设置中开启 推理摘要,或通过 API 设置 enable_reasoning_summary。该设置默认关闭。

对于自定义端点,请参阅 ElevenLabs 如何请求和存储推理内容。

推理内容受保留和 PII 脱敏设置约束。可通过以下渠道访问:

位置可用性
对话历史在 推理 徽标下可查看
获取对话 API在转录项的 reasoning 字段中返回
OpenTelemetry包含在通话后智能体响应 span 中,字段为 elevenlabs.reasoning_content
客户端事件仅文本对话中以 agent_reasoning_response_part 形式提供

使用零保留模式时,ElevenLabs **不会 存储推理内容 **。内容仅会发送给聊天客户端和通话后 webhook。

限制

  • 请求推理摘要可能会增加响应延迟。在对延迟敏感的语音智能体上启用前,请先进行测试。
  • 提供商可能返回摘要、思考文本、原始推理增量,或不返回可显示内容。

了解定价

  • Token:LLM 使用通常按处理的 token 数量计费。对于英文文本,100 个 token 大约相当于 75 个单词
  • 输入与输出定价:提供商通常会区分输入 token(发送给模型的数据)和输出 token(模型生成的响应数据)的价格
  • 缓存定价:
    • input_cache_read:指从缓存中检索先前处理过的输入数据所产生的费用。如果多次处理相同输入,使用缓存数据可以节省成本
    • input_cache_write:指将输入数据存储到缓存所产生的费用。部分 LLM 提供商可能会对此操作收费
  • 本文档列出的价格均按每 100 万个 token 计算,基于撰写时可获得的信息。LLM 提供商可能会调整这些价格
  • 成本转嫁定价:ElevenLabs 按提供商公布的费率转嫁第三方 LLM 成本,不加价。部分 Gemini 和 Claude 模型采用 Vertex AI 区域(非全球)定价,适用于美国和欧盟流量计费——输入、输出和缓存 token 价格提高 10%,与 Vertex 区域费率一致

有关当前模型功能、定价和服务条款,请查阅提供商文档。

HIPAA 合规性

平台提供的部分 LLM 可能适合在需要符合 HIPAA 要求的环境中使用。详情请参阅 HIPAA 合规文档。

相关资源

ElevenLabs 托管的模型

ElevenLabs 提供多种 AI 模型,其中包括由 ElevenLabs 托管的部分第三方模型。

标记为“由 ElevenLabs 托管”的模型,部署并运行在 ElevenLabs 管理的基础设施上。目前,这些模型托管在美国或企业部署所在地区。

如何识别由 ElevenLabs 托管的模型

ElevenLabs 托管的模型会在 ElevenLabs 界面中清晰标注。浏览或选择模型时,请查找“由 ElevenLabs 托管”标识。

数据处理方式

对于 ElevenLabs 托管的模型,请求会在 ElevenLabs 管理的基础设施内处理。这意味着原始模型提供商不会接收、访问或处理通过 ElevenLabs 提交的输入和输出。

通过托管这些模型,ElevenLabs 可以提供一致的体验,同时保留对处理模型请求所用基础设施的控制权。

常见问题

自托管模型托管在哪里?

ElevenLabs 托管的模型目前运行在位于美国或企业部署所在地区的基础设施上。

原始模型提供商会访问我的数据或使用情况元数据吗?

对于 ElevenLabs 托管的模型,模型原始开发者绝不会接收输入或输出,也无法访问处理这些内容的部署数据。

如何知道模型是否由 ElevenLabs 托管?

ElevenLabs 托管的模型会在 ElevenLabs 界面中以“由 ElevenLabs 托管”标识清晰标注。