优化 LLM 成本

在 ElevenLabs 平台上降低 LLM 推理成本的实用策略。

概述

管理大语言模型(LLM)推理成本,是开发可持续 AI 应用的关键。本指南介绍如何有效利用 ElevenLabs 平台功能来优化支出。有关模型能力和定价的详细信息,请参阅我们的主要 LLM 文档。

ElevenLabs 支持在静默期间减少模型推理,从而降低成本。 这些时段按常规每分钟费率的 5% 计费。更多详情请参阅 ElevenAgents 概述 页面。

了解推理成本

平台上的 LLM 推理成本主要受以下因素影响:

  • 输入 token:从提示词中处理的数据量,包括用户查询、系统指令和各类上下文数据。
  • 输出 token:LLM 在回复中生成的 token 数量。
  • 模型选择:不同 LLM 的每 token 定价不同。功能更强的模型通常成本更高。

通过 ElevenLabs 控制台或 API 监控用量,是识别可降低成本环节的关键。你还可以通过 托管 MCP 服务器,直接在 Claude 或其他 MCP 客户端中估算智能体预期的 LLM 成本,这有助于在更换模型前进行比较。

策略性选择模型

选择最合适的 LLM 是提升成本效率的主要因素。

  • 合理匹配规模:选择能够可靠完成特定任务的、复杂度最低(通常也更便宜)的模型。避免用高成本模型处理简单操作。例如,Google 的 gemini-2.0-flash 等模型可为许多常见任务提供极具竞争力的定价。请始终对照完整的 支持的 LLM 列表,获取最新定价和能力信息。
  • 实验测试:针对任务测试不同模型,比较输出质量与实际成本。需考虑语言支持、上下文窗口需求和专长能力。

优化提示词

提示词工程是减少 token 消耗及相关成本的有效方法。通过编写清晰、简洁且无歧义的系统提示词,可以引导模型生成更高效的回复。删除可能增加 token 数量的冗余措辞和不必要上下文。还可以明确指示模型所需的输出长度,例如添加“将回复限制为两句话”或“提供简短摘要”等语句。这些简单指令可在保持生成内容质量和相关性的同时,显著减少输出 token 数量。

模块化设计:对于复杂的对话流程,可利用智能体转接。这样可将一条大型系统提示词拆分为多条更小、更专业的提示词,并由不同智能体分别处理。相比为所有可能情况设计的完整提示词,这种方式仅加载当前对话阶段所需的上下文提示词,可大幅减少每次交互的 token 数量。

利用知识库和检索

对于需要访问大量信息的应用,检索增强生成(RAG)和维护良好的知识库至关重要。

  • 高效 RAG:
    • RAG 只向 LLM 提供知识库中的相关片段,而不是在提示词中包含大量数据,从而减少输入 token。
    • 优化检索器,只获取最相关的信息“块”。
    • 微调块大小和重叠度,在上下文与 token 数量之间取得平衡。
    • 了解如何实施 RAG。
  • 上下文大小:
    • 确保知识库包含准确、最新且相关的信息。
    • 结构良好的内容可提高检索精度,并减少无关上下文带来的 token 消耗。

智能使用工具

使用 webhook 工具可让 LLM 将任务委托给外部 API 或自定义代码,成本可能更低。

  • 任务卸载:识别确定性任务、需要实时数据的任务、复杂计算或 API 交互(例如数据库查询、外部服务调用)。
  • 编排:LLM 充当编排器,发起结构化工具调用。这通常比仅通过提示词处理复杂任务节省更多 token。
  • 工具说明:为每个工具提供清晰、简洁的说明,让 LLM 能够高效、准确地使用它们。

清单

可考虑采用以下方法降低成本:

功能成本影响操作项
LLM 选择降低每 token 成本选择能可靠完成任务的最小、最经济模型。进行实验并比较成本与质量。
自定义 LLM可降低专业任务的推理成本针对高频特定任务进行评估;在专有数据上微调,创建更小、更高效的模型。
系统提示词减少输入和输出 token,并引导模型行为保持简洁、清晰、具体。说明所需输出格式和长度(例如“简短回答”“使用 JSON”)。
用户提示词减少输入 token鼓励使用具体查询;有策略地使用 few-shot 示例;总结或选择相关历史记录。
输出控制减少输出 token要求生成摘要或关键信息;谨慎使用 max_tokens;迭代优化提示词以自然地保持简洁。
RAG避免在提示词中加入大量上下文,从而减少输入 token优化检索器的相关性;微调块大小/重叠度;确保嵌入和搜索算法质量高。
知识库提高 RAG 效率,减少无关 token定期整理;删除过时信息;确保良好结构、元数据和标签,以便精准检索。
工具(函数)避免为特定任务调用 LLM;减少 token将确定性、计算密集型或外部 API 任务委托给工具。为 LLM 设计清晰的工具说明。
智能体转接可在任务较简单部分使用更便宜的模型对初步分流/常见问题使用更简单、更便宜的智能体;仅在需要时转接到功能更强的智能体;将大型提示词拆分为由不同智能体处理的小型提示词
对话历史管理

对于有状态对话,与其将多份对话记录作为系统提示词的一部分传入,不如实施历史记录摘要或滑动窗口技术来精简上下文。 在构建面向消费者的应用时,这种方式尤其有效,通常可在收到通话后的 webhook 时进行管理。

持续监控 LLM 用量和成本。定期检查并优化提示词、RAG 配置和工具集成,确保持续的成本效益。