Otimização de custos de LLM

Estratégias práticas para reduzir despesas com inferência de LLM na plataforma ElevenLabs.

Visão geral

Gerenciar os custos de inferência de modelos de linguagem grandes (LLMs) é essencial para desenvolver aplicações de IA sustentáveis. Este guia apresenta estratégias importantes para otimizar os gastos na plataforma ElevenLabs usando seus recursos de forma eficaz. Para ver informações detalhadas sobre recursos e preços dos modelos, consulte nossa documentação principal sobre LLMs.

A ElevenLabs ajuda a reduzir custos ao diminuir a inferência dos modelos durante períodos de silêncio. Esses períodos são cobrados a 5% da tarifa usual por minuto. Veja a página de visão geral do ElevenAgents para mais detalhes.

Entendendo os custos de inferência

Os custos de inferência de LLMs em nossa plataforma são influenciados principalmente por:

  • Tokens de entrada: A quantidade de dados processados do seu prompt, incluindo perguntas dos usuários, instruções do sistema e quaisquer dados de contexto.
  • Tokens de saída: O número de tokens gerados pelo LLM na resposta.
  • Escolha do modelo: LLMs diferentes têm preços por token diferentes. Modelos mais avançados geralmente têm custos mais altos.

Monitorar seu uso pelo painel da ElevenLabs ou pela API é essencial para identificar oportunidades de redução de custos. Você também pode estimar o custo esperado de LLM de um agente diretamente pelo Claude ou outro cliente MCP usando o servidor MCP hospedado, o que é útil para comparar modelos antes de fazer uma alteração.

Seleção estratégica de modelos

Escolher o LLM mais adequado é um fator essencial para a eficiência de custos.

  • Dimensionamento adequado: Selecione o modelo menos complexo (e geralmente mais barato) que consiga realizar sua tarefa específica de forma confiável. Evite usar modelos caros para operações simples. Por exemplo, modelos como o gemini-2.0-flash do Google oferecem preços muito competitivos para várias tarefas comuns. Sempre consulte a lista completa de LLMs compatíveis para ver os preços e recursos mais recentes.
  • Experimentação: Teste vários modelos para suas tarefas, comparando a qualidade do resultado com os custos gerados. Considere o suporte a idiomas, as necessidades de janela de contexto e habilidades especializadas.

Otimização de prompts

A engenharia de prompts é uma técnica poderosa para reduzir o consumo de tokens e os custos associados. Ao criar prompts de sistema claros, concisos e sem ambiguidades, você pode orientar o modelo a produzir respostas mais eficientes. Elimine formulações redundantes e contexto desnecessário que possam aumentar sua contagem de tokens. Considere instruir explicitamente o modelo sobre o tamanho desejado da resposta — por exemplo, adicionando frases como “Limite sua resposta a duas frases” ou “Forneça um breve resumo”. Essas instruções simples podem reduzir significativamente o número de tokens de saída, mantendo a qualidade e a relevância do conteúdo gerado.

Design modular: Para fluxos de conversa complexos, use a transferência entre agentes. Isso permite dividir um único prompt de sistema grande em vários prompts menores e mais especializados, cada um processado por um agente diferente. Isso reduz significativamente a contagem de tokens por interação ao carregar apenas o prompt relevante para o contexto do estágio atual da conversa, em vez de um prompt abrangente pensado para todas as possibilidades.

Aproveitando conhecimento e recuperação

Para aplicações que precisam acessar grandes volumes de informação, a geração aumentada por recuperação (RAG) e uma base de conhecimento bem mantida são essenciais.

  • RAG eficiente:
    • O RAG reduz os tokens de entrada ao fornecer ao LLM apenas trechos relevantes da sua Base de conhecimento, em vez de incluir muitos dados no prompt.
    • Otimize o recuperador para buscar apenas os “chunks” de informação mais pertinentes.
    • Ajuste o tamanho e a sobreposição dos chunks para equilibrar contexto e contagem de tokens.
    • Saiba mais sobre como implementar RAG.
  • Tamanho do contexto:
    • Garanta que sua Base de conhecimento contenha informações precisas, atualizadas e relevantes.
    • Conteúdo bem estruturado melhora a precisão da recuperação e reduz o uso de tokens com contexto irrelevante.

Uso inteligente de ferramentas

Usar ferramentas de webhook permite que LLMs deleguem tarefas a APIs externas ou código personalizado, o que pode ser mais econômico.

  • Delegação de tarefas: Identifique tarefas determinísticas, que exigem dados em tempo real, cálculos complexos ou interações com APIs (por exemplo, consultas a bancos de dados e chamadas a serviços externos).
  • Orquestração: O LLM atua como um orquestrador, fazendo chamadas estruturadas de ferramentas. Isso costuma ser muito mais eficiente em tokens do que tentar realizar tarefas complexas apenas com prompts.
  • Descrições de ferramentas: Forneça descrições claras e concisas para cada ferramenta, permitindo que o LLM as use com eficiência e precisão.

Checklist

Considere aplicar estas técnicas para reduzir custos:

RecursoImpacto no custoItens de ação
Escolha do LLMReduz o custo por tokenSelecione o menor modelo e mais econômico que execute a tarefa de forma confiável. Experimente e compare custo e qualidade.
LLMs personalizadosCusto de inferência potencialmente menor para tarefas especializadasAvalie para tarefas específicas de alto volume; faça finetune com dados proprietários para criar modelos menores e eficientes.
Prompts de sistemaReduz tokens de entrada e saída e orienta o comportamento do modeloSeja conciso, claro e específico. Instrua sobre o formato e o tamanho desejados da saída (por exemplo, “seja breve”, “use JSON”).
Prompts de usuárioReduz tokens de entradaIncentive perguntas específicas; use exemplos few-shot de forma estratégica; resuma ou selecione o histórico relevante.
Controle de saídaReduz tokens de saídaPeça resumos ou informações essenciais; use max_tokens com cuidado; itere nos prompts para alcançar concisão natural.
RAGReduz tokens de entrada ao evitar contexto extenso no promptOtimize o recuperador para relevância; ajuste o tamanho/sobreposição dos chunks; garanta embeddings e algoritmos de busca de alta qualidade.
Base de conhecimentoMelhora a eficiência do RAG, reduzindo tokens irrelevantesFaça curadoria regularmente; remova informações desatualizadas; garanta boa estrutura, metadados e tags para recuperação precisa.
Ferramentas (funções)Evita chamadas ao LLM para tarefas específicas; reduz tokensDelegue tarefas determinísticas, com muitos cálculos ou de APIs externas para ferramentas. Crie descrições claras das ferramentas para o LLM.
Transferência entre agentesPermite usar modelos mais baratos em partes mais simples das tarefasUse agentes mais simples/baratos para triagem inicial e FAQs; transfira para agentes mais capazes apenas quando necessário; decomponha prompts grandes em prompts menores entre vários agentes
Gerenciamento do histórico de conversas

Para conversas com estado, em vez de incluir várias transcrições de conversas como parte do prompt de sistema, implemente técnicas de resumo de histórico ou janela deslizante para manter o contexto enxuto. Isso pode ser particularmente eficaz ao criar aplicações para consumidores e muitas vezes pode ser gerenciado ao receber um webhook pós-chamada.

Monitore continuamente o uso e os custos do seu LLM. Revise e aprimore regularmente seus prompts, configurações de RAG e integrações de ferramentas para garantir uma boa relação de custo-benefício contínua.