Cascata de LLMs

Saiba como a Agents Platform garante respostas confiáveis de LLM usando um mecanismo de fallback em cascata.

Visão geral

A Agents Platform usa um mecanismo de cascata de LLMs para aumentar a confiabilidade e a resiliência dos seus recursos de geração de texto. Esse sistema tenta automaticamente usar modelos de linguagem grandes (LLMs) de backup se o LLM principal configurado falhar, garantindo uma experiência mais fluida e consistente para o usuário.

As falhas podem incluir erros de API, tempos limite ou respostas vazias do provedor de LLM. A lógica de cascata lida com essas situações de forma adequada.

Como funciona

O processo em cascata segue uma sequência definida:

  1. Tentativa com o LLM preferido: o sistema primeiro tenta gerar uma resposta usando o LLM selecionado na configuração do agente.

  2. Sequência de LLMs de backup: se o LLM preferido falhar, o sistema usa automaticamente uma sequência predefinida de LLMs de backup. Essa sequência é selecionada com base no desempenho, na velocidade e na confiabilidade dos modelos. A sequência padrão atual (sujeita a alterações) é:

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. Conformidade com HIPAA: se o agente operar em um modo que exige privacidade rigorosa de dados (conformidade com HIPAA / retenção zero de dados), a lista de backup será filtrada para incluir apenas modelos compatíveis da sequência acima.

  4. Novas tentativas: o sistema tenta novamente o processo de geração várias vezes (pelo menos 3 tentativas) na sequência de LLMs disponíveis (preferido + backups). Se um LLM de backup também falhar, ele passa para o próximo da sequência. Se os LLMs de backup exclusivos acabarem dentro do limite de tentativas, ele poderá tentar novamente modelos de backup que falharam anteriormente.

  5. Inicialização sob demanda: as conexões com LLMs de backup são inicializadas apenas quando necessário, otimizando o uso de recursos.

A lista específica e a ordem dos LLMs de backup são gerenciadas internamente pela ElevenLabs e otimizadas para desempenho e disponibilidade. A sequência listada acima representa o padrão atual, mas pode ser atualizada sem aviso prévio.

LLMs personalizados

Quando você configura um LLM personalizado, a lógica de cascata padrão para outros modelos é ignorada. O sistema tentará usar o LLM personalizado especificado por você.

Se seu LLM personalizado falhar, o sistema tentará novamente a solicitação várias vezes com o mesmo LLM personalizado (correspondendo à contagem mínima padrão de tentativas) antes de considerar a solicitação malsucedida. Ele não recorrerá a modelos hospedados pela ElevenLabs, garantindo que sua configuração específica seja respeitada.

Benefícios

  • Maior confiabilidade: reduz o impacto de problemas temporários com um provedor de LLM específico.
  • Maior disponibilidade: aumenta a probabilidade de gerar uma resposta com sucesso, mesmo durante indisponibilidades parciais de LLMs.
  • Operação contínua: o mecanismo de fallback é automático e transparente para o usuário final.

Configuração

A cascata de LLMs é um processo automático em segundo plano. A única configuração necessária é selecionar seu LLM preferido nas configurações do agente. O sistema cuida do restante para garantir um desempenho robusto.