Cascata de LLMs
Saiba como a Agents Platform garante respostas confiáveis de LLM usando um mecanismo de fallback em cascata.
Visão geral
A Agents Platform usa um mecanismo de cascata de LLMs para aumentar a confiabilidade e a resiliência dos seus recursos de geração de texto. Esse sistema tenta automaticamente usar modelos de linguagem grandes (LLMs) de backup se o LLM principal configurado falhar, garantindo uma experiência mais fluida e consistente para o usuário.
As falhas podem incluir erros de API, tempos limite ou respostas vazias do provedor de LLM. A lógica de cascata lida com essas situações de forma adequada.
Como funciona
O processo em cascata segue uma sequência definida:
-
Tentativa com o LLM preferido: o sistema primeiro tenta gerar uma resposta usando o LLM selecionado na configuração do agente.
-
Sequência de LLMs de backup: se o LLM preferido falhar, o sistema usa automaticamente uma sequência predefinida de LLMs de backup. Essa sequência é selecionada com base no desempenho, na velocidade e na confiabilidade dos modelos. A sequência padrão atual (sujeita a alterações) é:
- Gemini 2.5 Flash
- GPT-4o
- Gemini 2.5 Flash Lite
- Claude Sonnet 4.5
-
Conformidade com HIPAA: se o agente operar em um modo que exige privacidade rigorosa de dados (conformidade com HIPAA / retenção zero de dados), a lista de backup será filtrada para incluir apenas modelos compatíveis da sequência acima.
-
Novas tentativas: o sistema tenta novamente o processo de geração várias vezes (pelo menos 3 tentativas) na sequência de LLMs disponíveis (preferido + backups). Se um LLM de backup também falhar, ele passa para o próximo da sequência. Se os LLMs de backup exclusivos acabarem dentro do limite de tentativas, ele poderá tentar novamente modelos de backup que falharam anteriormente.
-
Inicialização sob demanda: as conexões com LLMs de backup são inicializadas apenas quando necessário, otimizando o uso de recursos.
A lista específica e a ordem dos LLMs de backup são gerenciadas internamente pela ElevenLabs e otimizadas para desempenho e disponibilidade. A sequência listada acima representa o padrão atual, mas pode ser atualizada sem aviso prévio.
LLMs personalizados
Quando você configura um LLM personalizado, a lógica de cascata padrão para outros modelos é ignorada. O sistema tentará usar o LLM personalizado especificado por você.
Se seu LLM personalizado falhar, o sistema tentará novamente a solicitação várias vezes com o mesmo LLM personalizado (correspondendo à contagem mínima padrão de tentativas) antes de considerar a solicitação malsucedida. Ele não recorrerá a modelos hospedados pela ElevenLabs, garantindo que sua configuração específica seja respeitada.
Benefícios
- Maior confiabilidade: reduz o impacto de problemas temporários com um provedor de LLM específico.
- Maior disponibilidade: aumenta a probabilidade de gerar uma resposta com sucesso, mesmo durante indisponibilidades parciais de LLMs.
- Operação contínua: o mecanismo de fallback é automático e transparente para o usuário final.
Configuração
A cascata de LLMs é um processo automático em segundo plano. A única configuração necessária é selecionar seu LLM preferido nas configurações do agente. O sistema cuida do restante para garantir um desempenho robusto.