Cascade de LLM
Découvrez comment Agents Platform assure des réponses LLM fiables grâce à un mécanisme de repli en cascade.
Vue d’ensemble
Agents Platform utilise un mécanisme de cascade de LLM pour renforcer la fiabilité et la résilience de ses capacités de génération de texte. Ce système tente automatiquement d’utiliser des grands modèles de langage (LLM) de secours si le LLM principal configuré échoue, afin de garantir une expérience utilisateur plus fluide et cohérente.
Les échecs peuvent inclure des erreurs d’API, des délais d’expiration ou des réponses vides du fournisseur de LLM. La logique en cascade gère ces situations avec fiabilité.
Fonctionnement
Le processus en cascade suit une séquence définie :
-
Tentative avec le LLM préféré : Le système tente d’abord de générer une réponse à l’aide du LLM sélectionné dans la configuration de l’agent.
-
Séquence de LLM de secours : Si le LLM préféré échoue, le système bascule automatiquement vers une séquence prédéfinie de LLM de secours. Cette séquence est sélectionnée selon les performances, la vitesse et la fiabilité des modèles. La séquence par défaut actuelle, susceptible de changer, est la suivante :
- Gemini 2.5 Flash
- GPT-4o
- Gemini 2.5 Flash Lite
- Claude Sonnet 4.5
-
Conformité HIPAA : Si l’agent fonctionne dans un mode exigeant une confidentialité stricte des données, conformité HIPAA ou zéro rétention des données, la liste de secours est filtrée pour inclure uniquement les modèles conformes de la séquence ci-dessus.
-
Nouvelles tentatives : Le système relance le processus de génération plusieurs fois, au moins 3 tentatives, parmi la séquence de LLM disponibles, préféré et secours. Si un LLM de secours échoue également, le système passe au suivant dans la séquence. S’il ne reste plus de LLM de secours uniques dans la limite des tentatives, il peut réessayer des modèles de secours ayant précédemment échoué.
-
Initialisation différée : Les connexions aux LLM de secours sont initialisées uniquement lorsque nécessaire, afin d’optimiser l’utilisation des ressources.
La liste et l’ordre précis des LLM de secours sont gérés en interne par ElevenLabs et optimisés pour les performances et la disponibilité. La séquence indiquée ci-dessus correspond à la configuration par défaut actuelle, mais peut être mise à jour sans préavis.
LLM personnalisés
Lorsque vous configurez un LLM personnalisé, la logique de cascade standard vers d’autres modèles est ignorée. Le système tentera d’utiliser le LLM personnalisé que vous avez spécifié.
Si votre LLM personnalisé échoue, le système réessaiera la requête plusieurs fois avec le même LLM personnalisé, en respectant le nombre minimal standard de nouvelles tentatives, avant de considérer la requête comme échouée. Il ne basculera pas vers des modèles hébergés par ElevenLabs, afin de respecter votre configuration spécifique.
Avantages
- Fiabilité accrue : Réduit l’impact des problèmes temporaires chez un fournisseur de LLM donné.
- Disponibilité supérieure : Augmente la probabilité de générer une réponse avec succès, même lors de pannes partielles de LLM.
- Fonctionnement transparent : Le mécanisme de repli est automatique et transparent pour l’utilisateur final.
Configuration
La cascade de LLM est un processus automatique en arrière-plan. La seule configuration requise consiste à sélectionner votre LLM préféré dans les paramètres de l’agent. Le système gère le reste pour assurer des performances robustes.