LLM-Kaskadierung

Erfahren Sie, wie die Agents Platform mit einem kaskadierenden Fallback-Mechanismus zuverlässige LLM-Antworten sicherstellt.

Überblick

Die Agents Platform nutzt einen LLM-Kaskadierungsmechanismus, um die Zuverlässigkeit und Ausfallsicherheit ihrer Textgenerierung zu erhöhen. Dieses System versucht automatisch, Backup-Large-Language-Models (LLMs) zu verwenden, wenn das primär konfigurierte LLM ausfällt. So entsteht eine reibungslosere und konsistentere Nutzererfahrung.

Fehler können API-Fehler, Zeitüberschreitungen oder leere Antworten des LLM-Anbieters umfassen. Die Kaskadenlogik verarbeitet diese Situationen zuverlässig.

So funktioniert es

Der Kaskadierungsprozess folgt einer definierten Reihenfolge:

  1. Versuch mit dem bevorzugten LLM: Das System versucht zunächst, mit dem in der Konfiguration des Agenten ausgewählten LLM eine Antwort zu generieren.

  2. Backup-LLM-Reihenfolge: Wenn das bevorzugte LLM ausfällt, greift das System automatisch auf eine vordefinierte Reihenfolge von Backup-LLMs zurück. Diese Reihenfolge wird anhand von Modellleistung, Geschwindigkeit und Zuverlässigkeit zusammengestellt. Die aktuelle Standardreihenfolge (Änderungen vorbehalten) lautet:

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. HIPAA-Konformität: Wenn der Agent in einem Modus mit strengen Datenschutzanforderungen arbeitet (HIPAA-Konformität / keine Datenspeicherung), wird die Backup-Liste gefiltert und enthält nur konforme Modelle aus der obigen Reihenfolge.

  4. Wiederholungsversuche: Das System wiederholt den Generierungsprozess mehrmals (mindestens 3 Versuche) über die Reihenfolge verfügbarer LLMs hinweg (bevorzugtes LLM + Backups). Fällt auch ein Backup-LLM aus, fährt es mit dem nächsten in der Reihenfolge fort. Wenn die eindeutigen Backup-LLMs innerhalb des Wiederholungslimits aufgebraucht sind, kann es zuvor fehlgeschlagene Backup-Modelle erneut versuchen.

  5. Bedarfsorientierte Initialisierung: Verbindungen zu Backup-LLMs werden nur bei Bedarf initialisiert, um die Ressourcennutzung zu optimieren.

Die konkrete Liste und Reihenfolge der Backup-LLMs wird intern von ElevenLabs verwaltet und für Leistung und Verfügbarkeit optimiert. Die oben aufgeführte Reihenfolge entspricht dem aktuellen Standard, kann jedoch ohne Ankündigung aktualisiert werden.

Eigene LLMs

Wenn Sie ein eigenes LLM konfigurieren, wird die standardmäßige Kaskadierungslogik zu anderen Modellen umgangen. Das System versucht, Ihr angegebenes eigenes LLM zu verwenden.

Wenn Ihr eigenes LLM ausfällt, wiederholt das System die Anfrage mehrmals mit demselben eigenen LLM (entsprechend der standardmäßigen Mindestanzahl an Wiederholungsversuchen), bevor die Anfrage als fehlgeschlagen gilt. Es greift nicht auf von ElevenLabs gehostete Modelle zurück, damit Ihre spezifische Konfiguration berücksichtigt wird.

Vorteile

  • Höhere Zuverlässigkeit: Verringert die Auswirkungen vorübergehender Probleme bei einem bestimmten LLM-Anbieter.
  • Höhere Verfügbarkeit: Erhöht die Wahrscheinlichkeit, auch bei teilweisen LLM-Ausfällen erfolgreich eine Antwort zu generieren.
  • Nahtloser Betrieb: Der Fallback-Mechanismus läuft automatisch und transparent für Endnutzer.

Konfiguration

Die LLM-Kaskadierung ist ein automatischer Hintergrundprozess. Sie müssen lediglich Ihr bevorzugtes LLM in den Einstellungen des Agenten auswählen. Das System übernimmt den Rest, um eine robuste Leistung sicherzustellen.