Kaskadowanie LLM
Dowiedz się, jak Agents Platform zapewnia niezawodne odpowiedzi LLM dzięki kaskadowemu mechanizmowi zapasowemu.
Omówienie
Agents Platform wykorzystuje mechanizm kaskadowania LLM, aby zwiększyć niezawodność i odporność generowania tekstu. Jeśli skonfigurowany główny LLM zawiedzie, system automatycznie próbuje użyć zapasowych Large Language Models (LLM), zapewniając płynniejsze i bardziej spójne doświadczenie użytkownika.
Awarie mogą obejmować błędy API, przekroczenia limitu czasu lub puste odpowiedzi od dostawcy LLM. Logika kaskadowa sprawnie obsługuje takie sytuacje.
Jak to działa
Proces kaskadowy przebiega według określonej sekwencji:
-
Próba użycia preferowanego LLM: System najpierw próbuje wygenerować odpowiedź za pomocą LLM wybranego w konfiguracji agenta.
-
Sekwencja zapasowych LLM: Jeśli preferowany LLM zawiedzie, system automatycznie przechodzi do zdefiniowanej sekwencji zapasowych LLM. Sekwencja jest dobierana na podstawie wydajności, szybkości i niezawodności modeli. Obecna domyślna sekwencja (może ulec zmianie) to:
- Gemini 2.5 Flash
- GPT-4o
- Gemini 2.5 Flash Lite
- Claude Sonnet 4.5
-
Zgodność z HIPAA: Jeśli agent działa w trybie wymagającym ścisłej prywatności danych (zgodność z HIPAA / zerowe przechowywanie danych), lista zapasowa jest filtrowana tak, aby obejmowała tylko zgodne modele z powyższej sekwencji.
-
Ponowienia: System ponawia proces generowania wiele razy (co najmniej 3 próby) w sekwencji dostępnych LLM (preferowany + zapasowe). Jeśli zapasowy LLM także zawiedzie, system przechodzi do następnego w sekwencji. Jeśli w limicie ponowień zabraknie unikalnych zapasowych LLM, może ponowić próbę z wcześniej nieskutecznymi modelami zapasowymi.
-
Leniwa inicjalizacja: Połączenia z zapasowymi LLM są inicjalizowane tylko w razie potrzeby, co optymalizuje użycie zasobów.
Konkretna lista i kolejność zapasowych LLM są zarządzane wewnętrznie przez ElevenLabs i optymalizowane pod kątem wydajności oraz dostępności. Powyższa sekwencja to obecne ustawienie domyślne, ale może zostać zmieniona bez powiadomienia.
Własne LLM
Gdy konfigurujesz własny LLM, standardowa logika kaskadowa do innych modeli jest pomijana. System spróbuje użyć wskazanego przez ciebie własnego LLM.
Jeśli własny LLM zawiedzie, system ponowi żądanie wielokrotnie z tym samym własnym LLM (zgodnie ze standardową minimalną liczbą ponowień), zanim uzna żądanie za nieudane. Nie przejdzie do modeli hostowanych przez ElevenLabs, dzięki czemu twoja konfiguracja będzie respektowana.
Korzyści
- Większa niezawodność: Ogranicza wpływ tymczasowych problemów z konkretnym dostawcą LLM.
- Wyższa dostępność: Zwiększa szansę na wygenerowanie odpowiedzi nawet podczas częściowych awarii LLM.
- Płynne działanie: Mechanizm zapasowy działa automatycznie i jest niewidoczny dla użytkownika końcowego.
Konfiguracja
Kaskadowanie LLM to automatyczny proces działający w tle. Wystarczy wybrać Preferowany LLM w ustawieniach agenta. Resztą zajmuje się system, aby zapewnić stabilne działanie.