Selektywna specjalizacja: jak tworzyć agentów, którzy sprawdzają się w produkcji
- Autor
- Adarsh Shiragannavar
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Stworzenie agenta na poziomie dema nigdy nie było szybsze. Podłącz sprawny model, daj mu kilka narzędzi i w jedno popołudnie masz coś, co umówi spotkanie, przygotuje odpowiedź albo na żądanie pobierze raport. Problemy zaczynają się później. VP ds. CX, szef operacji, lider platformy — ktokolwiek odpowiada za działanie tego agenta w skali firmy — trafia na ścianę. To, co działało w demie, przy rzeczywistym ruchu i stawce staje się wolne i nieprzewidywalne. Rzadko zawodzi platforma bazowa. Zawodzi architektura zbudowana na niej.
Wąskie gardło: jeden agent od wszystkiego
Naturalnym odruchem po sukcesie pierwszego agenta jest dorzucanie mu kolejnych rzeczy. Więcej narzędzi. Więcej kontekstu. Szerszy zakres zadań. Skoro dobrze wykonał jedno zadanie, na pewno poradzi sobie z dziesięcioma.
Ten odruch tworzy wąskie gardło. Gdy jeden agent odpowiada za planowanie, wykonanie, zapamiętywanie i analizę w szerokim zakresie, kilka rzeczy psuje się naraz.
Podejmowanie decyzji staje się wolniejsze i trudniejsze do kontrolowania, bo każdy krok rywalizuje teraz o miejsce w jednym oknie kontekstu i jednym przebiegu rozumowania. Wybór narzędzi staje się mniej niezawodny, bo dokładność zwykle spada wraz z liczbą dostępnych narzędzi. System staje się też kruchy, bo drobne nieporozumienie na pierwszym etapie pozostaje bez kontroli. Bez granic między obowiązkami wczesny błąd po cichu zatruwa wszystko, co następuje dalej.
Wyobraź sobie jednego agenta głosowego stworzonego do obsługi zgłoszeń ubezpieczeniowych od początku do końca. Podczas jednej rozmowy musi potwierdzić tożsamość dzwoniącego, znaleźć właściwą polisę, sprawdzić zakres ochrony, zinterpretować zgłoszenie, oszacować prawdopodobną wypłatę, zapisać interakcję i zdecydować, czy przekazać sprawę człowiekowi. W demie, gdy rozmówca współpracuje i połączenie jest czyste, sprawnie obsługuje wszystko. Na produkcji, przy zakłóconym połączeniu mobilnym, na pierwszym etapie źle słyszy nazwisko dzwoniącego. Agent już się z tego nie podnosi. Pobiera niewłaściwą polisę, pewnie analizuje ochronę, której klient nie ma, i podaje kwotę wypłaty za plan, którego klient nigdy nie kupił. Między usłyszeniem nazwiska a działaniem nie było żadnego etapu kontroli, więc jeden błąd transkrypcji zmienił się w błędną obietnicę wypowiedzianą klientowi.
W regulowanej branży to nie tylko złe doświadczenie — to naruszenie zgodności, z którym wiąże się odpowiedzialność. To jeden z powodów, dla których możliwość ubezpieczenia agentów staje się warunkiem wdrożeń produkcyjnych, oraz dlaczego stworzyliśmy ElevenAgents jako pierwszą platformę Conversational AI kwalifikującą się do ubezpieczenia AI przez AIUC.
Zauważ, co faktycznie zawiodło. Agent nie był słaby w rozmowie. Nie radził sobie z samodzielnym dźwiganiem wszystkich obowiązków, bez punktu kontrolnego między zrozumieniem czegoś a działaniem. Rozwiązaniem nie jest mniejsza ambicja ani mniej aktywny agent. Jest nim struktura.
Warto to doprecyzować. To nie jest głównie ograniczenie samych modeli. Mocniejszy model podnosi poprzeczkę, ale nie usuwa problemu strukturalnego. To problem projektowania systemów.
Model myślowy: działy, nie CEO decydujący o wszystkim
Pomyśl, jak rośnie firma. Jeśli CEO osobiście podejmuje każdą decyzję w obszarze inżynierii, marketingu i HR, firma staje w miejscu. Nie rozwiążesz tego, zatrudniając mądrzejszego CEO. Rozwiążesz to, budując wyspecjalizowane zespoły o jasno określonym zakresie działania.
Ta sama logika dotyczy systemów AI. Zamiast jednego ogromnego agenta możesz podzielić system na wyspecjalizowanych agentów o ograniczonych obowiązkach. Jeden pobiera dane. Jeden pisze kod. Jeden zajmuje się wyłącznie weryfikacją faktów. Każdy ma węższy zakres, dzięki czemu jego decyzje są tańsze, szybsze i łatwiejsze do zaufania.
Nie wymaga to specjalistycznej infrastruktury. Nasza platforma ElevenAgents ma już niezbędne elementy: agenta konwersacyjnego w centrum, wywołania narzędzi do wyszukiwania i aktualizacji, przekazanie do innego agenta przy zmianie zakresu, wyszukiwanie wiedzy, które pomaga trzymać się faktów, oraz workflow łączące te elementy. Dobre wdrożenie polega głównie na świadomym używaniu tych podstawowych elementów, zamiast upychać wszystkie obowiązki w jednym promptcie i mieć nadzieję, że to zadziała.

To właśnie zaleta architektury wieloagentowej — i w odpowiednich zadaniach jest ona realna. Dobrym przykładem jest contact center. Załóżmy, że chcesz ocenić pod kątem jakości dziesięć tysięcy wczorajszych rozmów wsparcia. Praca łatwo dzieli się na części: jeden agent sprawdza, czy konsultant przestrzegał skryptu zgodności, drugi ocenia empatię i ton, kolejny oznacza rozmowy, które należało eskalować, a jeszcze inny wyodrębnia powód kontaktu klienta. Żadna z tych ocen nie zależy od pozostałych, więc wszystkie mogą działać równolegle na tym samym transkrypcie. To dokładnie rodzaj zadania, w którym podejście wieloagentowe się sprawdza. Części są niezależne, praca opiera się głównie na analizie danych, a odseparowanie każdej oceny we własnym kontekście faktycznie zwiększa jej precyzję.

Uczciwe kompromisy
Podejście wieloagentowe nie daje korzyści za darmo. Każdy lider techniczny oceniający tę architekturę będzie — i powinien — dokładnie sprawdzić koszty koordynacji, zanim się na nią zdecyduje. Najważniejsze zastrzeżenie jest takie.
Najczęstszym problemem jest fragmentacja kontekstu. Gdy dzielisz zadanie między agentów, którzy nie współdzielą pełnego kontekstu, każdy działa na częściowym obrazie, a ich decyzje mogą się ze sobą kłócić w sposób, którego koordynator nie potrafi pogodzić.
Ta sama pułapka pojawia się w rozmowach na żywo. Wyobraź sobie rozmowę windykacyjną podzieloną między agenta negocjacyjnego i agenta zgodności, którzy nie współdzielą stanu. Agent negocjacyjny, chcąc pomóc, oferuje klientowi sześciomiesięczny plan spłaty. Agent zgodności, który nie widział tej oferty, odrzuciłby ją, ponieważ region klienta ogranicza takie plany do trzech miesięcy. Każdy agent działał rozsądnie w swoim wycinku. Razem stworzyli zobowiązanie, którego firma nie może dotrzymać, złożone prawdziwej osobie w czasie rzeczywistym. Problemem nie był słaby model ani warstwa głosowa. Były nim dwa wąskie spojrzenia, które nigdy się nie spotkały.
Rozwiązaniem nie jest więcej agentów. Trzeba zachować ciągłość rozmowy i pozwolić agentowi sprawdzić regułę zgodności jako narzędzie, zanim złoży zobowiązanie — tak aby reguła i oferta spotkały się, zanim cokolwiek zostanie wypowiedziane. To wybór projektowy, a dobra platforma ułatwia jego podjęcie.
W praktyce wybór zależy od zadania. Podejście wieloagentowe sprawdza się w równoległej pracy opartej na analizie danych, gdzie części są naprawdę niezależne — w badaniach, wyszukiwaniu i weryfikacji. Gorzej radzi sobie z pracą ściśle powiązaną, gdzie wszystko musi tworzyć spójną całość, jak pisanie jednego fragmentu kodu. W zadaniach wrażliwych na opóźnienia, takich jak przetwarzanie głosu w czasie rzeczywistym, każde dodatkowe przekazanie między agentami wydłuża czas odpowiedzi przy ograniczonym budżecie opóźnień, więc długie łańcuchy agentów są domyślnie ryzykowne. Tu też liczy się nasza infrastruktura. ElevenAgents łączy rozpoznawanie mowy, wykrywanie zmian tury i generowanie głosu w jednym stosie, więc bazowe opóźnienie jest minimalne jeszcze przed dodaniem narzutu orkiestracji.
Co naprawdę napędza ROI
Zespoły, które osiągają realne korzyści z agentów, zwykle nie wybierają jednego najmądrzejszego modelu i nie oczekują, że udźwignie całą pracę. Świadomie decydują, gdzie się specjalizować, gdzie zachować jeden ciągły kontekst oraz jak agenci mają się koordynować, gdy jest to konieczne.
Innymi słowy, odpowiedzią rzadko jest „jeden wielki agent” i rzadko „podziel wszystko”. To selektywna specjalizacja. Korzyści wynikają z wyznaczania granic we właściwych miejscach, a nie z liczby agentów ani możliwości któregokolwiek z nich. Zachowaj zadanie w jednym agencie, gdy praca jest powiązana, a kontekst musi pozostać ciągły. Podziel je między wyspecjalizowanych agentów, gdy praca przebiega równolegle, a konteksty można wyraźnie odizolować.
Rekomendacja
W kolejnym projekcie nie zaczynaj od wyboru architektury. Najpierw rozpisz pracę.
Wypisz konkretne możliwości, których naprawdę potrzebuje system. Oznacz, które części są faktycznie niezależne, a które ściśle powiązane. Określ, gdzie odizolowany kontekst jest zaletą, a nie obciążeniem — na przykład przy weryfikacji faktów, którą chcesz oddzielić od głównego toku rozumowania. Dopiero wtedy zdecyduj, gdzie podzielić obowiązki między osobnych agentów.
Tak wygląda to w produkcyjnej linii przypominającej o spłacie pożyczki. Rozmowa na żywo pozostaje w jednym ciągłym agencie, ponieważ słowa klienta, ton i wymiana zdań są ściśle powiązane, a każde dodatkowe przekazanie powoduje opóźnienie słyszalne dla dzwoniącego. Do tego jednego konwersacyjnego rdzenia podłączasz wyspecjalizowane komponenty o ograniczonym zakresie, które nie przerywają rozmowy: wywołanie narzędzia pobierające dane konta i pozostałe saldo, zabezpieczenie zgodności sprawdzane przez agenta przed złożeniem jakiejkolwiek oferty płatności, sprawne przekazanie sprawy człowiekowi, gdy sytuacja tego wymaga, oraz osobny zestaw agentów ewaluacyjnych, którzy następnego ranka oceniają nagrania pod kątem jakości i ryzyka.

Rozmowa jest powiązana, więc pozostaje spójna. Wyszukiwanie danych, kontrole i oceny są niezależne, więc dostają własne granice. To selektywna specjalizacja, a nie dzielenie dla samego dzielenia, i bezpośrednio odpowiada podstawowym elementom, które daje ci dobra platforma agentowa.
Zrób tak, a zyskasz korzyści specjalizacji bez niepotrzebnego kosztu koordynacji. Przewidywalne działanie, ograniczone skutki błędów i system o złożoności, którą wybierasz świadomie, zamiast odkrywać ją dopiero na produkcji. Tak używana platforma agentowa nie jest demem, które staje się mniej stabilne w miarę skalowania. To infrastruktura, która działa stabilniej, gdy każda część ma jasno określone zadanie. Właśnie tym stworzyliśmy ElevenAgents.


