Przejdź do treści

Modele kaskadowe vs fuzjowane: Jak architektura decyduje, czy twój agent głosowy jest gotowy na firmę

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Większość osób uważa, że agenci głosowi działają w architekturze kaskadowej lub scalonej. W praktyce agenci są projektowani w spektrum między nimi, a w zależności od zastosowania wykorzystuje się zwykle pięć architektur.

Architektura agenta decyduje o tym, czy działa on niezawodnie w środowisku produkcyjnym, dostosowuje się do konkretnych wymagań biznesowych i brzmi naturalnie w rozmowie. Architektura oparta na fuzji, jak model Realtime od OpenAI, może brzmieć imponująco naturalnie w krótkich wymianach. Gdy jednak zespoły muszą egzekwować wymogi zgodności, zdebugować nieudaną odpowiedź albo podmienić LLM na mocniejszy model, który pojawi się w przyszłym miesiącu, pojedyncza scalona sieć daje niewiele możliwości.

W ElevenLabs korzystamy z zaawansowanej architektury kaskadowej. Używamy wyspecjalizowanych komponentów do rozpoznawania mowy, rozumowania i generowania mowy, aby zapewnić wysoki poziom inteligencji i niezawodności. Dodajemy prozodię kontekstową, optymalizację pod kątem niskich opóźnień i inteligentne zarządzanie kolejnością wypowiedzi, dzięki czemu rozmowy płyną naturalnie. Zbudowaliśmy ją w ten sposób, ponieważ firmy i instytucje publiczne, z którymi pracujemy, potrzebują agentów, które brzmią realistycznie i którym można zaufać przy złożonych zadaniach produkcyjnych. 

W tym artykule omawiamy pięć głównych architektur: ich zalety, ograniczenia oraz to, jak podchodzimy do fundamentów agentów wdrażanych w krytycznych workflow.

Co zespoły oceniają przy wyborze architektury

Pytania zadawane przez zespoły zwykle mieszczą się w trzech kategoriach.

Czy poradzi sobie ze złożonymi zadaniami?

  • Rozumowanie i elastyczność modeli: Czy możesz wybrać najlepsze modele do swojego zastosowania, w tym najsilniejsze dostępne LLM-y, i przejść na lepsze opcje, gdy staną się dostępne?
  • Logika agenta: Czy możesz definiować i kontrolować przepływy rozmowy, reguły decyzyjne oraz ścieżki eskalacji, którymi podąża agent?
  • Użycie narzędzi: Czy architektura obsługuje wieloetapowe wywoływanie narzędzi i integracje z systemami zewnętrznymi?

Czy będzie brzmieć i zachowywać się jak człowiek?

  • Prozodia: Czy agent zapewnia naturalny rytm, intonację i ton emocjonalny?
  • Opóźnienie: Czy odpowiedzi są wystarczająco szybkie, by rozmowa była naturalna?
  • Kolejność wypowiedzi: Czy agent wie, kiedy mówić, zrobić pauzę lub oddać głos?

Czy mogę mu zaufać w środowisku produkcyjnym?

  • Niezawodność: Czy agent działa przewidywalnie i konsekwentnie, czy z czasem zaczyna odbiegać od oczekiwań?
  • Mechanizmy ochronne: Czy architektura może chronić przed niezamierzonymi odpowiedziami lub użytkownikami działającymi w złej wierze?
  • Przejrzystość: Czy architektura tworzy wyniki pośrednie, czy jest czarną skrzynką?

Kompromisy między architekturami kaskadowymi i scalonymi

Architektury kaskadowe powstają przez połączenie wyspecjalizowanych komponentów: Speech to Text (STT), dużego modelu językowego i Text to Speech (TTS). Każdy etap można niezależnie optymalizować, testować i aktualizować. 

Architektura kaskadowa

Cascaded (Overview) Diagram

Ta modułowość sprawia, że architektury kaskadowe są podstawą większości agentów klasy enterprise. Każdy etap tworzy możliwe do sprawdzenia wyniki: czytelny tekst między STT a LLM-em oraz między LLM-em a TTS. Mechanizmy ochronne można egzekwować na warstwie tekstowej, najnowszy czołowy LLM można zintegrować bez modyfikowania modeli mowy, a gdy coś zawiedzie, źródło problemu zwykle da się wskazać.

Od dawna krytykuje się architektury kaskadowe za utratę sygnałów prozodycznych. Mowa zostaje sprowadzona do tekstu, a intonację, rytm i emocje trzeba odtworzyć po stronie wyjściowej. Sygnały te można częściowo odzyskać dzięki jawnemu modelowaniu, ale nie są uchwycone tak naturalnie jak w podejściach scalonych. Inne aspekty, takie jak opóźnienie i kolejność wypowiedzi, zazwyczaj można zoptymalizować do porównywalnego poziomu w obu podejściach.

Model scalony

Sequential Fused Diagram

Architektury scalone działają zupełnie inaczej. Rozpoznawanie, rozumowanie i generowanie odbywają się w jednej sieci multimodalnej. Audio trafia do środka i audio wychodzi — bez możliwej do sprawdzenia warstwy pośredniej.

Brak etapów pośrednich jest jednocześnie zaletą i ograniczeniem. Architektura scalona może naturalnie zachować sygnały prozodyczne, ponieważ mowa nigdy nie jest rozkładana na tekst. Ogranicza jednak możliwość egzekwowania mechanizmów ochronnych, wymiany poszczególnych komponentów czy sprawdzania wyników pośrednich podczas debugowania. Istnieją też ograniczenia w dostrajaniu STT do terminologii branżowej lub integrowaniu innego LLM-a dla lepszego rozumowania i wywoływania narzędzi. System to jedna sieć, więc zespoły są ograniczone do wbudowanych możliwości rozumowania. Obecnie oznacza to lżejsze rdzenie, które nie dorównują czołowym LLM-om w złożonych zadaniach.

Pięć architektur

1. Podstawowa architektura kaskadowa

Basic Cascaded Diagram

Audio jest transkrybowane, LLM generuje odpowiedź tekstową, a TTS ją wypowiada. Każdy etap działa na zwykłym tekście, więc wszystko możesz zobaczyć, testować i kontrolować.

Korzyści dla zaufania są jasne: mechanizmy ochronne na warstwie tekstowej, deterministyczne przepływy rozmów i pełne ścieżki audytu. Ponieważ LLM jest niezależnym komponentem, możesz połączyć agenta z dowolnym czołowym modelem oferującym najlepsze rozumowanie lub wywoływanie narzędzi i zaktualizować go, gdy tylko pojawi się lepszy. Słabością jest jakość rozmowy: bez kontekstowego TTS agent brzmi poprawnie, ale płasko. Nie dostosowuje emocji ani prozodii, co wystarcza do odczytania salda konta, ale nie do obsługi sfrustrowanego klienta.

Przykładowe zastosowania:

  • Zamienniki IVR w telekomunikacji i usługach komunalnych
  • Obsługa FAQ podczas onboardingu SaaS
  • Powiadomienia wychodzące, takie jak potwierdzenia wizyt, przypomnienia o lekach i alerty o dostawie, gdy konsekwencja jest ważniejsza niż ciepły ton

2. Zaawansowana architektura kaskadowa

Audio conversation flow: STT converts speech to text, LLM processes it, TTS converts text back to speech.

Ta sama modułowa architektura, ale teraz wiele komponentów działa w bogatszym kontekście. To właśnie zbudowaliśmy dzięki Expressive Mode w ElevenAgents.

Model STT Scribe v2 Realtime tworzy szybką i dokładną transkrypcję, korzystając z wcześniejszego kontekstu rozmowy. Na podstawie tekstu LLM instruuje TTS, jak wypowiedzieć tekst — nie tylko co powiedzieć — na przykład „uspokajająco”, „z naciskiem”, „pilnie”, dynamicznie dostosowując ton w trakcie rozmowy. System zarządzania kolejnością wypowiedzi korzysta z tych samych sygnałów, dzięki czemu agent wie, kiedy odpowiedzieć, a kiedy oddać głos. Modele mowy działają razem w jednym stosie, bez połączeń sieciowych między komponentami, więc opóźnienie pozostaje niskie.

Architektura zachowuje wszystkie zalety podstawowej wersji kaskadowej: pełną przejrzystość, mechanizmy ochronne na warstwie tekstowej, wymienność komponentów, dostrajanie do domeny i dostęp do najsilniejszych dostępnych modeli do wywoływania narzędzi oraz rozumowania. Zapewnia też znacznie lepszą prozodię, opóźnienie i zarządzanie kolejnością wypowiedzi. Zespoły mogą zintegrować nowy czołowy LLM już w tygodniu jego premiery albo dostroić STT dla ochrony zdrowia do terminologii branżowej bez przebudowy innych komponentów.

Przykładowe zastosowania:

  • Obsługa klienta w usługach finansowych, gdzie empatyczny ton podczas rozmowy o zakwestionowanej transakcji łączy się z rygorystycznymi mechanizmami zgodności i pełnym logowaniem interakcji
  • Recepcje placówek medycznych, które wstępnie klasyfikują rozmowy pacjentów z odpowiednią pilnością, zgodnymi z HIPAA przepływami i rozpoznawaniem mowy dostrojonym do terminologii medycznej
  • Asystenci sprzedaży utrzymujący ciepły, przekonujący ton, a jednocześnie działający według ustalonego scenariusza i aktualizujący CRM

3. Hybrydowa architektura kaskadowa i scalona

Hybrid Cascaded Diagram

Niektóre architektury przekazują cechy akustyczne mowy wejściowej — wymowę, emocje i ton — bezpośrednio do LLM-a jako embeddingi, zamiast najpierw konwertować ją na tekst. TTS pozostaje modułowy.

Daje to LLM-owi bogatsze dane o tym, jak coś zostało powiedziane, a nie tylko co zostało powiedziane, co jest cenne w konkretnych zastosowaniach. Scalony blok ASR+LLM trudniej audytować niż czyste przekazanie tekstu, ponieważ reprezentacją pośrednią jest embedding, a nie coś, co człowiek może odczytać. LLM-a nie można też już łatwo podmienić, co ogranicza możliwości rozumowania i wywoływania narzędzi do modelu, wokół którego zbudowano scalony blok.

Przykładowe zastosowania:

  • Nauka języków i trening wymowy, gdzie to, jak mówi uczeń, jest równie ważne jak to, co mówi
  • Obsługa wrażliwa na ton przy małej złożoności, gdzie ważne jest wykrycie frustracji, ale samo zadanie jest proste.

4. Sekwencyjna architektura scalona

Sequential Fused Diagram

Jeden model multimodalny obsługuje rozpoznawanie, rozumowanie i generowanie w jednym przebiegu, po jednej turze naraz.

Prozodia może być bardzo dobra. Ponieważ mowa nigdy nie jest rozkładana na tekst, model naturalnie zachowuje tempo, intonację i sygnały emocjonalne. Krótkie rozmowy mogą brzmieć wyjątkowo płynnie.

Bez warstwy tekstowej możliwości egzekwowania mechanizmów ochronnych są ograniczone, podobnie jak dostęp do wyników pośrednich potrzebnych do debugowania oraz elastyczność podmiany LLM-a na lepszy lub dostrojenia STT do swojej domeny. Rdzenie rozumowania są zwykle lżejsze niż czołowe LLM-y, więc złożone wywoływanie narzędzi i zadania wieloetapowe na tym tracą. Gdy zadanie wymaga rozwiązania złożonego problemu, sama prozodia nie wystarczy.

Przykładowe zastosowania:

  • Osobisti towarzysze, chatboty rozrywkowe i aplikacje, w których ekspresyjność napędza zaangażowanie, a wymogi zgodności są minimalne.

5. Dwukierunkowa architektura scalona

Duplex Fused Diagram

Wejście i wyjście są przetwarzane jednocześnie — model słucha i mówi w tym samym czasie. Dzięki temu krótkie wymiany mogą wydawać się wyjątkowo naturalne, z rzeczywistym nakładaniem się wypowiedzi i płynnym przechodzeniem między turami.

To także architektura najtrudniejsza do kontrolowania: mechanizmy ochronne bardzo trudno w niej egzekwować, a przesłuchy wprowadzają nieprzewidywalne błędy. Sprawdzanie, logowanie i debugowanie są niezwykle trudne, a system jest w dużej mierze zamknięty, z minimalnymi możliwościami wymiany komponentów, dostrajania do domeny lub personalizacji. Rozumowanie i użycie narzędzi są jeszcze bardziej ograniczone niż w sekwencyjnych modelach scalonych, ponieważ równoczesne przetwarzanie zostawia mniej zasobów na złożoną logikę. To samo równoczesne przetwarzanie, które sprawia, że krótkie wymiany brzmią naturalnie, powoduje niestabilność dłuższych rozmów.


Przykładowe zastosowania:

  • Eksperymentalne aplikacje towarzyszące, społecznościowe platformy głosowe i dema badawcze, w których nieprzewidywalne zachowanie jest akceptowalne.

Wybór odpowiedniej architektury do swojego zastosowania

Cascaded-vs-fused-model-chart (recap of the above)

Właściwa architektura zależy od wymagań danej aplikacji. Jeśli tworzysz rozwiązanie, w którym najważniejsza jest naturalnie brzmiąca mowa, architektury scalone mają realne zalety — o ile godzisz się na kompromis w zakresie czołowego rozumowania, mechanizmów ochronnych i przejrzystości. Modele scalone wciąż prowadzą pod względem prozodii, ale zaawansowane systemy kaskadowe zbliżają się do nich z każdym kwartałem. Z kolei modele scalone nie poczyniły istotnych postępów w złożonym rozumowaniu ani zaufaniu ze względu na ograniczenia architektury.

Dla większości firm i instytucji publicznych najlepsza architektura powinna świetnie brzmieć, a zarazem być wydajna, konfigurowalna, godna zaufania i gotowa do wdrożenia na dużą skalę. Dlatego zdecydowaliśmy się zbudować ElevenAgents w oparciu o zaawansowaną architekturę kaskadową, inwestując w Expressive Mode oraz najlepsze w swojej klasie, wspólnie zoptymalizowane modele Speech to Text i Text to Speech. Dzięki temu zespoły mogą tworzyć agentów o wysokim poziomie inteligencji, niezawodności i kontroli, które jednocześnie mówią naturalnie, jak ludzie.

W miarę jak agenci AI coraz częściej trafiają do obsługi klienta, edukacji, osobistych asystentów i innych obszarów, sukces odniosą te oparte na architekturach dopasowanych do konkretnych zastosowań.

Podobne artykuły

Twórz z najwyższej jakości audio AI