Przejdź do treści

Możliwości agentów głosowych: pamięć, eskalacja i nie tylko

Opublikowano

PosłuchajPosłuchaj tego artykułu

Tradycyjne systemy telefoniczne opierały się na skryptowych, odpowiedziach sterowanych menu. Ograniczało to ich zdolność do reagowania na naturalną mowę i obsługi złożonych próśb w workflow. Dzisiejsze agenty głosowe wykraczają daleko poza to, łącząc rozpoznawanie mowy w czasie rzeczywistym, rozumowanie i kontekst w bardziej responsywne systemy głosowe.


Nowoczesne agenty głosowe potrafią uwierzytelnić klienta, znaleźć jego dane w systemie, udzielić trafnej odpowiedzi na podstawie bieżących danych, rozpoznać, kiedy sprawę trzeba przekazać dalej, i nie tylko. Wszystko dzieje się podczas rozmowy, bez kierowania użytkownika do kolejki połączeń w oczekiwaniu na konsultanta.

Ten przewodnik odpowiada na sześć pytań o możliwości agentów głosowych AI: jak pamiętają dzwoniących, radzą sobie z frustracją, na jakich danych się uczą, jak personalizują rozmowy, jak chronią wrażliwe dane i jak wpływają na CSAT. Każda odpowiedź pokazuje, jak ElevenAgents robi to w praktyce.

Six voice agent capabilities: memory, training, data, difficult calls, personalization, and outcomes.

Podsumowanie:

  • Agenty głosowe łączą rozpoznawanie mowy w czasie rzeczywistym z rozumowaniem na bieżących danych, dzięki czemu mogą uwierzytelniać dzwoniących, odpowiadać na podstawie aktualnych informacji i wykonywać zadania w trakcie rozmowy bez kierowania kogokolwiek do kolejki połączeń.
  • Pamięć agenta działa w ramach jednej rozmowy i między kolejnymi interakcjami: na początku pobiera historię klienta z CRM przez zmienne dynamiczne, a wyniki zapisuje przez webhooki po rozmowie.
  • Frustracją dzwoniących zarządza wykrywanie sentymentu i deeskalacja w czasie rzeczywistym. Gdy frustracja przekroczy próg lub dzwoniący poprosi o człowieka, rozmowa może zostać przekazana człowiekowi albo wyspecjalizowanemu agentowi.
  • Agenty budują bazę wiedzy na podstawie przesłanych treści, m.in. PDF, Word, tekstu, Markdown, HTML i EPUB. RAG wyszukuje trafne fragmenty, a mniejsze dokumenty pozostają w pełnym kontekście.
  • Spersonalizowane rekomendacje łączą dane CRM, bieżącą prośbę i sprawdzanie produktów podczas rozmowy przez tool calling, więc agent porównuje faktyczną dostępność z historią dzwoniącego.
  • Konfigurowalne ustawienia prywatności regulują retencję danych, przechowywanie audio, redakcję transkrypcji i tryb bez retencji. Wdrożenia dla opieki zdrowotnej na poziomie enterprise mogą kwalifikować się do HIPAA.

Jakie możliwości mają agenty głosowe?

Agent głosowy to system sztucznej inteligencji (AI), który może prowadzić z klientami rozmowy głosowe w czasie rzeczywistym. W porównaniu z tradycyjnymi rozwiązaniami głosowymi rozumie intencję i kontekst sytuacji oraz wykonuje zadania w imieniu klienta. Taki agent słucha klienta, analizuje to, co słyszy, korzysta z systemów potrzebnych do realizacji prośby, a potem odpowiada naturalnym tonem, podobnym do tonu konsultanta. 

Możliwości agentów głosowych to konkretne funkcje, które sprawiają, że rozmowy między agentem a klientem są użyteczne. Można je podzielić na kilka kategorii, które określają, jak dobrze agent sprawdzi się w danej roli:

  • Pamięć i kontekst: Możliwość zachowania informacji o kliencie w trakcie jednej rozmowy lub wielu interakcji z tym samym klientem.
  • Obsługa trudnych sytuacji i rozmów: Agenty trzymają się tematu i zasad, gdy dzwoniący jest sfrustrowany, zdezorientowany lub nie chce zaakceptować wyniku. 
  • Uczenie na twoich treściach: Agenty korzystają z istniejącej wewnętrznej dokumentacji i zasad firmy, by dobierać odpowiedzi do rozmowy zamiast używać ogólnego skryptu.
  • Personalizacja dla klienta: Agenty dostosowują ton, tempo lub rekomendacje do osoby dzwoniącej, zamiast przedstawiać ogólne menu opcji. 
  • Obsługa danych: Informacje udostępniane agentom są zarządzane zależnie od tego, jakie dane są przechowywane, jak długo firma je zachowuje i kto ma do nich dostęp. 
  • Mierzalne wyniki: System zapewnia wewnętrzne monitorowanie, które pomaga ocenić, czy agent głosowy rozwiązuje problemy i czy robi to równie dokładnie jak konsultant. 

Te możliwości pomagają firmom lepiej dostosować agentów do potrzeb klientów. 

Jak agenty głosowe pamiętają wcześniejsze rozmowy z klientami?

Agenty głosowe nie mają wbudowanej pamięci między rozmowami. Pamięć między połączeniami składa się z trzech elementów: zmiennych dynamicznych, które wstrzykują dane CRM na początku rozmowy, webhooka inicjującego rozmowę, który je pobiera, oraz webhooka po rozmowie, który zapisuje wyniki. W trakcie jednej rozmowy agent automatycznie zachowuje pełny kontekst rozmowy.

Zależnie od architektury agenty głosowe mogą obsługiwać pamięć klienta na dwóch poziomach:

  • W trakcie jednej rozmowy: Agent utrzymuje kontekst rozmowy i śledzi wszystko, co zostało powiedziane podczas sesji. Dzięki temu klient nie musi powtarzać tych samych informacji.
  • Między wieloma interakcjami: Ta pamięć jest możliwa dzięki integracji wielokanałowej. Agent pobiera historię klienta z firmowego CRM lub bazy danych na początku rozmowy, a następnie zapisuje jej wynik, aby kolejna rozmowa uwzględniała wcześniejszy kontekst.

Kontekst jest dodawany na początku rozmowy przez zmienne dynamiczne w ElevenAgents. Te zmienne przekazują wartości czasu działania do promptów, wiadomości i narzędzi agenta. Pozwala to personalizować każdą rozmowę informacjami o użytkowniku bez tworzenia osobnego agenta dla każdego klienta. Imię dzwoniącego, status konta, dane identyfikacyjne i historia wcześniejszych interakcji mogą trafić do agenta głosowego na początku rozmowy. 

W przypadku przychodzących rozmów telefonicznych ElevenAgents może pobrać początkowe dane z serwerów firmy przez webhook inicjujący rozmowę i zastosować JSON zwrócony przez endpoint podczas ładowania kontekstu przez agenta. Platforma pobiera potrzebne dane w czasie początkowego łączenia z klientem. Zwykle wygląda to jak standardowy sygnał oczekiwania lub muzyka na czekanie, gdy agent równolegle analizuje kontekst. 

Po zakończeniu rozmowy proces działa w drugą stronę. Agent wysyła wyniki rozmowy z powrotem do CRM lub systemu wsparcia przez webhooki po rozmowie albo inne narzędzia do obsługi połączeń. Zapisuje, co wydarzyło się podczas rozmowy i jakie działania wobec klienta mogą być jeszcze potrzebne. To dokumentacja interakcji z klientem utrzymuje pamięć agenta głosowego. Dzięki temu kolejny agent lub konsultant ma pełny kontekst jeszcze przed rozpoczęciem rozmowy. 

Voice agents use CRM variables and webhooks to remember callers across calls.

Jak agenty głosowe obsługują sfrustrowanych lub zdenerwowanych klientów?

Sfrustrowani i zdenerwowani klienci pojawiają się w każdej obsłudze klienta. Agenty głosowe radzą sobie z takimi sytuacjami, wykrywając problem, dostosowując reakcję i eskalując sprawę, gdy jest to potrzebne. 

Oto jak agenty głosowe radzą sobie z trudnymi sytuacjami z klientami:

  • Wykrywanie frustracji: Reakcje klientów najskuteczniej wykrywa się przez analizę sentymentu. Analiza ocenia rozmowy jako pozytywne, negatywne lub neutralne. W pojedynczej rozmowie śledzi każdą odpowiedź użytkownika na skali od negatywnej do pozytywnej, dzięki czemu widać, gdzie rozmowa poszła źle. Po zebraniu danych z różnych tematów można ustalić, które obszary najbardziej frustrują dzwoniących i co warto poprawić. Wiodące modele agentów głosowych, takie jak dostępne w ElevenLabs, potrafią nawet rozumieć ton na podstawie transkrypcji na żywo i odpowiednio się dostosować.
  • Dostosowanie w czasie rzeczywistym: Zachowanie deeskalacyjne można bezpośrednio określić w system prompt agenta. Pozwala mu to uznać frustrację dzwoniącego, nie wdawać się w spory, zachować spokojne odpowiedzi na temat i wskazać drogę do rozwiązania. 
  • Przekazanie do człowieka: Narzędzie transfer to number przekazuje rozmowę człowiekowi po spełnieniu określonych warunków — zwykle gdy dzwoniący prosi o rozmowę z człowiekiem, dwa razy powtarza tę samą skargę albo sentyment pozostaje negatywny przez kilka kolejnych tur. Zapisz te warunki w system prompt. Agent może odtworzyć dzwoniącemu komunikat podczas oczekiwania i przekazać osobne podsumowanie operatorowi odbierającemu połączenie. Dzięki temu konsultant zaczyna z kontekstem, a nie od zera. ElevenAgents obsługuje też transfer agent-agent, który kieruje rozmowę do wyspecjalizowanego agenta, gdy dzwoniący potrzebuje innej wiedzy niż oferuje agent — zamiast przekazywać go człowiekowi.

Najważniejszym elementem obsługi sfrustrowanych klientów przez agenty głosowe jest ścieżka przekazania rozmowy. 

Voice agents detect frustration, adapt responses, and escalate persistent complaints to humans.

Jakich formatów plików można użyć do trenowania agenta głosowego?

Nowoczesne agenty głosowe nie są trenowane w tradycyjnym rozumieniu AI/LLM. Otrzymują wiedzę, na której mogą bazować: dokumentację, strony internetowe lub zasoby w formie zwykłego tekstu, tworzące bazę wiedzy. Podczas rozmów agent pobiera z niej trafne fragmenty. To podejście nazywa się generowaniem wspomaganym wyszukiwaniem (RAG). Dzięki temu agent może korzystać z dużo większej ilości informacji, niż zapewniłby pojedynczy prompt.

Informacje do bazy wiedzy można dodać na kilka sposobów: przesłać plik, wskazać agentowi adres URL lub wkleić tekst bezpośrednio. W ElevenAgents każdy przesłany plik może mieć do 20 MB i być w jednym z tych formatów: 

  • .pdf 
  • .docx 
  • .txt 
  • .md 
  • .html 
  • .epub

Format wpływa na jakość wyszukiwania. Markdown, zwykły tekst i DOCX są czysto wyodrębniane i przewidywalnie dzielone na fragmenty dla RAG. PDF-y z wielokolumnowym układem, tabelami lub zeskanowanymi stronami są wyodrębniane słabo, więc przed przesłaniem warto je przekonwertować. 

Po dołączeniu dokumentu agent używa go na jeden z dwóch sposobów. Małe dokumenty mogą być w pełnym kontekście, czyli cały ich tekst pozostaje w prompcie w każdej turze. Większe dokumenty są indeksowane dla RAG. 

W tym procesie podczas rozmowy pobierane są tylko fragmenty najbardziej trafne dla danego pytania. Dokument może być użyty w pełnym kontekście tylko wtedy, gdy jego wyodrębniony tekst mieści się w 250 000 znaków. Większe dokumenty przechodzą przez RAG. Po włączeniu RAG system automatycznie wybiera właściwą ścieżkę.

Voice agent knowledge base supports uploads, full context, RAG, and format-aware retrieval.

Jak agenty głosowe tworzą spersonalizowane rekomendacje produktów?

Spersonalizowane rekomendacje produktów powstają przez połączenie wielu informacji o dzwoniącym w momencie rozmowy z agentem głosowym. Obejmują one to, kim jest dzwoniący, o co pyta i co jest dostępne. Agent zna dane dzwoniącego z CRM, przekazane przez zmienne dynamiczne. 

Z rozmowy na żywo zna też prośbę, a dostępność sprawdza w danych produktowych przez wywołania narzędzi. Następnie analizuje wszystkie te informacje, by polecić dzwoniącemu spersonalizowane opcje, tak jak dobrze przygotowany konsultant. 

Aby lepiej zrozumieć, jak działa to w praktyce, zobaczmy przykładową rozmowę. 

Powracający klient dzwoni na linię wsparcia technicznego sprzedawcy, bo nie może zalogować się na konto i chce dokonać zakupu. Tak agent głosowy zamienia tę rozmowę w spersonalizowaną rekomendację:

  • Pobiera kontekst na początku: Agent zna już historię zakupów dzwoniącego i inne powiązane informacje, ponieważ pobrał je na początku rozmowy.
  • Uwzględnia prośbę w rekomendacji: Dzwoniący opisuje, czego potrzebuje, a agent wykorzystuje ten opis w rekomendacji, zamiast zaczynać od zera.
  • Sprawdza bieżące dane produktów podczas rozmowy: Agent wywołuje API produktu, by sprawdzić aktualne stany magazynowe i ceny, zamiast polegać na danych treningowych.
  • Dopasowuje dostępność do dzwoniącego: Porównuje dostępne produkty z opisem i historią zakupów dzwoniącego.
  • Rekomenduje i realizuje zamówienie: Agent proponuje produkt i na życzenie finalizuje zamówienie, bez przekazywania dzwoniącego gdzie indziej.


Całą tę rozmowę obsługuje tool calling. Dzięki temu bot głosowy może korzystać z zewnętrznych systemów, takich jak katalog produktów czy API zamówień, i uwzględniać te informacje w odpowiedziach. Dokumentacja ElevenLabs dotycząca narzędzi wyjaśnia, jak skonfigurować takie połączenie.

Five-step call flow uses history and live stock data to recommend and complete an order.

Czy agenty głosowe mogą obsługiwać wrażliwe dane klientów?

Agenty głosowe oferują konfigurowalne ustawienia okresów retencji, możliwość nieprzechowywania audio rozmów, redakcję historii rozmów i ścisłe zasady retencji dla silnie regulowanych branż, takich jak ochrona zdrowia. 

W ElevenAgents każde z tych ustawień konfiguruje się w ustawieniach prywatności. Oto jak to działa:

  • Retencja: Transkrypcje rozmów i nagrania audio są przechowywane tylko przez określony czas. Domyślnie ElevenAgents zachowuje transkrypcje i nagrania przez dwa lata, ale okres ten można ustawić od zera dni do bezterminowo; dla zgodności z HIPAA zaleca się co najmniej sześć lat. Pamiętaj, że faktyczne przetwarzanie chronionych informacji zdrowotnych na naszej platformie wymaga włączenia Zero Retention Mode. Oznacza to, że sześć lat dokumentacji należy bezpiecznie przechowywać we własnej infrastrukturze za pomocą webhooków.
  • Retencja audio:Nagrania audio rozmów można zachować na potrzeby obsługi klienta lub całkowicie wyłączyć ich zapisywanie, aby audio klientów nie było przechowywane. Wyłączenie zapisu nagrań i ustawienie retencji na zero dni oznacza, że dane są usuwane zaraz po rozmowie.
  • Redakcja historii rozmów: Po zakończeniu rozmowy etap przetwarzania końcowego skanuje transkrypcję i audio, aby redagować wrażliwe dane klientów. Wykrywa wrażliwe informacje, zastępuje je symbolem zastępczym w transkrypcji i sygnałem dźwiękowym w klipach audio. Historia rozmowy pozostaje dostępna do wglądu, a ekspozycja wrażliwych informacji jest ograniczona. 
  • Tryb bez retencji: Ta konfiguracja jest najlepsza przy rygorystycznych wymaganiach dotyczących retencji. Większość danych w żądaniach i odpowiedziach jest usuwana od razu po zakończeniu żądania. Dotyczy to ruchu API i jest dostępne dla klientów enterprise.

W przypadku wdrożeń związanych z opieką zdrowotną ElevenAgents kwalifikuje się do HIPAA w połączeniu z umowami Business Associate Agreement (BAA), dostępnymi dla klientów enterprise. W połączeniu z podpisaną umową BAA nasz Zero Retention Mode wspiera zgodność z HIPAA, o ile klient odpowiednio skonfiguruje i wykorzysta platformę zgodnie z własnymi wymogami. Pełne informacje o konfiguracji tych ustawień znajdziesz w dokumentacji prywatności ElevenLabs.

Four ElevenAgents privacy controls: retention, audio, redaction, and zero retention mode.

Jak agenty głosowe poprawiają satysfakcję klientów?

Czynniki, które często poprawiają satysfakcję klientów, to wyeliminowanie lub skrócenie czasu oczekiwania, spójność i szybsze rozwiązywanie spraw. Ponieważ agenty głosowe mogą odbierać połączenia bez zwłoki, dzwoniący zwykle otrzymują odpowiedzi tej samej jakości niezależnie od pory dnia. Rutynowe sprawy, które wcześniej czekały w kolejce na konsultanta, są rozwiązywane szybciej. 

Trzeba jednak pamiętać, że gdy interakcja z klientem idzie źle, uwięzienie sfrustrowanego klienta w pętli agenta szkodzi doświadczeniu klienta szybciej niż muzyka na czekanie kiedykolwiek. Wiele organizacji nie mierzy satysfakcji klientów w oderwaniu od innych danych. Raportowane razem z nią wskaźniki obejmują containment rate (odsetek spraw rozwiązanych przez agenta bez udziału człowieka), średni czas obsługi i rozwiązanie sprawy przy pierwszym kontakcie. 

Po zestawieniu w jednym raporcie często opowiadają inną historię niż pojedynczy wskaźnik. Na przykład wysoki containment rate przy spadającej satysfakcji klientów często oznacza, że sprawy są szybko zamykane bez udziału człowieka. 

Admiral to dobry przykład firmy, która przedkłada rozwiązanie sprawy przy pierwszym kontakcie nad containment. Jak omówiono w tym webinarze, firma dążyła do 90% wskaźnika rozwiązania spraw, dostępności 24/7 i realnej poprawy NPS. Przekazanie rozmowy człowiekowi nigdy nie obciążało wyniku agenta, ponieważ rozwiązanie problemu było ważniejsze niż utrzymanie rozmowy w ramach systemu. 

Dowiedz się więcej o tym, jak ta funkcja agenta głosowego łączy się z ich CRM i konfiguracją głosową.

Korzystaj z pełnych możliwości agentów głosowych w ElevenAgents

Możliwości agentów głosowych opisane w tym przewodniku nie są oddzielnymi produktami. Powinny działać w tym samym agencie i tej samej konfiguracji, z odpowiednimi zmiennymi dynamicznymi, narzędziami i ustawieniami prywatności dla potrzeb firmy.

Możesz zacząć od jednego typu połączeń i połączyć go tylko z systemami, których potrzebuje. Gdy wskaźniki potwierdzą, że działa, możesz rozbudować agenta. 

Dowiedz się więcej o ElevenAgents lub skontaktuj się ze sprzedażą i zacznij już dziś.

Wdróż AI enterprise z ElevenAgents już dziś

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

Podobne artykuły

Twórz z najwyższej jakości audio AI