Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Projektowanie Conversational AI: Jak tworzyć bardziej ludzkie doświadczenia użytkownika

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Projektowanie Conversational AI kiedyś oznaczało tworzenie drzewa decyzyjnego. Pierwsze chatboty i menu IVR działały według sztywnych, wcześniej przygotowanych ścieżek: naciśnij 1 w sprawie płatności, powiedz „tak” lub „nie” i miej nadzieję, że pytanie klienta pasuje do jednej z przewidzianych ścieżek. Ten model działał tylko wtedy, gdy rozmowa mieściła się w tym, co już przygotowano.

Agenci AI znieśli to ograniczenie. Mogą teraz analizować rozmowę w czasie rzeczywistym, korzystać z bazy wiedzy, wywoływać narzędzia i pamiętać, co już zostało powiedziane, więc nie ogranicza ich już sztywny skrypt.

Ta zmiana nie wyeliminowała jednak potrzeby projektowania Conversational AI. Podniosła za to poprzeczkę. Bez sztywnego skryptu, na którym można się oprzeć, persona agenta, workflow i punkty decyzyjne muszą być na tyle dobrze zdefiniowane, by sprawdzić się w otwartej rozmowie w czasie rzeczywistym, a nie tylko w z góry określonym scenariuszu.

Ten przewodnik wyjaśnia, czym w praktyce jest projektowanie Conversational AI dla czatu i agentów głosowych, dlaczego ma znaczenie dla metryk, z których jesteś rozliczany, oraz co optymalizować, aby rozmowa była bardziej naturalna. Dopracuj to, a wdrożysz agentów AI, którzy lepiej łączą się z klientami i zapewniają szybszą, lepszą obsługę.

Podsumowanie

  • Projektowanie Conversational AI określa, jak strukturyzowana i optymalizowana jest komunikacja agenta AI, aby rozmowa była naturalna.
  • Voice AI wybacza mniej niż tekst, ponieważ problemy z głosem, opóźnieniami i timingiem, które w interfejsie czatu mogą pozostać niezauważone, sprawiają, że rozmowa głosowa brzmi robotycznie.
  • ElevenAgents pozwala tworzyć naturalnie brzmiących agentów AI do rozmów głosowych i czatu dzięki funkcjom, które dają kontrolę nad głosem, personą i przebiegiem rozmowy oraz pozwalają optymalizować opóźnienia w każdym kanale.

Czym jest projektowanie Conversational AI?

Projektowanie Conversational AI to praktyka UX polegająca na konfigurowaniu zachowania agenta AI. Obejmuje wszystko: od jego persony po zabezpieczenia, workflow i bazy wiedzy, z których korzysta — tak, by rozmowa była równie dopracowana jak każda inna część doświadczenia z produktem.

Ta konfiguracja nie wszędzie wygląda tak samo. Agenci mogą działać w wielu kanałach, takich jak czat, głos czy SMS, z jednej konfiguracji. Każdy z nich ma własne ograniczenia, ale w głosie są one największe. Gdy głos jest jednym z kanałów agenta, musi on wybrać i wygenerować głos, zarządzać tempem i zmianą tur w czasie rzeczywistym oraz odpowiedzieć, zanim pauza zacznie brzmieć jak zerwane połączenie. W czacie nie jest to tak konieczne, ponieważ lekko opóźniona lub niedoskonała odpowiedź rzadko przerywa interakcję.

Oto, co warto uwzględnić przy wdrażaniu Conversational AI dla agenta czatowego oraz co dodatkowo wnosi głos.

Feature
Chat
Voice
Latency
Small delays are unnoticeable, and there is often more time to think as users type their own answers.
Voice agents have almost no room for delay. A pause that's fine in a chat window reads as dead air on a call, and the customer assumes it dropped.
Persona
Comes through in font, color, and word choice.
Persona also has to come through in accent, pacing, and tone, since the customer hears it instead of reading it.
Conversation flow
Messages simply queue up. No turn-taking, interruption handling, or silence detection needed.
The agent has to decide, in real time, when the customer is done talking and when it’s safe to respond.
Language and accent
The agent just needs to detect and match the right language.
The agent also has to get the accent right, since language detection alone won't catch it.

Klienci nie oceniają świadomie każdego z tych czynników. Po prostu zauważają, gdy coś nie gra, a to wystarczy, by podważyć zaufanie do całego agenta i zagrozić celom, dla których został wdrożony.

Dlaczego projektowanie Conversational AI ma znaczenie dla dobrego doświadczenia użytkownika

Każdy z opisanych wyżej czynników — od zmiany tur po opóźnienia i personę — wpływa na to, jak klient postrzega twoją markę w kluczowym momencie, który może uczynić go jej ambasadorem lub krytykiem. To postrzeganie bezpośrednio wpływa na metryki, z których rozliczane są zespoły.

  • Wyższa satysfakcja i skuteczność rozwiązywania spraw: Klienci lepiej oceniają interakcję, gdy agent szybko odpowiada i nie przerywa niezręcznie.
  • Mniej porzuconych rozmów: Klienci rezygnują z rozmowy nie tylko przez długie oczekiwanie. Przekaz, który nie spełnia oczekiwań — niezręczna cisza podczas rozmowy czy sztywna, niepasująca do marki odpowiedź na czacie — może wywołać tę samą chęć zakończenia rozmowy.
  • Szybsze rozwiązanie sprawy: Jasne ustawienia przebiegu rozmowy i dobrze rozpisane workflow oznaczają mniej ślepych zaułków, powtarzanych pytań i sytuacji „połączę cię z innym działem”.
  • Mniej eskalacji do konsultantów: Gdy agent naturalnie prowadzi rozmowę i realizuje określony workflow, częściej rozwiązuje sprawę za pierwszym razem, zamiast zdezorientować klienta tak, że prosi o rozmowę z człowiekiem.

Przykładem jest eDreams ODIGEO, jedna z największych na świecie platform turystycznych online. Firma wdrożyła agentów AI z ElevenAgents w pięciu głównych językach i odnotowała dwucyfrową poprawę szybkości rozwiązywania spraw oraz dwucyfrowy spadek liczby przekierowań połączeń. Częściowo umożliwiła to synteza głosu o niskich opóźnieniach i dokładniejsze rozpoznawanie intencji na początku każdego połączenia. Takie wyniki zależą od wielu czynników wykraczających poza samo projektowanie rozmowy, ale pokazują możliwości dobrego projektowania Conversational AI.

Jak działa projektowanie Conversational AI w ElevenAgents

W ElevenAgents możesz optymalizować personę, głos, zmianę tur, przekazania i opóźnienia — czyli czynniki decydujące o tym, czy agent wydaje się ludzki. Oto jak skonfigurować i zoptymalizować każdy z nich, aby agent dobrze sprawdzał się w prawdziwej rozmowie.

Persona i wybór głosu

Persona tworzy pierwsze wrażenie klienta, a niedopasowanie podważa zaufanie, zanim rozmowa w ogóle się zacznie. Persona zbyt sztywna dla przyjaznej marki detalicznej sprawia, że klienci zaczynają wątpić w agenta, zanim powie coś przydatnego. Zacznij ją kształtować w system prompt, gdzie definiujesz rolę agenta, jego osobowość i zabezpieczenia przed wszystkim innym.

W przypadku agentów głosowych persona musi też wybrzmieć w samym głosie. Głos zbyt swobodny dla rozmowy finansowej wysyła taki sam sygnał jak niedopasowana persona w tekście, więc wybór głosu staje się częścią tego samego zadania. Zacznij od tego:

  • Wybór głosu: Dopasuj głos do marki, odbiorców i tematu. Akcent, płeć i ton pomagają budować zaufanie rozmówcy oraz nadają rozmowie właściwy charakter.
  • Obsługa wielu języków: Wybierz głos dla każdego obsługiwanego języka, zamiast używać jednego głosu na wszystkich rynkach. Jeden głos wymuszony w wielu językach zwykle brzmi obco przynajmniej w jednym z nich, co podważa zaufanie, które chcesz budować.

ElevenAgents daje dostęp do ponad 11 000 głosów w Voice Library, gdzie możesz wyszukiwać według akcentu, charakteru i zastosowania, więc rzadko zaczynasz od zera. Jeśli żaden nie pasuje, masz jeszcze dwie opcje: sklonować istniejący głos z krótkiej próbki audio lub zaprojektować go od podstaw za pomocą promptu tekstowego opisującego oczekiwany wiek, akcent, ton i tempo.

Ustawienia przebiegu rozmowy

W rozmowie głosowej czas jest szczególnie ważny. W przeciwieństwie do czatu, gdzie pauza to tylko puste miejsce, przerwa w rytmie rozmowy natychmiast brzmi jak cisza w słuchawce lub zerwane połączenie. Właściwy rytm to najważniejszy czynnik, dzięki któremu agent głosowy wydaje się naturalnym uczestnikiem rozmowy. Zaczyna się od samego modelu zmiany tur.

Model zmiany tur ElevenLabs to system oparty na badaniach, który wykrywa, kiedy rozmówca faktycznie skończył mówić, a nie tylko robi pauzę. Dzięki temu określa, kiedy agent powinien odpowiedzieć, zamiast zgadywać na podstawie stałego opóźnienia.

Dodatkowo możesz dostosować kilka ustawień, aby poprawić przebieg rozmowy:

  • Limit czasu tury: Czas, przez jaki agent czeka w ciszy przed odpowiedzią, aby nie wchodzić klientowi w słowo, gdy ten jeszcze myśli, ani nie zostawiać go bez odpowiedzi po zakończeniu wypowiedzi.
  • Miękki limit czasu: Krótka fraza wypełniająca, której agent używa podczas przetwarzania, np. „Chwileczkę” lub „Już sprawdzam”, aby klient nie pomyślał, że połączenie zostało zerwane. Unikaj fraz obiecujących konkretny czas, takich jak „jedna sekunda”, ponieważ rzeczywisty czas odpowiedzi jest różny.
  • Przerywanie: Określa, czy agent przestaje mówić, gdy klient zaczyna mu przerywać. Włącz tę opcję, aby rozmowa była naturalna. Wyłącz ją, gdy ważne jest przekazanie całej treści — w przypadku informacji prawnych, instrukcji bezpieczeństwa i wszystkiego, co musi zostać wysłuchane do końca.
  • Szybkość przejmowania tury: Określa, jak szybko agent odpowiada po tym, jak klient skończy mówić. „Szybko” sprawdza się w obsłudze klienta, gdzie liczą się błyskawiczne odpowiedzi. „Cierpliwie” najlepiej działa przy zbieraniu danych klienta, takich jak numer telefonu czy adres e-mail, aby agent nie przerwał w połowie cyfry. „Normalnie” to dobry wybór domyślny dla ogólnej rozmowy.

Niewielkie zmiany w tych ustawieniach dają duży efekt. Nawet drobna zmiana limitu czasu może decydować o tym, czy agent wydaje się uważny, czy sprawia wrażenie, że przerywa rozmówcom.

Workflow, projektowanie przekazań i skrypty

Workflow to miejsce, gdzie w ElevenAgents projektowanie Conversational AI staje się praktyką. Definiują, co dzieje się i kiedy: punkty decyzyjne, ścieżki eskalacji, przekazania — wszystko, co w przeciwnym razie agent musiałby improwizować.

Workflow współpracują z dwoma innymi systemami, aby dopracować agenta. System prompt określa podstawowe zachowanie agenta — jego rolę, ton oraz to, co może i czego nie może mówić — w kluczowych momentach, takich jak powitanie czy przekazanie. Procedury to bardziej precyzyjna opcja dla jednego, jasno określonego zadania, np. weryfikacji tożsamości klienta lub obsługi zwrotu. Zamiast rozgałęziać się zależnie od słów klienta, realizują stałą sekwencję od początku do końca, krok po kroku, niezależnie od przebiegu rozmowy.

Najłatwiej zacząć budowę agenta, korzystając z gotowych szablonów agentów, które zawierają punkt wyjścia dla workflow i system promptów. Dzięki temu dopracowujesz, zamiast budować od zera. Oto zmiany, od których możesz zacząć, aby dostosować je do swoich potrzeb:

  • Mapowanie decyzji: Dokładnie rozpisz, co agent robi w każdym punkcie decyzyjnym, aby cała rozmowa była zdefiniowana od rozpoczęcia do rozwiązania sprawy. Węzły subagentów pozwalają dostosować system prompt, model, a nawet głos w konkretnych punktach przebiegu, dzięki czemu wrażliwy etap weryfikacji może działać z bardziej restrykcyjnymi zabezpieczeniami niż luźna rozmowa na początku połączenia.
  • Wyzwalacze eskalacji: Zdefiniuj jasne wyzwalacze przekazania sprawy człowiekowi, wbudowane w workflow, zamiast pozostawiać decyzję agentowi w danej chwili. Eskaluj na przykład, gdy problem nie zostanie rozwiązany po dwóch próbach, klient prosi o przełożonego albo transakcja jest na tyle wrażliwa lub wartościowa, że wymaga udziału człowieka.
  • Kontekst przekazania: W system prompt określ, jakie dane agent ma zebrać przed przekazaniem, np. identyfikator zamówienia lub numer konta, oraz warunki uruchamiające przekazanie. Następnie przypisz zapisane dane do konfiguracji narzędzia przekazywania, aby zostały przeniesione automatycznie, zamiast zmuszać klienta do powtarzania ich konsultantowi.
  • Gotowe sformułowania: Zdefiniuj dokładne brzmienie kluczowych komunikatów w system prompt. Powitania, komunikaty o błędach, informacje prawne i przekazania eskalacji nigdy nie powinny być pozostawione improwizacji agenta. Dokładny komunikat, taki jak „Mam teraz problem z dostępem do tych informacji”, jest pewniejszy niż poleganie na tym, że agent sam zgadnie, jak się wyrazić, gdy coś przestanie działać.

Sam workflow jest tworzony w ElevenAgents jako wizualny graf, w którym każdy punkt decyzyjny i wyzwalacz eskalacji jest przedstawiony jako węzeł, który możesz bezpośrednio zobaczyć i edytować.

Conversational AI design. Workflow interface for managing agent transfers and meetings in ElevenLabs platform.

Po uruchomieniu analityka nakłada dane z prawdziwych rozmów na ten sam graf, dzięki czemu dokładnie widzisz, gdzie klienci się blokują lub rezygnują, i możesz to poprawić bez zgadywania.

Opóźnienia i wydajność

Opóźnienia są jednym z najważniejszych czynników decydujących o tym, czy interakcja wydaje się ludzka. Powolna odpowiedź to jeden z najszybszych sposobów, by przypomnieć klientowi, że rozmawia z maszyną — nawet jeśli wszystko inne przebiega dobrze.

Każdy etap procesu dodaje własne opóźnienie, niezależnie od tego, czy agent działa na czacie, czy głosowo. Niektóre dotyczą obu przypadków, a inne tylko rozmów głosowych.

  • LLM: Każdy wybór modelu to kompromis między kosztem, jakością rozumowania i szybkością, a właściwa równowaga zależy od rozmowy. Proste, częste interakcje, takie jak FAQ czy potwierdzanie wizyt, mogą działać na szybszym, lżejszym modelu bez pogorszenia doświadczenia. W przypadku bardziej złożonych zadań, takich jak doradztwo finansowe lub wieloetapowe rozwiązywanie problemów, zwykle warto zapłacić za model o lepszym rozumowaniu, nawet jeśli odpowiada trochę wolniej.
  • Baza wiedzy i RAG: Każde wyszukanie w bazie wiedzy dodaje pełny cykl komunikacji, zanim agent odpowie, więc zwięzła, ukierunkowana baza wiedzy działa szybciej niż taka, którą agent musi szeroko przeszukiwać.
  • Integracje i wywołania narzędzi: Każde wywołanie zewnętrznego narzędzia, np. sprawdzenie zamówienia w Salesforce lub dostępności w kalendarzu, dodaje własny cykl komunikacji. Pisz jasne opisy narzędzi, aby agent nie wahał się, którego użyć, i wywołuj tylko narzędzia faktycznie potrzebne w rozmowie.
  • Lokalizacja i hosting danych: Dopasuj region ElevenAgents do lokalizacji hostowanych danych, a w przypadku wdrożeń telefonicznych także do regionu dostawcy telefonii (Twilio, SIP lub innego). Jeśli region agenta i region bramki połączeń znajdują się po przeciwnych stronach świata, ta odległość dodaje opóźnienie, zanim rozmowa w ogóle się zacznie.
  • Zamiana mowy na tekst (tylko głos): Scribe transkrybuje słowa klienta, zanim agent będzie mógł je przeanalizować. Do rozmów na żywo używaj wersji działającej w czasie rzeczywistym (Scribe v2 Realtime), a nie wersji wsadowej, stworzonej z myślą o dokładności, nie szybkości.
  • Zmiana tur (tylko głos): Określa, kiedy agent w ogóle decyduje się odpowiedzieć; temat opisaliśmy szczegółowo wyżej. Warto pamiętać, że sama w sobie wpływa na opóźnienia, ponieważ model, który zwleka z wykryciem końca tury, dodaje zwłokę, zanim ruszy reszta procesu.
  • Text to Speech i wybór głosu (tylko głos): Głosy domyślne i syntetyczne oraz Instant Voice Clones odpowiadają szybciej niż Professional Voice Clones. Korzystaj z Professional Voice Clones tylko wtedy, gdy dodatkowa wierność brzmienia jest warta kompromisu w postaci opóźnienia.

Więcej o opóźnieniach znajdziesz w sprawdzonych metodach optymalizacji opóźnień oraz w opisie sposobu mierzenia i raportowania opóźnień na całej ścieżce przetwarzania.

Zaprojektuj pierwszego agenta z ElevenAgents

Opisane tu elementy pokazują, czym w praktyce jest projektowanie Conversational AI dla agenta AI. Wszystko to jest natywne dla ElevenAgents i konfigurowalne w konsoli no-code, więc możesz stworzyć agenta, który prowadzi prawdziwą rozmowę, a nie tylko poprawnie odpowiada na pytania.

Zespołom, które chcą uzyskać praktyczną pomoc, zespół ElevenLabs Forward Deployed Engineers pomaga bezpośrednio określić zakres, zbudować i uruchomić agenta gotowego do produkcji, a następnie dalej dostraja jego wydajność po wdrożeniu.

Niezależnie od tego, czy budujesz go samodzielnie, czy korzystasz ze wsparcia, najszybciej zobaczysz różnicę, gdy go wypróbujesz. Zacznij już dziś, tworząc agenta lub rozmawiając z naszym zespołem sprzedaży.

Stwórz z naszym zespołem agenta gotowego do produkcji

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

FAQ o projektowaniu Conversational AI

Podobne artykuły

Twórz z najwyższej jakości audio AI