Projektowanie Conversational AI: Jak tworzyć bardziej ludzkie doświadczenia użytkownika
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Projektowanie Conversational AI oznaczało kiedyś tworzenie drzewa decyzyjnego. Wczesne chatboty i menu IVR działały według sztywnych, gotowych gałęzi: naciśnij 1 w sprawie płatności, powiedz „tak” lub „nie” i miej nadzieję, że pytanie klienta pasuje do jednej z przewidzianych ścieżek. Ten model działał tylko wtedy, gdy rozmowa mieściła się w tym, co wcześniej zaprojektowano.
Agenci AI usunęli to ograniczenie. Mogą teraz analizować rozmowę w czasie rzeczywistym, korzystać z bazy wiedzy, wywoływać narzędzia i pamiętać, co już powiedziano, więc nie są ograniczeni sztywnym skryptem.
Ta zmiana nie wyeliminowała jednak potrzeby projektowania Conversational AI. Podniosła poprzeczkę. Bez sztywnego skryptu, do którego można wrócić, persona agenta, workflow i punkty decyzyjne muszą być zdefiniowane na tyle dobrze, by sprawdzały się w otwartej rozmowie w czasie rzeczywistym, a nie tylko w z góry ustalonej.
Ten przewodnik wyjaśnia, czym w praktyce jest projektowanie Conversational AI dla czatu i agentów głosowych, dlaczego ma znaczenie dla wskaźników, z których jesteś rozliczany, oraz co optymalizować, by rozmowa brzmiała naturalniej. Zrób to dobrze, a wdrożysz agentów AI, którzy budują relacje z klientami i zapewniają szybszą, lepszą obsługę.
Podsumowanie
- Projektowanie Conversational AI określa, jak uporządkowana i zoptymalizowana jest komunikacja agenta AI, aby rozmowa wydawała się naturalna.
- Głosowe AI wybacza mniej niż tekst, ponieważ problemy z głosem, opóźnieniami i timingiem, niezauważalne w czacie, mogą sprawić, że rozmowa głosowa zabrzmi robotycznie.
- ElevenAgents umożliwia tworzenie ludzkich agentów AI do rozmów głosowych i czatu dzięki funkcjom, które pozwalają kontrolować głos, personę i przebieg rozmowy oraz optymalizować opóźnienia w każdym kanale.
Czym jest projektowanie Conversational AI?
Projektowanie Conversational AI to obszar UX, który dotyczy konfiguracji zachowania agenta AI. Obejmuje wszystko: od persony po zabezpieczenia, workflow i bazy wiedzy, z których korzysta agent. Wszystkie te elementy współpracują, by rozmowa była tak dopracowana jak każda inna część doświadczenia z produktem.
Ta konfiguracja nie wszędzie wygląda tak samo. Agenci mogą działać w wielu kanałach, takich jak czat, rozmowy głosowe czy SMS, na podstawie jednej konfiguracji. Każdy z nich ma własne ograniczenia, ale w głosie są one największe. Gdy głos jest jednym z kanałów agenta, musi on wybrać i generować głos, zarządzać tempem i kolejnością wypowiedzi w czasie rzeczywistym oraz odpowiedzieć, zanim przerwa zacznie brzmieć jak zerwane połączenie. W przeciwieństwie do czatu, gdzie nieco wolniejsza lub niedoskonała odpowiedź rzadko psuje interakcję, nic z tego nie jest opcjonalne.
Oto, co trzeba uwzględnić przy wdrażaniu Conversational AI dla agenta czatowego oraz co dodatkowo wnosi głos.
Klienci nie oceniają świadomie każdego z tych czynników. Po prostu zauważają, gdy coś nie gra, a to wystarczy, by osłabić zaufanie do całego agenta i zagrozić celom, dla których go wdrożono.
Dlaczego projektowanie Conversational AI ma znaczenie dla dobrego doświadczenia użytkownika
Każdy z opisanych wyżej czynników — od kolejności wypowiedzi po opóźnienia i personę — wpływa na to, jak klient postrzega twoją markę w ważnym momencie, który może uczynić go jej zwolennikiem lub krytykiem. To postrzeganie bezpośrednio przekłada się na wskaźniki, z których rozliczane są zespoły.
- Wyższa satysfakcja i skuteczność rozwiązywania spraw: Klienci oceniają interakcję lepiej, gdy agent odpowiada szybko i nie przerywa niezręcznie.
- Mniej porzuconych rozmów: Klienci rezygnują z rozmowy nie tylko przez długie oczekiwanie. Odpowiedź niespełniająca oczekiwań — niezręczna cisza podczas rozmowy czy sztywna, niepasująca do marki odpowiedź na czacie — może wywołać tę samą chęć zakończenia rozmowy.
- Szybsze rozwiązanie sprawy: Jasne ustawienia przebiegu rozmowy i dobrze rozpisane workflow oznaczają mniej ślepych zaułków, powtarzanych pytań i sytuacji „połączę cię z innym działem”.
- Mniej eskalacji do ludzkich agentów: Gdy agent naturalnie prowadzi rozmowę i trzyma się ustalonego workflow, częściej rozwiązuje sprawę za pierwszym razem, zamiast dezorientować klienta tak, że prosi o rozmowę z człowiekiem.
Przykładem jest eDreams ODIGEO, jedna z największych internetowych platform turystycznych na świecie. Firma wdrożyła agentów AI z ElevenAgents w pięciu głównych językach i odnotowała dwucyfrową poprawę szybkości rozwiązywania spraw oraz dwucyfrowy spadek liczby przekierowań rozmów. Przyczyniły się do tego m.in. synteza głosu o niskich opóźnieniach i trafniejsze rozpoznawanie intencji na początku każdej rozmowy. Takie wyniki zależą od wielu czynników wykraczających poza samo projektowanie rozmowy, ale pokazują, co umożliwia dobre projektowanie Conversational AI.
Jak działa projektowanie Conversational AI w ElevenAgents
W ElevenAgents możesz optymalizować personę, głos, kolejność wypowiedzi, przekazania rozmowy i opóźnienia — czyli czynniki decydujące o tym, czy agent brzmi po ludzku. Oto jak skonfigurować i optymalizować każdy z nich, aby agent dobrze radził sobie w prawdziwej rozmowie.
Persona i wybór głosu
Persona kształtuje pierwsze wrażenie klienta, a niedopasowanie podważa zaufanie, zanim rozmowa w ogóle się zacznie. Persona zbyt sztywna dla przyjaznej marki handlowej sprawia, że klienci zaczynają wątpić w agenta, zanim powie coś użytecznego. Zacznij ją określać w system prompt, gdzie definiujesz rolę agenta, jego osobowość i zabezpieczenia przed wszystkim innym.
W przypadku agentów głosowych persona musi też wybrzmiewać w głosie. Głos zbyt swobodny dla rozmowy finansowej wysyła ten sam sygnał co niedopasowana persona w tekście, więc wybór głosu jest częścią tego samego zadania. Zacznij od tego:
- Wybór głosu: Dopasuj głos do marki, odbiorców i tematu. Akcent, płeć i ton pomagają budować zaufanie rozmówcy i nadają ton rozmowie.
- Obsługa wielu języków: Wybierz głos dla każdego obsługiwanego języka, zamiast używać jednego głosu na wszystkich rynkach. Jeden głos wymuszony w wielu językach zwykle brzmi obco w co najmniej jednym z nich, co osłabia budowane zaufanie.
ElevenAgents daje dostęp do ponad 11 000 głosów w Voice Library, gdzie możesz wyszukiwać według akcentu, charakteru i zastosowania, więc rzadko zaczynasz od zera. Jeśli żaden nie pasuje, masz jeszcze dwie opcje: sklonować istniejący głos z krótkiej próbki audio albo zaprojektować własny od podstaw za pomocą promptu tekstowego opisującego oczekiwany wiek, akcent, ton i tempo.
Ustawienia przebiegu rozmowy
W rozmowach głosowych czas ma największe znaczenie. W czacie przerwa to tylko puste miejsce, ale w rozmowie telefonicznej zaburzenie rytmu od razu brzmi jak cisza lub zerwane połączenie. Ustawienie właściwego rytmu to najważniejszy sposób, by agent głosowy wydawał się naturalnym uczestnikiem rozmowy. Zaczyna się od samego modelu kolejności wypowiedzi.
Model kolejności wypowiedzi ElevenLabs, oparty na badaniach, wykrywa, czy rozmówca rzeczywiście skończył mówić, a nie tylko zrobił pauzę. Dzięki temu określa, kiedy agent powinien odpowiedzieć, zamiast zgadywać na podstawie stałego opóźnienia.
Oprócz tego możesz dostosować kilka ustawień, aby poprawić przebieg rozmowy:
- Limit czasu tury: Czas, przez który agent czeka w ciszy przed odpowiedzią, aby nie wtrącić się, gdy klient jeszcze myśli, ani nie zostawić go bez odpowiedzi po zakończeniu wypowiedzi.
- Miękki limit czasu: Krótka fraza wypełniająca, której agent używa podczas przetwarzania, np. „Chwileczkę” lub „Już sprawdzam”, aby klient nie sądził, że połączenie zostało zerwane. Unikaj zwrotów obiecujących konkretny czas, np. „sekundkę”, bo rzeczywisty czas odpowiedzi bywa różny.
- Przerwania: Czy agent przestaje mówić, gdy klient zaczyna mu przerywać. Włącz tę opcję, by rozmowa brzmiała naturalnie. Wyłącz ją, gdy ważne jest pełne przekazanie treści: w zastrzeżeniach prawnych, instrukcjach bezpieczeństwa i wszędzie tam, gdzie całość musi zostać usłyszana.
- Szybkość reakcji: Jak szybko agent odpowiada, gdy klient przestaje mówić. „Szybka” sprawdza się w obsłudze klienta, gdzie liczą się krótkie czasy odpowiedzi. „Cierpliwa” jest najlepsza przy zbieraniu danych klienta, np. numeru telefonu lub adresu e-mail, aby agent nie przerwał w połowie cyfry. „Normalna” to dobry wybór domyślny dla zwykłych rozmów.
Małe zmiany dają tu duży efekt. Nawet niewielka korekta limitu czasu może zdecydować, czy agent wydaje się uważny, czy sprawia wrażenie, że przerywa rozmówcom.
Workflow, projektowanie przekazań i skrypty
Workflow to miejsce, gdzie w ElevenAgents projektowanie Conversational AI trafia do praktyki. Definiują, co dzieje się i kiedy: punkty decyzyjne, ścieżki eskalacji, przekazania rozmów — wszystko, co w innym przypadku agent musiałby improwizować.
Workflow współpracują z dwoma innymi systemami, które pomagają dopracować agenta. System prompt definiuje kluczowe zachowania agenta — jego rolę, ton oraz to, co może i czego nie może mówić — w ważnych momentach, takich jak powitania czy przekazania rozmowy. Procedury to bardziej szczegółowa opcja dla jednego, jasno określonego zadania, np. weryfikacji tożsamości klienta lub obsługi zwrotu. Zamiast rozgałęziać się zależnie od tego, co mówi klient, prowadzą przez stałą sekwencję krok po kroku, od początku do końca, niezależnie od przebiegu rozmowy.
Najłatwiej zacząć tworzenie agenta od użycia gotowych szablonów agentów, które zawierają punkt wyjścia dla workflow i system promptów. Dzięki temu dostrajasz agenta zamiast budować go od zera. Oto zmiany, od których możesz zacząć, by je dopasować:
- Mapowanie decyzji: Dokładnie rozpisz działania agenta w każdym punkcie decyzyjnym, aby cała rozmowa była określona od otwarcia po rozwiązanie sprawy. Węzły subagentów pozwalają zmienić system prompt, model, a nawet głos w konkretnych miejscach przebiegu, dzięki czemu wrażliwy etap weryfikacji może działać z bardziej rygorystycznymi zabezpieczeniami niż luźna rozmowa na początku połączenia.
- Wyzwalacze eskalacji: Zdefiniuj jasne wyzwalacze przekazania sprawy człowiekowi, wbudowane w workflow zamiast pozostawione agentowi do decyzji w danej chwili. Eskaluj np. wtedy, gdy problem pozostaje nierozwiązany po dwóch próbach, klient prosi o przełożonego albo transakcja jest na tyle wrażliwa lub wartościowa, że wymaga udziału człowieka.
- Kontekst przekazania: W system prompt określ, co agent powinien zebrać przed przekazaniem rozmowy, np. ID zamówienia lub numer konta, oraz warunki wyzwalające przekazanie. Następnie przypisz te zapisane dane do konfiguracji narzędzia przekazywania rozmów, aby zostały przeniesione automatycznie, zamiast klient musiał powtarzać je konsultantowi.
- Gotowe sformułowania: W system prompt zdefiniuj dokładne brzmienie komunikatów w kluczowych momentach. Powitania, komunikaty o błędach, zastrzeżenia prawne i przekazania przy eskalacji nigdy nie powinny być improwizowane przez agenta. Dokładna fraza, np. „Mam teraz problem z dostępem do tych informacji”, jest pewniejsza niż pozwalanie agentowi zgadywać, jak to ująć, gdy coś przestanie działać.
Sam workflow jest w ElevenAgents tworzony jako wizualny graf, w którym każdy punkt decyzyjny i wyzwalacz eskalacji jest węzłem widocznym i edytowalnym bezpośrednio.

Po uruchomieniu analityka nakłada dane z prawdziwych rozmów na ten sam graf, więc dokładnie widzisz, gdzie klienci się blokują lub rezygnują, i możesz to naprawić bez zgadywania.
Opóźnienia i wydajność
Opóźnienie to jeden z najważniejszych czynników decydujących o tym, czy interakcja wydaje się ludzka. Wolna odpowiedź szybko przypomina klientowi, że rozmawia z maszyną, nawet jeśli reszta rozmowy przebiega dobrze.
Każdy element pipeline’u dodaje własne opóźnienie, niezależnie od tego, czy agent działa na czacie, czy głosowo. Niektóre dotyczą obu przypadków, a inne tylko rozmów głosowych.
- LLM: Wybór każdego modelu to kompromis między kosztem, jakością rozumowania i szybkością, a właściwy balans zależy od rozmowy. Proste, częste interakcje, takie jak FAQ czy potwierdzenia wizyt, mogą działać na szybszym, lżejszym modelu bez pogorszenia doświadczenia. W przypadku bardziej złożonych zadań, np. doradztwa finansowego lub wieloetapowego rozwiązywania problemów, zwykle warto zapłacić za model o lepszym rozumowaniu, nawet jeśli odpowiada trochę wolniej.
- Baza wiedzy i RAG: Każde wyszukiwanie w bazie wiedzy wymaga dodatkowej rundy przed odpowiedzią agenta, dlatego zwięzła, skoncentrowana baza odpowiada szybciej niż taka, którą agent musi szeroko przeszukiwać.
- Integracje i wywołania narzędzi: Każde wywołanie zewnętrznego narzędzia, np. sprawdzenie zamówienia w Salesforce lub dostępności w kalendarzu, dodaje własną rundę komunikacji. Pisz jasne opisy narzędzi, by agent nie wahał się, którego użyć, i wywołuj tylko te narzędzia, których rozmowa naprawdę potrzebuje.
- Lokalizacja i hosting danych: Dopasuj region ElevenAgents do miejsca hostowania danych, a w przypadku wdrożeń telefonicznych także do regionu dostawcy telefonii — Twilio, SIP lub innego. Jeśli region agenta i region bramki połączeń znajdują się po przeciwnych stronach świata, już ta różnica zwiększa opóźnienie, zanim rozmowa się zacznie.
- Speech-to-text (tylko głos): Scribe transkrybuje wypowiedź klienta, zanim agent będzie mógł ją przeanalizować. Do rozmów na żywo używaj wersji czasu rzeczywistego (Scribe v2 Realtime), a nie wersji batch, która stawia dokładność ponad szybkością.
- Kolejność wypowiedzi (tylko głos): Określa, kiedy agent w ogóle decyduje się odpowiedzieć; omówiliśmy to wyżej. Warto pamiętać, że samo w sobie wpływa na opóźnienie, ponieważ model, który zwleka z wykryciem końca wypowiedzi, dodaje czas, zanim wystartuje reszta pipeline’u.
- Text-to-speech i wybór głosu (tylko głos): Głosy domyślne i syntetyczne oraz Instant Voice Clones odpowiadają szybciej niż Professional Voice Clones. Używaj Professional Voice Clones tylko tam, gdzie dodatkowa wierność brzmienia jest warta kompromisu w postaci opóźnień.
Więcej o opóźnieniach znajdziesz w dobrych praktykach optymalizacji opóźnień oraz w opisie tego,jak opóźnienia są mierzone i raportowane w całym pipeline’ie.
Zaprojektuj pierwszego agenta z ElevenAgents
Opisane tu elementy pokazują, co projektowanie Conversational AI oznacza w praktyce dla agenta AI. Wszystko to jest natywne dla ElevenAgents i można skonfigurować w konsoli no-code, aby stworzyć agenta, który prowadzi prawdziwą rozmowę, a nie tylko poprawnie odpowiada na pytania.
Zespołom, które chcą praktycznej pomocy, inżynierowie ElevenLabs Forward Deployed Engineers pomagają bezpośrednio określić zakres, zbudować i uruchomić gotowego do produkcji agenta, a następnie dostrajają jego wydajność po wdrożeniu.
Niezależnie od tego, czy tworzysz go samodzielnie, czy korzystasz ze wsparcia, najszybciej zobaczysz różnicę, gdy go wypróbujesz. Zacznij już dziś, tworząc agenta lub rozmawiając z naszym zespołem sprzedaży.



