Podsumowanie webinaru: Jak tworzyć naturalnie brzmiące AI Agents
- Autor
- Luigi Sambuy
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Większość zespołów chce stworzyć agenta, który brzmi naturalnie.
Problem, z którym mierzy się większość zespołów, to agenci, którzy wykonują zadanie, ale nie rozumieją kontekstu, pilności ani emocji. Gdy dzwoniący to zauważy, spada zaufanie, a wraz z nim jakość interakcji.
Podczas naszych ostatnich Warsztatów na żywo: Jak budować naturalnie brzmiących agentów AI, Luigi Sambuy (Forward Deployed Engineering) pokazał, co odróżnia robota od agenta, który brzmi naprawdę po ludzku.
Dlaczego naturalne brzmienie jest trudniejsze, niż się wydaje
Większość zespołów wdrażających agentów rozwiązała już kwestię dokładności — agent podaje właściwą odpowiedź, rezerwuje właściwy stolik, odwołuje właściwy lot.
Trudniej zadbać o właściwy sposób mówienia.
Agent, który nie odzwierciedla emocji dzwoniącego, nie wyczuwa pilności i odpowiada na każde pytanie tym samym płaskim rytmem, zawsze będzie brzmiał sztucznie — niezależnie od tego, jak poprawne są jego odpowiedzi. Klienci chcą nie tylko rozwiązać problem — chcą też czuć, że ktoś ich słucha.
Cztery cechy naturalnie brzmiącego agenta
- Rytm i płynność — naturalne tempo, pauzy i zmiany prędkości zamiast monotonnego odczytu
- Dopasowanie — reagowanie troską na frustrację dzwoniącego, a ciepłem na dobre wiadomości
- Kontekst — wykorzystywanie historii użytkownika, systemów firmowych oraz wskazówek kulturowych i regionalnych, by odpowiedzi nie były ogólnikowe
- Tożsamość — głos stworzony dla marki, a nie gotowy domyślny głos
Demo: naturalnie brzmiący agent w praktyce
Scenariusz: Klient dzwoni do restauracji Rosette, aby przełożyć rezerwację. Obchodzi piątą rocznicę ślubu i się spóźnia.
Co pokazano:
- Agent ciepło rozpoczął rozmowę, wspominając o rocznicy, zanim zrobił cokolwiek innego
- Wychwycił drobną rozbieżność między podaną godziną rezerwacji a faktyczną rezerwacją i dopytał, zamiast zgadywać
- Przełożył rezerwację na 21:00 i bez pytania zaproponował stolik przy oknie na tę okazję
- Przez całą rozmowę agent stosował naturalne pauzy, wypełniacze i ton dopasowany do sytuacji — uspokajający, ciepły, bez pośpiechu
Dlaczego to ważne: Nic z tego nie wynikało z użycia innego modelu ani mocniejszej platformy. Zadecydował prompt. Prompt systemowy pozwolił agentowi poprawiać się w trakcie zdania, naturalnie urywać wypowiedź podczas „szukania informacji” i zmieniać ton emocjonalny, by dopasować go do dzwoniącego — te same techniki są dziś dostępne dla każdego zespołu budującego na naszej platformie.
Siedem sposobów na tworzenie naturalnych agentów
- Tagi emocji — dostępne w trybie ekspresyjnym konwersacyjnego modelu v3; najważniejszy sposób na większą różnorodność tonu
- Dźwięki tła — odgłosy biura, miasta lub pisania na klawiaturze dla bardziej znajomego, ludzkiego kontekstu
- Ton w prompcie systemowym — tu kryje się większość różnicy
- Ustawienia reaktywności (eager / normal / patient) — dopasowane do czasu potrzebnego na interakcję
- Słownik wymowy / słowa kluczowe — dla imion, marek i obcych słów, które agent mógłby inaczej błędnie wymówić.
- Ustawienia wyjścia — niektóre zespoły celowo dodają w tle dzwoniące telefony zamiast nieskazitelnego audio, bo klienci przechodzący z tradycyjnego contact center są przyzwyczajeni do lekko przytłumionego brzmienia
- Voice Design lub klonowanie — tworzenie w pełni własnego głosu dla marki zamiast wybierania gotowego. Voice Design pozwala opisać konkretny głos (np. „mężczyzna po trzydziestce, który brzmi, jakby mówił przez zestaw słuchawkowy”). Voice Cloning obejmuje zarówno natychmiastowy klon (około 30 sekund audio), jak i profesjonalny klon (więcej materiału, wyższa jakość).
Dobre praktyki dla naturalnie brzmiących agentów
Wpisz ton bezpośrednio w prompt systemowy. Tu kryje się większość różnicy między płaskim a naturalnym agentem. Wyraźnie pozwól agentowi poprawiać się w trakcie zdania („tak jak mówią ludzie”), naturalnie urywać wypowiedź podczas szukania informacji i robić pauzę po czymś poważnym, zanim odpowie.
Dopasuj tagi emocji do sytuacji. Tag „excited” nie pasuje do poważnej lub ryzykownej sytuacji. Umieszczaj tagi świadomie tam, gdzie rzeczywiście pojawią się w rozmowie, i dostosowuj je do stanu emocjonalnego dzwoniącego w miarę jej trwania (np. spokojnie i uspokajająco dla zdenerwowanego rozmówcy, a szybko, ale ciepło dla osoby, która się spieszy).
Świadomie ustaw reaktywność.Tryb eager sprawdza się w szybkich rozmowach z dużą ilością informacji, a patient, gdy ktoś potrzebuje czasu, by znaleźć dokument lub numer. Ustawienie wszędzie trybu eager może sprawić, że agent będzie natarczywy zamiast naturalny.
Dobieraj LLM do każdego węzła.Używaj lżejszych, szybszych modeli do prostych kroków przekierowania, a bardziej zaawansowanych do węzłów podejmujących rzeczywiste decyzje.
Traktuj odczuwane opóźnienie jako część „naturalności”.Poza wyborem modelu, spekulacyjne generowanie tury (gdy model zaczyna tworzyć odpowiedź, zanim dzwoniący skończy mówić) i słowa wypełniające przy miękkim limicie czasu skracają odczuwaną długość pauzy, nawet jeśli rzeczywisty czas odpowiedzi się nie zmienia.
Lokalizuj zamiast tłumaczyć.Wybieraj głosy faktycznie wytrenowane w języku docelowym, używaj słownika wymowy, a przy zastosowaniach w jednym języku rozważ napisanie samego promptu w tym języku, by poprawić wyniki. Multilingual v2 pozostaje solidną opcją, gdy niskie opóźnienia między językami są ważniejsze niż szeroki zakres ekspresji.
Monitoruj swojego agenta.Korzystaj z testów symulacyjnych, by sprawdzać agenta bez prawdziwych rozmów, kryteriów oceny zaliczone/niezaliczone po rozmowie oraz analizy sentymentu tura po turze, by dokładnie wykryć, gdzie w rozmowie agent użył niewłaściwego tonu — a następnie wykorzystaj ten sygnał do dostrojenia promptu.
Obejrzyj pełną sesję
Obejrzyj pełny webinar tutaj.





