Webbinar-sammanfattning: Bygg AI-agenter som låter naturliga
- Skriven av
- Luigi Sambuy
- Publicerad
- Senast uppdaterad
LyssnaLyssna på den här artikeln
De flesta team vill bygga en agent som låter naturlig.
Det många team saknar är en agent som inte bara slutför uppgiften, utan också förstår sammanhang, brådska och känslor. När en uppringare märker att det brister, minskar både förtroendet och kvaliteten på interaktionen.
I vår senaste Live Workshop: Bygga AI-agenter som låter naturliga, gick Luigi Sambuy (Forward Deployed Engineering) igenom vad som skiljer en robotliknande agent från en som känns genuint mänsklig.
Varför det är svårare än det verkar att låta naturlig
De flesta team som använder agenter har redan löst noggrannheten – agenten ger rätt svar, bokar rätt bord och avbokar rätt flyg.
Det svårare är att få leveransen rätt.
En agent som inte speglar uppringarens känslor, inte uppfattar brådska och svarar på varje fråga i samma platta rytm kommer alltid att uppfattas som artificiell, oavsett hur korrekta svaren är. Kunder vill inte bara få sitt problem löst – de vill känna sig hörda under tiden.
Fyra egenskaper hos en agent som låter naturlig
- Rytm och flyt – naturligt tempo, pauser och varierad hastighet i stället för ett monotont uppläsningssätt
- Spegling – att bemöta en frustrerad uppringare med omtanke och goda nyheter med värme
- Sammanhang – att använda användarhistorik, verksamhetssystem och kulturella/regionala signaler så att svaren inte blir generiska
- Identitet – en röst som faktiskt är skapad för varumärket, inte ett standardval från hyllan
Demo: En naturligt låtande agent i praktiken
Scenario: En kund ringer Rosette Restaurant för att flytta sin bokning. Det är deras femte bröllopsdag och de blir sena.
Det här visas:
- Agenten inledde varmt och uppmärksammade bröllopsdagen innan den gjorde något annat
- Den upptäckte en liten skillnad mellan den uppgivna bokningstiden och den faktiska bokningen och bad om ett förtydligande i stället för att gissa
- Den flyttade bokningen till 21.00 och erbjöd proaktivt ett fönsterbord för tillfället, utan att kunden behövde be om det
- Genom hela samtalet använde agenten naturliga pauser, utfyllnadsord och en ton som anpassade sig till situationen – lugnande, varm och utan stress
Varför det spelar roll: Inget av detta kom från en annan modell eller en kraftfullare plattform. Det kom från prompten. Systemprompten gav agenten tillåtelse att rätta sig själv mitt i en mening, tystna naturligt medan den ”letar upp något” och ändra sin känslomässiga ton för att matcha uppringaren – samma tekniker som alla team som bygger på plattformen kan använda i dag.
Sju sätt att bygga naturliga agenter
- Känslotaggar – tillgängliga i det konversationsbaserade v3-modellens uttrycksfulla läge; det viktigaste verktyget för variation i ton
- Bakgrundsljud – kontorsatmosfär, stadsljud eller tangentbordsljud för ett mer välbekant, mänskligt sammanhang
- Ton i systemprompten – här ligger i praktiken den största skillnaden
- Inställningar för initiativ (ivrig / normal / tålmodig) – anpassade efter hur mycket tid interaktionen behöver
- Uttalslexikon / nyckelord – för namn, varumärken och utländska ord som agenten annars skulle uttala fel.
- Utdatainställningar – vissa team lägger medvetet till telefoner som ringer i bakgrunden i stället för kristallklart ljud, eftersom kunder som flyttar från traditionella kontaktcenter är vana vid den lite dämpade tonen
- Voice Design eller kloning – att skapa en helt anpassad röst för varumärket i stället för att välja en standardröst. Med Voice Design kan du skriva en prompt för något specifikt (t.ex. ”en man i trettioårsåldern som låter som om han talar genom ett headset”). Voice Cloning sträcker sig från en direktklon (cirka 30 sekunders ljud) till en professionell klon (mer material, högre ljudkvalitet).
Bästa praxis för agenter som låter naturliga
Skriv in tonen direkt i systemprompten. Här ligger i praktiken den största skillnaden mellan en platt agent och en naturlig. Ge agenten uttrycklig tillåtelse att rätta sig själv mitt i en mening (”så som människor faktiskt pratar”), att tystna naturligt medan den letar upp något och att låta tystnaden få ta plats efter något allvarligt innan den svarar.
Anpassa känslotaggarna efter situationen. En ”excited”-tagg passar inte i en allvarlig eller riskfylld situation. Placera taggar medvetet där de faktiskt kommer att förekomma i samtalet och anpassa dem efter uppringarens känsloläge under samtalets gång (t.ex. lugn och betryggande för en orolig uppringare, jämfört med snabb men varm för någon som har bråttom).
Ställ in initiativnivån medvetet. Ivrig fungerar för snabba utbyten med mycket information; tålmodig fungerar när någon behöver tid för att hitta ett dokument eller nummer. Om du alltid använder ivrig kan agenten kännas påträngande snarare än naturlig.
Välj LLM för varje nod. Använd enklare, snabbare modeller för enkla routningssteg och mer kapabla modeller för noder som fattar verkliga beslut.
Se upplevd latens som en del av det ”naturliga”. Utöver modellval minskar både spekulativ turgenerering (att låta modellen börja formulera ett svar medan uppringaren fortfarande talar) och utfyllnadsord vid mjuka tidsgränser hur lång en paus känns, även när den faktiska svarstiden är oförändrad.
Lokalisera i stället för att översätta. Välj röster som faktiskt har tränats på målspråket, använd ett uttalslexikon och överväg att skriva själva prompten på språket för användningsfall med ett enda språk för bättre prestanda. Multilingual v2 är fortfarande ett bra alternativ när låg latens mellan språk är viktigare än uttrycksfullhet.
Övervaka agenten. Använd simuleringstester för att validera en agent utan riktiga samtal, utvärderingskriterier för godkänt/underkänt efter samtalet och sentimentanalys tur för tur för att fånga exakt var i ett samtal agenten använde fel ton – använd sedan den informationen för att finjustera prompten.
Se hela sessionen
Se hela webbinariet här.





