Webbinar-sammanfattning: Bygg AI-agenter som låter naturliga
- Skriven av
- Luigi Sambuy
- Publicerad
- Senast uppdaterad
LyssnaLyssna på den här artikeln
De flesta team vill bygga en agent som låter naturlig.
Det de flesta team saknar är en agent som inte bara slutför uppgiften, utan också förstår sammanhang, brådska och känslor. När den som ringer märker att den inte gör det minskar förtroendet, liksom kvaliteten på interaktionen.
I vår senaste livesession: Bygg AI-agenter som låter naturliga, gick Luigi Sambuy (Forward Deployed Engineering) igenom vad som skiljer en robotaktig agent från en som känns genuint mänsklig.
Varför det är svårare än det verkar att låta naturlig
De flesta team som lanserar agenter har redan löst noggrannheten – agenten ger rätt svar, bokar rätt bord och avbokar rätt flyg.
Det svårare är att få framförandet rätt.
En agent som inte speglar den som ringer upps känslor, inte uppfattar brådska och besvarar varje fråga med samma platta rytm kommer alltid att uppfattas som artificiell, oavsett hur korrekta svaren är. Kunder vill inte bara få sitt problem löst – de vill känna sig hörda medan det händer.
Fyra kännetecken för en naturligt låtande agent
- Rytm och flyt – naturligt tempo, pauser och varierad hastighet i stället för monoton uppläsning
- Spegling – bemöt en frustrerad person med omtanke och goda nyheter med värme
- Sammanhang – använd användarhistorik, affärssystem och kulturella/regionala signaler så att svaren inte blir generiska
- Identitet – en röst som faktiskt är skapad för varumärket, inte ett färdigt standardval
Demo: En naturligt låtande agent i praktiken
Scenario: En kund ringer Rosette Restaurant för att ändra sin bokning. Det är deras femte bröllopsdag och de blir sena.
Det som visas:
- Agenten inledde varmt och uppmärksammade bröllopsdagen innan den gjorde något annat
- Den upptäckte en liten skillnad mellan den angivna bokningstiden och tiden som faktiskt var bokad, och bad om förtydligande i stället för att gissa
- Den flyttade bokningen till 21.00 och erbjöd proaktivt ett fönsterbord för tillfället, utan att kunden behövde fråga
- Under hela samtalet använde agenten naturliga pauser, utfyllnadsord och en ton som anpassades efter situationen – lugnande, varm och utan stress
Varför det spelar roll: Inget av detta kom från en annan modell eller en kraftfullare plattform. Det kom från prompten. Systemprompten gav agenten tillåtelse att rätta sig själv mitt i en mening, tystna naturligt medan den "letar upp något" och anpassa sin känslomässiga ton efter den som ringer – samma tekniker som alla team som bygger på plattformen kan använda i dag.
Sju verktyg för att bygga naturliga agenter
- Känslotaggar – tillgängliga i v3-konversationsmodellens expressiva läge; det enskilt största genombrottet för varierad ton
- Bakgrundsljud – kontorsatmosfär, stadsljud eller tangentbordsljud för ett mer välbekant, mänskligt sammanhang
- Ton i systemprompten – här finns faktiskt större delen av skillnaden
- Inställningar för svarsvillighet (ivrig / normal / tålmodig) – anpassade efter hur mycket tid interaktionen kräver
- Uttalslexikon / nyckelord – för namn, varumärken och utländska ord som agenten annars skulle uttala fel.
- Utdatainställningar – vissa team lägger medvetet till telefoner som ringer i bakgrunden i stället för kristallklart ljud, eftersom kunder som går över från ett traditionellt kontaktcenter är vana vid den lätt dämpade tonen
- Voice Design eller kloning – skapa en helt anpassad röst för varumärket i stället för att välja en färdig röst. Med Voice Design kan du prompta fram något specifikt, till exempel "en man i trettioårsåldern som låter som om han talar genom ett headset". Voice Cloning sträcker sig från en direktklon (ungefär 30 sekunders ljud) till en professionell klon (mer material, högre kvalitet).
Bästa praxis för naturligt låtande agenter
Skriv in tonen direkt i systemprompten. Det är här större delen av skillnaden mellan en platt agent och en naturlig agent faktiskt finns. Ge agenten tydlig tillåtelse att rätta sig själv mitt i en mening ("så som människor faktiskt pratar"), att tystna naturligt medan den letar upp något och att låta tystnaden få ta plats efter något allvarligt innan den svarar.
Anpassa känslotaggarna efter situationen. En tagg som "excited" är fel i ett allvarligt eller riskfyllt läge. Placera taggar medvetet där de faktiskt uppstår i samtalet och anpassa dem efter den som ringer upps känsloläge under samtalets gång, till exempel lugnt och betryggande för en orolig person jämfört med snabbt men varmt för någon som har bråttom.
Ställ in svarsvilligheten medvetet. Ivrig fungerar för snabba utbyten med mycket information, medan tålmodig fungerar när någon behöver tid för att ta fram ett dokument eller ett nummer. Om du använder ivrig som standard överallt kan agenten kännas påstridig snarare än naturlig.
Välj LLM för varje nod. Använd lättare, snabbare modeller för enkla routningssteg och mer kapabla modeller för noder som fattar faktiska beslut.
Se upplevd fördröjning som en del av det "naturliga". Utöver modellval minskar både spekulativ generering av svarsturer – där modellen börjar formulera ett svar medan den som ringer fortfarande pratar – och utfyllnadsord vid mjuka tidsgränser hur lång en paus upplevs, även när den underliggande svarstiden inte har ändrats.
Lokalisera i stället för att översätta. Välj röster som faktiskt har tränats på målspråket, använd ett uttalslexikon och överväg att skriva själva prompten på det språket för användningsfall med ett enda språk, för bättre prestanda. Multilingual v2 är fortfarande ett bra alternativ när låg fördröjning mellan språk är viktigare än expressivt omfång.
Övervaka din agent. Använd simuleringstester för att validera en agent utan riktiga samtal, utvärderingskriterier för godkänd/icke godkänd-poäng efter samtal och sentimentanalys tur för tur för att fånga exakt var i ett samtal agenten använde fel ton – använd sedan den insikten för att justera prompten.
Se hela sessionen
Se hela webbinariet här.





