Vad är avsiktsigenkänning: Förstå användarmål inom NLP
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
LyssnaLyssna på den här artikeln
Varje meddelande en användare skriver, oavsett om det är till en LLM-agent eller som en sökning på Google, har en avsikt bakom sig. Användaren försöker uppnå ett mål, oavsett om det handlar om att hitta specifik information eller utföra en åtgärd.
Avsiktsigenkänning är processen att identifiera vad målet är, fastställa vad användaren behöver utifrån det målet och uppfylla begäran så korrekt som möjligt. Ett system med en välkalibrerad förståelse för avsikt kan ge kunder bättre och mer precisa svar, vilket ökar engagemanget och nöjdheten.
I den här artikeln går vi igenom vad avsiktsigenkänning är och hur avsikter har utvecklats i LLM-sökningens tid.
Sammanfattning
- Avsiktsigenkänning är en teknik inom naturlig språkbehandling som kategoriserar målet med en inmatning.
- För att känna igen avsikten i en konversation går en modell igenom fyra steg: förbehandling av konversationen, funktionsextraktion, klassificering och entitetsextraktion.
- När man interagerar med en LLM kan avsikten vara informativ, transaktionell, konversationell eller navigerande.
- Vanliga utmaningar som forskare tar hänsyn till när de finjusterar avsiktsigenkänning är språklig tvetydighet, inmatningar utanför modellens område och konversationer med flera avsikter.
Vad är avsiktsigenkänning?
Avsiktsigenkänning är en teknik inom naturlig språkbehandling (NLP) som klassificerar talad eller skriven inmatning utifrån vad användaren vill uppnå i sitt sammanhang. Klassificeringen är också anledningen till att tekniken ibland kallas avsiktsklassificering, eftersom programvaran måste förstå inmatningen och avgöra vilken åtgärd som ska vidtas.
Det är viktigt att notera att avsiktsigenkänning inte bara är nyckelordsmatchning. Det finns för många språkliga variationer av samma mål för att matchning ska fungera. Till exempel är ”Mina användaruppgifter fungerar inte”, ”Varför kan jag inte logga in?”, ”Mitt konto verkar vara låst” och ”Mitt lösenord fungerar inte” olika skriftliga variationer av samma underliggande avsikt.
Genom att använda avsiktsigenkänning som en funktion inom NLP kan AI-system bättre förstå vad en användare vill få ut av interaktionen, så att de kan ge bästa möjliga upplevelse i varje konversation.

Hur fungerar avsiktsigenkänning?
Den exakta arkitektur som ett AI-system använder för avsiktsigenkänning beror på leverantören. Vanligtvis använder systemet dock en variant av samma fyra grundläggande steg för att omvandla rå inmatning till en tydligt definierad avsikt.
Här är de fyra stegen i avsiktsigenkänning:
- Förbehandling
- Funktionsextraktion
- Klassificering
- Entitetsextraktion
Låt oss gå igenom dem mer i detalj.

Förbehandling
Inmatning, oavsett om det är röst eller text, behöver rensas så att modellen får ett enhetligt och igenkännbart format att arbeta med. För text innebär det att rätta stavfel, ta bort skiljetecken och versaler samt dela upp ovanliga eller långa ord i mindre delordenheter med tokenisering. I den här fasen kan även vanliga funktionsord som ”en” och ”den” tas bort för tydlighetens skull, om de inte direkt påverkar meningens betydelse.
I automatisk taligenkänning måste systemet först transkribera inkommande röstdata till text, vilket lägger till ytterligare ett steg i förbehandlingen innan modellen kan börja arbeta med det normaliserade transkriptet.
Funktionsextraktion
Den rensade texten omvandlas sedan till en numerisk representation som programvaran kan arbeta med. Funktionsextraktion bevarar en menings semantiska betydelse, men uttrycker den numeriskt.
De strategier som forskare använder i det här steget har utvecklats betydligt de senaste åren. Tidigare användes Bag-of-Words-modeller eller representationer med Term Frequency-Inverse Document Frequency (TF-IDF) för att vikta ord utifrån hur utmärkande eller vanliga de är. Även om detta gav snabba resultat fångade det inte meningars nyanser. ”Jag vill inte avboka” och ”Jag vill avboka” innehåller trots allt nästan exakt samma ord, men betyder helt olika saker.
Ett annat exempel som kan vara svårt med TF-IDF är ”Hund biter katt” jämfört med ”Katt biter hund”, där betydelsen förändras helt med mycket små ändringar i meningen.
Ett modernare sätt att utföra funktionsextraktion är att använda täta vektorrepresentationer för att skapa en vektorinbäddning som representerar användarens inmatning. Dessa inbäddningar kopplar sammanhang genom närhet och grupperar ord med liknande betydelse för att härleda kontext från den rumsliga relationen.
Transformer-baserade encoders tar detta ett steg längre genom att skapa kontextuella kartor där en vektor för ett ord förändras beroende på vilka ord som omger det. Det är avgörande för ord som har flera betydelser beroende på sammanhanget (”läs de här instruktionerna”, ”jag läste den artikeln i går”).
En menings kontextuella representation ger system för avsiktsigenkänning förmågan att förstå vad en användare vill och sedan klassificera det i de senare stegen.
Klassificering
Med en tydlig representation av en inmatning kan en modell jämföra den med olika kända avsiktsfall och tilldela konfidensvärden under processen. Efter att ha gått igenom avsiktstyper väljer den den med högst konfidensvärde.
Vissa team experimenterar med ett konfidensvärde som tröskel för klassificering. Om det sätts för lågt kan en ganska felaktig avsikt ändå föras vidare till nästa steg. Men om det sätts för högt kan motsatsen inträffa: modellen kan inte klassificera avsikten med säkerhet och gå vidare till nästa steg.
Genom att finjustera klassificeringsmodellen kan du hitta det värde som fungerar bäst för din verksamhet.
Om modellen inte kan identifiera en avsikt ställer den troligen fler frågor till användaren eller eskalerar till en mänsklig agent, om den har konfigurerats för det.
Entitetsextraktion
Vi beskriver entitetsextraktion som ett separat steg, men den sker egentligen parallellt med klassificeringen. Entitetsextraktion hämtar uppgifter från en inmatning som är användbara för att svara senare, till exempel ordernummer, kontouppgifter, produktnamn eller andra detaljer som hjälper modellen att utföra begäran.
De entiteter som extraheras i det här steget ger användarspecifik information som behövs för att utföra begäran. Om klassificeringen exempelvis identifierar att en användare vill avboka en order talar entitetsextraktionen om för agenten vilken order och vilket kundkonto som åtgärden gäller.
Avsiktsigenkänning jämfört med avsiktsdetektering
Avsiktsigenkänning och avsiktsdetektering används ofta synonymt, trots att de har något olika betydelser. Avsiktsigenkänning är hela processen för att klassificera avsikten i en användares begäran. Avsiktsdetektering omfattar bara det första steget i processen: att avgöra om användarens svar över huvud taget innehåller en avsikt.
I praktiken spelar skillnaden bara roll i särskilda gränsfall. Till exempel kan en kundsupportagent som får en fråga som helt saknar koppling till dess inlärda sammanhang först identifiera, med hjälp av avsiktsdetektering, att avsikten inte är tillämplig på dess kunskapsbas. Vad den gör därefter, till exempel avslutar på ett smidigt sätt, avgörs av konfigurationen för avsiktsigenkänning.
Typer av avsikter
Det finns lika många specifika avsikter som det finns frågor. I stället för att varje tänkbar formulering av en fråga kräver en egen avsikt identifierar systemet vanligtvis först avsiktskategorin och agerar därefter.
De viktigaste avsiktstyperna i NLP-system är:
- Informativ avsikt: Beskriver en inmatning där användarens huvudsakliga mål är att lära sig något eller få specifik information. Rätt svar är att tillhandahålla det efterfrågade innehållet, antingen som en förklaring eller genom att hänvisa till rätt resurser där användaren kan hitta informationen.
- Navigerande avsikt: Beskriver när en användare vill hitta en specifik resurs eller sida. Systemet kategoriserar avsikten och extraherar entiteter för att sedan hänvisa användaren till rätt plats.
- Transaktionell avsikt: Beskriver en inmatning där en användare vill uppnå ett specifikt mål, som att boka en tid eller säga upp sin prenumeration. Transaktionella avsikter bygger alltid på åtgärder med konsekvenser.
- Konversationell avsikt: Beskriver en inmatning som främst är social snarare än en av de andra kategorierna. Denna form av avsikt är vanligare i dag i takt med att LLM:er har blivit mer lättillgängliga, och vissa använder agenter för allmänna ändamål som ett gränssnitt för vardagliga chattar.
En LLM kan hantera alla dessa avsiktstyper i alla dessa kategorier. Oavsett hjälper en förståelse för vilken avsiktskategori en inmatning tillhör till att skapa ett mer korrekt svar. Allt från vilka verktygsanrop en agent gör till det exakta svar den formulerar bygger på att först identifiera den underliggande avsikten i användarens inmatning.

Användningsområden för avsiktsigenkänning i olika branscher
Avsiktsigenkänning är centralt för alla automatiserade svarsystem, eftersom svaret måste stämma överens med avsikten för att konversationen ska vara meningsfull.
Här är några exempel på hur avsikt används i olika branscher:
- Kundservice: En röstagent använder avsiktsigenkänning för att förstå en kunds talade begäran och hänvisa kunden till rätt avdelning eller resurs. Felklassificering kan leda till att kunden får prata med fel medarbetare eller att frågan inte löses.
- Hälso- och sjukvård: Avsiktsigenkänning driver vårdassistenter som hanterar bokningar. Branscher med högre risk, som hälso- och sjukvård eller finans, använder ofta högre konfidensgränser för att undvika felkategoriseringar som kan leda till kritiska fel.
- Personalavdelning: En konversationell HR-assistent kan finnas i företagets interna dokument och guida medarbetare till resurserna de behöver. En medarbetare kan exempelvis fråga om semesterförmåner, varpå agenten förstår den informativa avsikten och hämtar detaljerna från den bredare wikin.
Överlag är korrekt avsiktsigenkänning den första förutsättningen för en lyckad konversation. Om avsikten blir fel blir även den efterföljande konversationen fel.
Utmaningar med avsiktsigenkänning
Att känna igen avsikten i ett uttalande är helt och hållet en språklig utmaning. Betydelser förändras, ord får olika funktioner beroende på sitt sammanhang och samma fras kan betyda olika saker beroende på hur den sägs. Särskilt när avsiktsigenkänning i allt högre grad används i röstagenter är den sista punkten mycket viktig.
Här är några av de främsta utmaningarna med avsiktsigenkänning och hur du löser dem:
- Tvetydighet: När samma fras betyder två olika saker beroende på hur någon säger den kan språklig tvetydighet minska säkerheten i avsiktsigenkänningen. För att hantera detta bygger modeller upp kontext över flera samtalsvändor för att få en mer heltäckande förståelse för vad någon kan vilja. Ju mer kontext en modell har att använda, desto mer precist kan den utforma sitt svar.
- Konversationer utanför modellens område: Om en användare frågar modellen om något som ligger långt utanför dess kunskapsområde kan modellen felkategorisera avsikten till den närmaste liknande kategorin, vilket leder till ett felaktigt svar. En lösning är att träna modeller på gränsfall för att minska risken för att detta händer. Att kombinera detta med skyddsräcken som hindrar vissa ämnen från att tas upp i konversationer bidrar till att minska risken.
- Inmatningar med flera avsikter: En konversation motsvarar naturligtvis inte alltid en avsikt per inmatning. ”Kan du avboka min order och även uppdatera min leveransadress för framtida beställningar?” innehåller två tydliga mål. En klassificerare med flera etiketter hjälper till att identifiera konversationssträngar som innehåller fler än en avsikt eller ett mål, vilket förbättrar noggrannheten när flera underliggande önskemål ska hanteras.
När forskare förstår och förutser dessa utmaningar kan de vidta åtgärder för att minska dem i förväg.

Kom i gång med ElevenAgents
I en röstagent hjälper avsiktsigenkänning till att hålla Conversational AI-system korrekta och kundnöjdheten hög. Upprepade felmatchningar av avsikter undergräver kundernas förtroende för din agent och minskar användarnas vilja att använda dina AI-supportsystem.
ElevenAgents använder avsiktsigenkänning för att exakt förstå vad en användare behöver och hjälpa dem i konversationen genom att styra interaktionen rätt, hämta relevant information eller eskalera samtalet vid behov.
Läs mer om ElevenAgents eller registrera dig för att börja skapa röstagenter som förstår vad dina användare vill.



