什么是意图识别:了解 NLP 中的用户目标
- 发布时间
- 最近更新
用户写下的每条消息,无论是发给 LLM 智能体还是输入 Google,背后都有意图。他们希望实现某个目标,比如查找特定信息或执行某项操作。
意图识别是识别这一目标、根据目标梳理用户需求,并尽可能准确地完成请求的过程。对意图有精细理解的系统能通过精准回复更好地服务客户,提升参与度和满意度。
本文将介绍什么是意图识别,以及在 LLM 搜索时代,意图如何演变。
摘要
- 意图识别是自然语言处理中的一项技术,用于归类输入内容的目标。
- 要识别对话中的意图,模型会经过 4 个步骤:对话预处理、特征提取、分类和实体提取。
- 与 LLM 交互时,意图可以是信息型、事务型、对话型或导航型。
- 研究人员在微调意图识别时,常考虑的挑战包括语言歧义、超出范围的输入和多意图对话。
什么是意图识别?
意图识别是自然语言处理(NLP)中的一项技术,可根据用户在语境中想实现的目标,对语音或文本输入进行分类。由于软件必须理解输入并确定应采取的正确行动,因此这项技术有时也称为意图分类。
需要注意,意图识别不只是关键词匹配。表达同一目标的语言方式太多,无法仅靠匹配。例如,“我的用户信息无法使用”“为什么我无法登录?”“我的账户好像被锁定了”和“我的密码不起作用”虽然表述不同,底层意图却相同。
将意图识别用作 NLP 的一项功能,AI 系统就能更好地理解用户希望从交互中获得什么,从而在每次对话中提供尽可能出色的体验。

意图识别如何运作?
AI 系统用于意图识别的具体架构取决于提供商。不过,系统通常会采用类似的 4 个核心阶段,将原始输入转化为明确定义的意图。
意图识别包括以下 4 个阶段:
- 预处理
- 特征提取
- 分类
- 实体提取
下面详细介绍。

预处理
无论是语音还是文本,输入都需要清理,以确保模型处理的是一致且可识别的格式。对于文本,这包括纠正拼写错误、删除标点和大小写,然后通过分词将不常见或较长的词拆分为更小的子词单元。为提高清晰度,这个阶段还可能去除“a”和“the”等高频功能词,除非它们会直接影响句意。
在 自动语音识别 流程中,系统必须先将传入的语音数据转写为文本。因此,在模型开始处理规范化转写文本前,预处理会多一个阶段。
特征提取
随后,清理后的文本会转化为软件可处理的数值表示。特征提取会保留句子的语义,但以数值形式呈现。
过去几年,研究人员在这一阶段采用的策略有了显著演变。早期方法会使用词袋模型,或词频-逆文档频率(TF-IDF)表示,根据词语的独特性或出现频率赋予权重。虽然结果很快,但无法捕捉句子的细微含义。毕竟,“我不想取消”和“我想取消”几乎包含相同的词,意思却完全不同。
TF-IDF 还可能难以处理另一个例子:“狗咬猫”和“猫咬狗”只改动了很少几个词,意思却完全改变。
更现代的特征提取方法是使用稠密向量表示,创建代表用户输入的 向量嵌入。这些嵌入通过彼此接近的距离关联语境,将含义相近的词归为一组,再从这种空间关系中推断上下文。
基于 Transformer 的编码器更进一步,可创建上下文映射:一个词的向量会随周围词语而变化。这对于会因语境而一词多义的词至关重要,例如“请阅读这些说明”和“我昨天读了那篇文章”。
句子的上下文表示让意图识别系统能够理解用户需求,并在后续阶段进行分类。
分类
获得清晰的输入表示后,模型便可将输入与不同的已知意图案例比较,同时为其分配置信度。遍历各类意图后,它会选择置信度最高的一项。
有些团队会尝试为分类设置置信度阈值。阈值过低,准确性较差的意图仍可能进入下一步;阈值过高,则会出现相反情况:模型无法明确分类意图,也无法进入下一步。
微调分类模型有助于找到最适合业务的阈值。
如果模型无法识别意图,通常会向用户追问更多问题,或在配置允许时转交给人工客服。
实体提取
这里将实体提取视为单独的步骤,但它实际上与分类同时进行。实体提取会从输入中获取后续回复所需的详情,例如订单号、账户信息、产品名称或其他能帮助模型执行请求的具体信息。
这一步提取的实体可提供成功执行请求所需的用户特定信息。例如,若分类识别出用户想取消订单,实体提取会告诉智能体应操作哪一笔订单和哪个客户账户。
意图识别与意图检测
意图识别和意图检测经常被交替使用,但含义略有不同。意图识别是对用户请求中意图进行分类的完整过程;意图检测仅指其中的第一阶段,即根据用户回复判断是否存在意图。
在实际应用中,这一区别只在边缘用例中重要。例如,客户支持智能体 收到与其已学习语境完全无关的问题时,可能先通过意图检测识别该意图不适用于知识库。之后如何处理,例如优雅地拒绝回答,则由意图识别配置决定。
意图类型
有多少问题,就有多少具体意图。系统通常不会为问题的每种可能表述设置不同意图,而是先识别意图类别,再据此采取行动。
NLP 系统中的主要意图类型包括:
- 信息型意图:指用户的主要目标是了解或获取特定信息的输入。正确的回复应提供所需内容,可以直接解释,也可以指向用户可获取信息的正确资源。
- 导航型意图:指用户想查找特定资源或页面。系统会归类这一意图并提取实体,然后将其引导至正确位置。
- 事务型意图:指用户想实现特定目标的输入,例如预约或取消订阅。事务型意图始终涉及会产生实际结果的操作。
- 对话型意图:指主要用于社交互动,而不属于其他类别的输入。随着 LLM 广泛普及,这种意图越来越常见,有些人会将通用智能体用作日常聊天界面。
LLM 能处理所有这些类别中的各类意图。无论如何,了解输入属于哪种意图类别,有助于形成更准确的回复。从智能体调用哪些 工具 到如何组织具体回复,都取决于先识别用户输入背后的意图。

各行业中的意图识别用例
意图识别是所有自动回复系统的核心,因为回复必须与意图一致,对话才有意义。
以下是意图在不同行业中的一些应用示例:
- 客户服务:语音智能体通过意图识别理解客户的口头请求,并将其转接至合适的部门或资源。错误分类可能导致客户联系到错误的工作人员,或问题无法得到解决。
- 医疗保健:意图识别可为管理预约的医疗助手提供支持。医疗或金融等高风险行业通常会采用更高的置信度阈值,以避免错误分类导致严重错误。
- 人力资源:HR 对话助手可部署在公司内部文档中,引导员工找到所需资源。例如,员工可以询问休假福利,智能体会理解其信息型意图,并从更广泛的 Wiki 中呈现相关详情。
总体而言,精准的意图识别是推动成功对话的首要因素。意图识别错了,后续对话也会出错。
意图识别的挑战
识别陈述的意图完全是一项语言挑战。含义会变化,词语会随语境改变功能,同一句话也可能因说法不同而有不同意思。尤其是意图识别越来越多地部署在语音智能体中,这一点尤为重要。
以下是意图识别面临的一些主要挑战及解决方法:
- 歧义:当同一句话因说法不同而有两种含义时,语言歧义会降低意图识别的确定性。为解决这一问题,模型会通过多轮对话构建上下文,更全面地理解对方可能想要什么。模型可利用的上下文越多,生成回复时就越精准。
- 超出模型范围的对话:如果用户向模型询问远超其知识范围的问题,模型可能会将意图错误归入最接近的相似类别,导致回复不准确。一种解决方案是针对边缘用例训练模型,以降低这种情况发生的概率。将此方法与护栏机制结合,防止某些主题在对话中被突破,也有助于降低风险。
- 多意图输入:自然对话并不总是输入与意图 1:1 对应。“你能取消我的订单,并更新我未来订单的收货地址吗?”包含两个不同目标。使用多标签分类器有助于识别包含多个意图或目标的对话内容,提升处理多重潜在需求时的准确性。
了解并预判这些挑战,能让研究人员提前采取措施降低其影响。

开始使用 ElevenAgents
在语音智能体中,意图识别有助于保持对话式 AI系统的准确性和高客户满意度。反复出现的意图不匹配会削弱客户对智能体的信任,降低用户使用 AI 支持系统的意愿。
ElevenAgents 使用意图识别精准理解用户需求并在对话中满足需求,正确路由交互、获取相关信息或按需升级通话。
了解更多关于 ElevenAgents 的信息,或注册,开始构建能理解用户需求的语音智能体。


