跳至内容

网络研讨会回顾:构建企业级安全 AI 智能体

发布时间
最近更新

收听收听本文

网络研讨会回顾:为企业部署构建安全的 AI 智能体

让 AI 智能体处理对话并不难。难的是赢得安全团队、法务团队和客户的信任,这也是大多数企业部署停滞的原因。

本文回顾了我们的线上研讨会:为企业部署构建安全的 AI 智能体,我们在会上讲解了支持企业智能体大规模部署的工具、框架和实践方法。

如何构建分层安全机制

已有超过 400 万个智能体部署在 ElevenAgents 平台上。在企业环境中稳定运行的智能体有一个共同点:安全从一开始就内置其中,而不是在首次事故后才补上。

本次线上分享介绍了框架、控制措施和部署实践,帮助智能体通过安全审查。

不同类型的智能体需要截然不同的边界。

  • 一个视频游戏角色可能需要使用明显带有暴力色彩的语言来符合体验设定,但绝不能脱离角色或透露自己是 AI。
  • 医疗接待员需要讨论伤情和医疗相关情境,但绝不能提供医疗建议。
  • 信用卡客服智能体不应涉及露骨内容,也不应向未经验证的来电者透露账户详情。

智能体具有非确定性,任何单一防护措施都无法完全防范所有潜在风险。因此,企业团队需要采用分层方法,让多项控制措施协同工作,使安全失误成为罕见例外。

这一原则也构成了本次分享围绕的 4 个问题:

  1. 如何控制智能体说什么、做什么?
  2. 如何检查它是否正常工作?
  3. 如何保护数据,以满足安全和合规要求?
  4. 如何建立安全部署的流程?

如何理解智能体行为控制

任何智能体对话中,都有 3 个环节需要考虑安全问题。

输入
用户说了些什么。对抗性用户可能会尝试“忽略之前的所有指令”或“假装你是另一个助手”之类的说法。需要在这些操控尝试到达模型之前检测并处理它们。这样既能避免不必要的成本,也能阻止恶意行为者获取无权访问的信息。

决策
LLM 决定要说什么或做什么。系统提示词是主要控制界面,但在较长或复杂的对话中,LLM 可能偏离指令。需要在整段对话中持续强化行为的机制,而非只在开始时设置。还应定义升级路径:在哪些情况下,智能体应转交给人工或更专业的智能体,以及转交条件是什么?

输出
即使有严格指导,仍可能出现遗漏,尤其是在长时间对话中。需要最后一道安全防线。可以将其视为检查主智能体工作的微型智能体:它会在回复发送给用户前进行评估,并决定发送、重试还是升级处理。它还会与回复生成并行运行,仅增加极少延迟。

在这 3 个环节中,都需要提前定义退出策略:违规时是结束对话、通过纠正指导触发重试,还是转交人工?这一决策会影响问题发生时的用户体验。

演示 1:在 ElevenAgents 中配置护栏

场景:为网站销售与支持智能体配置多层安全控制,以防止操控、偏离主题的回复和违反政策。


演示内容:

  • 操控护栏(输入)— 位于“安全”标签页,此开关可检测提示词注入模式,即试图覆盖系统指令的行为,并在智能体回复前终止对话。建议所有生产环境智能体启用。
  • 系统提示词和 Focus 护栏(决策)— 系统提示词是基础。每条重要规则都应明确写在其中。演示中,在会话中途添加了一条指令:“不得提供任何折扣。”单独启用的 Focus 护栏会在整个对话中自动强化系统提示词,解决较长交互中出现的偏离问题。强系统提示词搭配启用 Focus,是让智能体保持正轨的最有效组合。
  • 内容护栏(输出)— 预配置类别涵盖脏话、法律建议和政治观点。每类都有可调节的置信度阈值,建议从“中”等级开始。这是后备防线:如果智能体即将生成不应输出的内容,它会在发送前拦截。
  • 自定义护栏(输出)— 以自然语言编写、由用户定义的检查规则,适用于预设未覆盖的任何情况。演示中配置了一个“禁止折扣”护栏:“拦截任何提及智能体无权提供的折扣、促销或特殊价格的回复。”自定义护栏需要额外进行一次 LLM 评估,因此会产生按用量计费的成本,并需考虑延迟。请保持指令简洁,将不同检查拆分为单独的护栏,而不是合并在一起。
  • 违规处理方式 — 有两个选项:结束通话或重试。重试时,可提供额外指令来引导智能体下一次尝试,例如升级给人工,或发送默认的跳转提示。

重要性:这些控制措施并非一套方案适用于所有场景。每项护栏都可单独配置。这种精细度正是理论上安全的智能体与能够在各种企业场景中安全运行的智能体之间的关键差异。

演示 2:上线前进行模拟测试

场景:使用两个与折扣相关的对话场景测试客服智能体,确认它会将用户引导至定价页面,而不会提供折扣。

演示内容:

  • 在“测试”标签页定义了 2 个模拟测试,每项均包含模拟用户场景、设定的对话轮数和明确的成功标准
  • 其中一项测试最初失败,原因是系统提示词缺少针对特定边缘情况的指令
  • 将缺失的指令添加到系统提示词的护栏部分
  • 重新发布智能体后,再次运行两项测试,均已通过
  • 详细运行记录可准确显示对话的失败环节,包括工具调用和智能体操作

重要性:模拟测试让团队能在真实用户接触智能体前,于受控环境中验证其行为。它既涵盖常规场景,也涵盖对抗性场景。测试针对完整对话流程,而非仅针对单条回复。作出更改后,可立即重新运行测试,确认修复是否有效。

演示 3:敏感部署中的 PII 脱敏

场景:为企业智能体配置对话日志中的个人身份信息脱敏。

演示内容:

  • 在“高级”标签页的“隐私”设置中,提供“对话历史记录脱敏”开关
  • 可单独开启脱敏的特定数据实体列表,包括出生日期、年龄和其他敏感字段
  • 可选择所有实体,或仅选择与该智能体用例相关的实体

重要性:在 HIPAA 等高合规要求环境中,PII 脱敏不能替代零留存模式。它的作用是减少用于内部审查或质量控制的对话日志中的数据暴露。团队可以保留需要的日志,同时去除不需要的数据。目前该功能仅面向企业版客户提供。

安全部署企业智能体的最佳实践

  1. 采用分层方法。单一控制措施无法确保行为安全。输入护栏、输出验证、提示词强化和测试必须协同进行。各层相互强化,可显著降低安全问题的风险。
  2. 让护栏适配场景。医疗智能体和零售客服智能体需要不同规则。请根据用例定义边界,而非套用通用模板。
  3. 从重要用例开始。最成功的企业部署并非从一次性的试点开始,而是选择客服、预约等真实场景,并投入精力把它做好。
  4. 上线前测试,并持续测试。使用模拟测试和外部红队工具。测试常规场景和对抗性场景。将生产环境中发现的新边缘情况补充到测试套件中。
  5. 分阶段部署。先从有限流量开始。监控真实对话,找出智能体难以应对的情况。调整后重新测试,再逐步扩大范围。
  6. 慎重选择执行模式。对于严格验证比速度更重要的文本智能体,使用阻塞模式。对于以低延迟为优先的语音智能体,使用流式模式。
  7. 明确护栏违规后的处理方式。提前决定违规时是结束通话、触发重试,还是升级给人工。
  8. 保持自定义护栏指令简洁。护栏会并行运行。冗长复杂的自定义护栏会增加延迟。请使用简明指令,并将不同检查拆分为单独的护栏。
  9. 了解认证实际涵盖的内容。SOC 2 Type 2 和 ISO 27001 是基本要求。HIPAA 和 PCI DSS 等领域特定标准面向受监管行业。ISO 42001 和AIUC-1等较新的 AI 专项认证则涵盖偏见、透明度和对抗韧性,AIUC-1 认证还可帮助获得 AI 专项保险。
  10. 尽早建立流程能力。首次部署最耗时。投入测试和部署流程建设的团队,后续每个智能体都能实现更快迭代。

观看完整分享

观看完整网络研讨会请点击这里。

safety-webinar-cover


相关内容

用高质量 AI 音频创作