网络研讨会回顾:构建企业级安全 AI 智能体
- 发布时间
- 最近更新
收听收听本文
网络研讨会回顾:为企业部署构建安全的 AI 智能体
让 AI 智能体处理对话并不难。难的是让安全团队、法务团队和客户信任它,这正是大多数企业部署停滞的原因。
本文回顾了我们的线上研讨会“为企业部署构建安全的 AI 智能体”,我们在会上介绍了帮助企业大规模部署智能体的工具、框架和实践方法。
如何构建分层安全体系
已有超过 400 万个智能体部署在 ElevenAgents 平台上。能在企业环境中稳定运行的智能体有一个共同点:安全从一开始就内置其中,而不是在首次事故后才补上。
线上研讨会介绍了让智能体通过安全审查、而非无法通过的框架、控制措施和部署实践。
不同智能体需要截然不同的边界。
- 一名视频游戏角色可能需要使用明确的暴力语言来符合体验设定,但绝不能脱离角色或透露自己是 AI。
- 医疗接待员需要讨论受伤和医疗情境,但绝不能提供医疗建议。
- 信用卡支持智能体不应接触露骨内容,也不应向未经验证的来电者透露账户详情。
智能体具有非确定性,任何单一防护措施都无法完全防范所有潜在风险。因此,企业团队需要采用分层方法——通过多项控制措施协同工作,让安全失误成为极少数例外。
这一原则构成了本次研讨会围绕的 4 个问题:
- 如何控制智能体的言行?
- 如何检查它是否正常运行?
- 如何保护数据以满足安全和合规要求?
- 如何建立安全部署的流程?
如何理解对智能体行为的控制
在任何智能体对话中,都有 3 个环节需要考虑安全问题。
输入
用户会说些什么。对抗性用户可能会尝试“忽略之前的所有指令”或“假装你是另一个助手”之类的话。需要在这些操纵尝试触及模型前检测并处理它们。这样既能避免不必要的成本,也能阻止不法者获取无权获得的信息。
决策
LLM 决定说什么或做什么。系统提示词是主要控制点,但在冗长或复杂的对话中,LLM 可能偏离指令。需要在整个对话过程中强化行为的机制,而不只是在开头。还应定义升级路径:在哪些情况下,智能体应转交给人工或更专业的智能体,以及相应条件是什么?
输出
即使有严格的引导,也可能有内容漏网,尤其是在长时间对话中。需要最后一道安全网。可以将它看作检查主智能体工作的小型智能体:它会在回复送达用户前进行评估,并决定发送、重试还是升级处理。它还会与回复生成并行运行,几乎不增加延迟。
对于这 3 个环节,都需要预先定义退出策略:违规时是结束对话、在修正引导下重试,还是转交人工?这一决定会影响发生问题时的用户体验。
演示 1:在 ElevenAgents 中配置护栏
场景:为网站销售和支持智能体配置多层安全控制,以防范操纵、跑题回复和违反政策。
演示内容:
- 操纵护栏(输入)——位于“安全”标签页中,此开关可检测提示词注入模式,即试图覆盖系统指令的行为,并在智能体回复前终止对话。建议所有生产环境智能体启用。
- 系统提示词和 Focus 护栏(决策)——系统提示词是基础。所有重要规则都应在其中明确写出。演示中,在会话中途添加了一条指令:“不得提供任何折扣。”单独启用的 Focus 护栏会在整个对话中自动强化系统提示词,解决较长互动中出现的偏离问题。强系统提示词结合启用 Focus,是让智能体保持正轨最有效的组合。
- 内容护栏(输出)——预配置类别涵盖脏话、法律建议和政治观点。每类都可调整置信度阈值,建议从中等开始。这是后备层:如果智能体即将生成不应生成的内容,它会在发送前拦截。
- 自定义护栏(输出)——针对预设未涵盖的任何情况,以自然语言编写用户自定义检查。演示中配置了“禁止折扣”护栏:“拦截任何提及智能体无权提供的折扣、促销或特殊定价的回复。”自定义护栏会使用额外的 LLM 评估,因此会产生按用量计费的成本,并需考虑延迟。指令应简洁明确,将不同检查拆分为单独的护栏,而不是合并在一起。
- 违规后的操作——有两个选项:结束通话或重试。重试时,可提供额外指令来引导智能体下一次尝试,例如升级给人工或发送默认跳转消息。
重要性:这些控制措施并非一刀切。可在每个护栏层级进行配置。正是这种细粒度,让智能体从理论上的安全,变为能在多样化企业环境中实际安全运行。
演示 2:上线前进行模拟测试
场景:针对 2 个与折扣相关的对话场景测试支持智能体,确认它会将用户引导至定价页面,而不会提供折扣。
演示内容:
- 在“测试”标签页中定义 2 项模拟测试,每项都有模拟用户场景、设定的对话轮数和明确的成功标准
- 其中一项测试最初失败,因为系统提示词缺少针对特定边缘情况的指令
- 将缺失指令添加到系统提示词的护栏部分
- 重新发布智能体后再次运行两项测试,均通过
- 详细运行历史会准确显示对话中失败的部分,包括工具调用和智能体操作
重要性:模拟测试让团队能够在真实用户接触智能体前,在受控环境中验证其行为。它覆盖常规场景和对抗性场景,并针对完整对话流程运行,而不只是单条回复。每次修改后,都可立即重新运行测试,确认修复是否有效。
演示 3:敏感部署的 PII 脱敏
场景:为企业智能体配置从对话日志中脱敏个人身份信息。
演示内容:
- 在“高级”标签页的“隐私”设置中找到“对话历史记录脱敏”开关
- 可逐项开启脱敏的特定数据实体列表,包括出生日期、年龄和其他敏感字段
- 可选择所有实体,或仅选择与特定智能体用例相关的实体
重要性:在 HIPAA 等高合规环境中,PII 脱敏不能替代零留存模式。它的作用是减少用于内部审查或质量控制的对话日志中的数据暴露。团队可以保留所需日志,同时移除不需要的数据。目前仅向企业版客户提供。
安全部署企业智能体的最佳实践
- 采用分层方法。没有任何单项控制能确保行为安全。输入护栏、输出验证、提示词强化和测试必须协同工作。每一层都会强化其他层,合力显著降低安全问题风险。
- 让护栏与场景匹配。医疗智能体和零售支持智能体需要不同规则。应定义适合具体用例的边界,而不是套用通用模板。
- 从真正重要的用例开始。最成功的企业部署不会从一次性的试点开始,而是选择真正的需求,例如客户支持、排期,并投入精力把它做好。
- 上线前测试,并持续测试。使用模拟测试和外部红队工具。针对常规和对抗性场景进行测试。将生产环境中发现的新边缘情况补充到测试套件中。
- 分阶段部署。先从有限流量开始。监控真实对话。找出智能体不擅长的地方。进行调整、重新测试,然后扩大范围。
- 谨慎选择执行模式。对于严格验证比速度更重要的文本智能体,使用阻塞模式。对于延迟优先的语音智能体,使用流式模式。
- 明确护栏违规后的操作。提前决定违规时是结束通话、触发重试,还是升级给人工。
- 保持自定义护栏指令简洁。护栏会并行运行。冗长复杂的自定义护栏会增加延迟。指令应简洁明确,并将不同检查拆分为单独的护栏。
- 了解认证实际涵盖的内容。SOC 2 Type 2 和 ISO 27001 是基本门槛。HIPAA 和 PCI DSS 等领域特定标准适用于受监管行业。ISO 42001 和AIUC-1等较新的 AI 专项认证涵盖偏见、透明度和对抗韧性,而 AIUC-1 认证还可帮助获得 AI 专项保险。
- 尽早建立流程能力。首次部署最耗时。投入测试和部署流程的团队,后续每个智能体的迭代速度都会显著加快。
观看完整研讨会
在此观看完整网络研讨会。

.webp&w=3840&q=80)
.webp&w=3840&q=80)


