跳至内容

AI 智能体的多层安全框架

发布时间
最近更新

收听收听本文

随着 AI 智能体承担高风险工作,团队需要确信其行为安全且可预测。

在 ElevenAgents 中,我们采用分层安全架构,涵盖对话各阶段的护栏、上线前对抗测试、生产环境监控、数据保护和独立验证。

虽然任何非确定性系统都无法防范所有风险,但这套全面的安全框架可帮助基于 ElevenAgents 构建的领先企业和政府机构设计出极少出错、能平稳恢复且符合高安全标准的智能体。

对话全程保护

可轻松启用和配置控件,保护每次交互的 3 个阶段。这是 ElevenAgents 中 Guardrails 2.0 的基础。

输入 - 实时检查用户发送的内容。

  • 操控护栏会独立分析用户输入,并可在发现提示词注入迹象时结束对话。

决策 - 智能体决定行动时,如何引导并确保其不偏离目标。

  • 系统提示词应包含对智能体的明确指令,例如避免不当话题、规定智能体如何表明身份,以及限制其职责范围。
  • 工作流和流程可通过工具调用限制最敏感的操作,例如在共享任何账户详情前验证来电者身份。
  • Focus 护栏会强化现有系统指令并缓解偏离问题,这对长时间或复杂交互尤为重要。

输出 -独立验证器与回复生成并行运行,几乎不增加延迟。启用后可拦截包含敏感内容或违反政策的回复。

  • 内容护栏根据每个类别的阈值筛查敏感内容。
  • 自定义护栏执行以自然语言编写的领域专属规则,每项规则均由轻量级模型评估。
  • 退出策略可定义护栏触发后的处理方式,例如结束通话、转接人工,或通过修正指令重新生成回复。

可靠的上线前测试

ElevenAgents 提供可靠的测试功能,帮助平台构建者在智能体或配置变更上线前发现并修复问题。

模拟让你能在任何真实交互前,与模拟用户进行完整的多轮对话。定义场景后,模拟器会推动对话直至解决,其中包括真实或模拟的工具调用。由于可控制模拟用户,也可将其设为敌对或具有操控性,使验证常规路径的同一机制也能测试对抗性路径。

以下功能可进一步扩大覆盖范围:

  • 重复运行可多次执行测试,并按原因归类失败结果,以发现错误模式和边缘情况。
  • 下一条回复和工具调用测试检查单条回复和关键操作。
  • 渠道专属测试验证智能体在每个发布渠道的表现是否符合预期,因为输出可按渠道调整,例如通话时简洁,邮件中则更详尽。
  • 通过 API 进行红队测试。 也可通过 API 和红队测试 SDK 运行测试。

上线后评估和改进智能体

部署智能体后,系统会持续评估实时对话。采用 LLM 评审方式,可根据设定的标准自动评估每通通话。可在仪表板中查看对话结果,并借助包含可搜索转录文本、来源、工具调用和护栏触发记录的详细对话日志追踪问题。

可轻松将生产环境中发现的问题反馈到测试套件。提出变更时,可使用 Experiments 将部分实时流量路由至变体,并在广泛应用前衡量实际结果。

建议分阶段部署。先将有限流量分配给智能体,评估这些对话;确认智能体按预期运行后,再扩展到更多用例、渠道或地区。

保护敏感数据

智能体可能处理支付详情、健康信息和个人标识符,因此必须考虑存储哪些数据、存储位置及存储时长。

我们提供多种数据保护机制:

  • Zero Retention Mode可为符合条件的服务启用,确保不保留特定类型的数据,适用于严格的监管环境。
  • 对话历史记录脱敏会在通话后移除敏感实体,并按具体实体类型以文本占位符和音频哔声替代。
  • 可配置保留期限使存储时限符合监管要求。
  • 数据驻留确保处理在指定司法管辖区内进行。
  • 私有部署(VPC)为高敏感度工作负载隔离环境。
  • 加密保护传输中和静态数据。

平台级保障与外部验证

上述所有措施均建立在更广泛的平台级保障之上。这是一项涵盖内容溯源、滥用检测、禁止用途执行和模型红队测试的综合计划。通过安全合作伙伴计划,我们还与 AI 安全领域的前沿公司合作,为其产品和新兴行业标准作出贡献。

我们的方案也接受独立审查,符合 SOC 2 Type II、ISO 27001 和 GDPR 等通用安全与隐私标准,以及支付处理领域的 PCI DSS Level 1、美国医疗领域的 HIPAA 等行业和用例专属认证。更多信息请参阅信任中心

我们还符合 ISO 42001 等较新的 AI 原生标准,该标准规范 AI 管理体系;以及 AIUC-1,后者要求 AI 智能体能够承受独立评估机构每季度进行的对抗模拟。AIUC-1 背后的同一能力还让我们获得了业界首批智能体保险保单

对于大型或复杂的部署项目,我们的 前线部署工程师会与团队协作,设计并实施智能体策略,包括配置、护栏、测试、监控和发布策略。

总结

ElevenAgents 的安全方案采用分层设计,各层相互强化:

  • 智能体配置:通过系统提示词、工作流和流程塑造行为,并通过工具调用限制最敏感的操作。
  • 护栏:各阶段的独立检查:输入阶段的操控检测、决策阶段的 Focus,以及输出阶段的内容和自定义验证器,并配有可配置的退出策略。
  • 测试:上线前进行对抗模拟、重复运行、渠道专属测试和红队测试。
  • 监控:分阶段发布,随后持续评估、提供可搜索日志和转录文本,并在上线后形成反馈闭环。
  • 数据保护:脱敏、Zero Retention Mode、可配置保留期限、数据驻留、私有(VPC)部署和加密。
  • 外部验证:认证、AIUC-1 的独立对抗测试、智能体保险、红队测试和专家支持。

相关内容

用高质量 AI 音频创作