AI 智能体的多层安全框架
- 发布时间
- 最近更新
随着 AI 智能体承担高风险工作,团队需要确信其行为安全且可预测。
在 ElevenAgents 中,我们采用分层安全架构,涵盖对话各阶段的护栏、上线前对抗测试、生产环境监控、数据保护和独立验证。
虽然任何非确定性系统都无法防范所有风险,但这套全面的安全框架可帮助基于 ElevenAgents 构建的领先企业和政府机构设计出极少出错、能平稳恢复且符合高安全标准的智能体。
对话全程保护
可轻松启用和配置控件,保护每次交互的 3 个阶段。这是 ElevenAgents 中 Guardrails 2.0 的基础。
输入 - 实时检查用户发送的内容。
- 操控护栏会独立分析用户输入,并可在发现提示词注入迹象时结束对话。
决策 - 智能体决定行动时,如何引导并确保其不偏离目标。
- 系统提示词应包含对智能体的明确指令,例如避免不当话题、规定智能体如何表明身份,以及限制其职责范围。
- 工作流和流程可通过工具调用限制最敏感的操作,例如在共享任何账户详情前验证来电者身份。
- Focus 护栏会强化现有系统指令并缓解偏离问题,这对长时间或复杂交互尤为重要。
输出 -独立验证器与回复生成并行运行,几乎不增加延迟。启用后可拦截包含敏感内容或违反政策的回复。
- 内容护栏根据每个类别的阈值筛查敏感内容。
- 自定义护栏执行以自然语言编写的领域专属规则,每项规则均由轻量级模型评估。
- 退出策略可定义护栏触发后的处理方式,例如结束通话、转接人工,或通过修正指令重新生成回复。
可靠的上线前测试
ElevenAgents 提供可靠的测试功能,帮助平台构建者在智能体或配置变更上线前发现并修复问题。
模拟让你能在任何真实交互前,与模拟用户进行完整的多轮对话。定义场景后,模拟器会推动对话直至解决,其中包括真实或模拟的工具调用。由于可控制模拟用户,也可将其设为敌对或具有操控性,使验证常规路径的同一机制也能测试对抗性路径。
以下功能可进一步扩大覆盖范围:
- 重复运行可多次执行测试,并按原因归类失败结果,以发现错误模式和边缘情况。
- 下一条回复和工具调用测试检查单条回复和关键操作。
- 渠道专属测试验证智能体在每个发布渠道的表现是否符合预期,因为输出可按渠道调整,例如通话时简洁,邮件中则更详尽。
- 通过 API 进行红队测试。 也可通过 API 和红队测试 SDK 运行测试。
上线后评估和改进智能体
部署智能体后,系统会持续评估实时对话。采用 LLM 评审方式,可根据设定的标准自动评估每通通话。可在仪表板中查看对话结果,并借助包含可搜索转录文本、来源、工具调用和护栏触发记录的详细对话日志追踪问题。
可轻松将生产环境中发现的问题反馈到测试套件。提出变更时,可使用 Experiments 将部分实时流量路由至变体,并在广泛应用前衡量实际结果。
建议分阶段部署。先将有限流量分配给智能体,评估这些对话;确认智能体按预期运行后,再扩展到更多用例、渠道或地区。
保护敏感数据
智能体可能处理支付详情、健康信息和个人标识符,因此必须考虑存储哪些数据、存储位置及存储时长。
我们提供多种数据保护机制:
- Zero Retention Mode可为符合条件的服务启用,确保不保留特定类型的数据,适用于严格的监管环境。
- 对话历史记录脱敏会在通话后移除敏感实体,并按具体实体类型以文本占位符和音频哔声替代。
- 可配置保留期限使存储时限符合监管要求。
- 数据驻留确保处理在指定司法管辖区内进行。
- 私有部署(VPC)为高敏感度工作负载隔离环境。
- 加密保护传输中和静态数据。
平台级保障与外部验证
上述所有措施均建立在更广泛的平台级保障之上。这是一项涵盖内容溯源、滥用检测、禁止用途执行和模型红队测试的综合计划。通过安全合作伙伴计划,我们还与 AI 安全领域的前沿公司合作,为其产品和新兴行业标准作出贡献。
我们的方案也接受独立审查,符合 SOC 2 Type II、ISO 27001 和 GDPR 等通用安全与隐私标准,以及支付处理领域的 PCI DSS Level 1、美国医疗领域的 HIPAA 等行业和用例专属认证。更多信息请参阅信任中心。
我们还符合 ISO 42001 等较新的 AI 原生标准,该标准规范 AI 管理体系;以及 AIUC-1,后者要求 AI 智能体能够承受独立评估机构每季度进行的对抗模拟。AIUC-1 背后的同一能力还让我们获得了业界首批智能体保险保单。
对于大型或复杂的部署项目,我们的 前线部署工程师会与团队协作,设计并实施智能体策略,包括配置、护栏、测试、监控和发布策略。
总结
ElevenAgents 的安全方案采用分层设计,各层相互强化:
- 智能体配置:通过系统提示词、工作流和流程塑造行为,并通过工具调用限制最敏感的操作。
- 护栏:各阶段的独立检查:输入阶段的操控检测、决策阶段的 Focus,以及输出阶段的内容和自定义验证器,并配有可配置的退出策略。
- 测试:上线前进行对抗模拟、重复运行、渠道专属测试和红队测试。
- 监控:分阶段发布,随后持续评估、提供可搜索日志和转录文本,并在上线后形成反馈闭环。
- 数据保护:脱敏、Zero Retention Mode、可配置保留期限、数据驻留、私有(VPC)部署和加密。
- 外部验证:认证、AIUC-1 的独立对抗测试、智能体保险、红队测试和专家支持。

.webp&w=3840&q=80)


