推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

AI 智能体的多层安全框架

发布时间
最近更新

收听收听本文

随着 AI 智能体承担高风险工作,团队需要确信智能体的行为安全且可预测。

在 ElevenAgents 中,我们采用分层安全架构,涵盖对话各阶段的护栏、上线前的对抗测试、生产环境监控、数据保护和独立验证。

虽然任何非确定性系统都无法防范所有风险,但这套全面的安全框架让基于 ElevenAgents 构建解决方案的领先企业和政府机构能够设计出极少出错、可平稳恢复并达到高安全标准的智能体。

保护对话的每个阶段

你可以轻松启用和配置控件,保护每次交互的三个阶段。这是 ElevenAgents 中 Guardrails 2.0 的基础。

输入 - 实时检查用户发送的内容。

  • 操纵护栏会独立分析用户输入,并可在发现提示词注入迹象时结束对话。

决策 - 智能体决定采取何种行动时,如何引导其保持正确方向。

  • 系统提示词应包含明确指令,例如避免不当话题、定义智能体如何表明身份以及限制其职责范围。
  • 工作流和流程可将最敏感的操作置于工具调用之后,例如在共享任何账户详情前验证来电者身份。
  • Focus 护栏可强化现有系统指令并减轻偏移,这在长时间或复杂交互中尤为重要。

输出 - 独立验证器与响应生成并行运行,几乎不增加延迟。启用后,可拦截包含敏感内容或违反政策的响应。

  • 内容护栏通过按类别设置阈值,筛查敏感内容类别。
  • 自定义护栏执行以自然语言编写的领域专属规则,每条规则均由轻量级模型评估。
  • 退出策略让你定义护栏触发后的处理方式,例如结束通话、转接人工服务,或附加纠正指令后重新生成响应。

强大的上线前测试

ElevenAgents 提供强大的测试功能,帮助在平台上构建解决方案的团队在智能体或配置变更上线前发现并修复问题。

模拟 让你在任何真实交互前,与模拟用户进行完整的多轮对话。你定义场景,模拟器会推动对话直至完成,包括真实或模拟的工具调用。由于你可控制模拟用户,因此可将其设为敌对或具有操纵性,使验证常规路径的同一机制也能测试对抗性路径。

以下功能可进一步扩展测试覆盖范围:

  • 重复运行 可多次执行测试,并按失败原因分组,以发现错误模式和边缘情况。
  • 下一回复和工具调用测试检查单个响应和关键操作。
  • 渠道专属测试 验证智能体在每个发布渠道上的表现是否符合预期,因为智能体输出可按渠道调整(例如通话中简洁,电子邮件中详尽)。
  • 通过 API 进行红队测试。 也可使用红队测试 SDK 通过 API 运行测试。

上线后评估和改进智能体

部署智能体后,系统会持续评估实时对话。采用 LLM 评审方式,可根据你设定的标准自动评估每通对话。你可在仪表板中查看对话结果,并通过包含可搜索转录文本、来源、工具调用和护栏触发记录的详细对话日志追踪问题。

在生产环境发现的任何问题都可轻松反馈至测试套件。提出变更时,你可以使用 Experiments 将部分实时流量路由到变体,在广泛应用前衡量实际结果。

建议分阶段部署。先将有限流量导向智能体,评估这些对话;确认智能体运行符合预期后,再扩展到更多用例、渠道或地区。

保护敏感数据

智能体可处理支付详情、健康信息和个人标识符,因此需要考虑存储哪些数据、存储位置以及存储时长。

我们提供多种数据保护机制:

  • Zero Retention Mode 可为符合条件的服务启用,确保不保留特定类型的数据,专为严格的监管环境设计。
  • 对话历史记录脱敏会在通话结束后移除敏感实体,并在文本中替换为占位符、在音频中替换为哔声,精确到单个实体类型。
  • 可配置保留期限可使存储期限符合监管要求。
  • 数据驻留确保处理过程在指定司法辖区内进行。
  • 私有部署(VPC)可为高敏感度工作负载隔离环境。
  • 加密保护传输中和静态存储的数据。

平台级保障与外部验证

以上所有措施均建立在我们更广泛的 平台级保障之上。这是一项综合计划,涵盖内容溯源、滥用检测、禁止用途执行和模型红队测试。我们还通过安全合作伙伴计划,与 AI 安全领域的领先公司合作,为其产品和不断发展的行业标准贡献力量。

我们也接受独立审查,遵循 SOC 2 Type II、ISO 27001 和 GDPR 等通用安全与隐私标准,以及支付处理领域的 PCI DSS Level 1、美国医疗领域的 HIPAA 等行业及用例专属认证。更多信息请参阅我们的信任中心。

我们还符合较新的 AI 原生标准,例如管理 AI 管理体系的 ISO 42001,以及 AIUC-1;该标准要求 AI 智能体能够经受独立评估机构每季度进行的对抗模拟。AIUC-1 背后的同类能力,也让企业能够获得行业首批智能体保险保单。

对于大型或复杂的部署项目,我们的 前线部署工程师会与团队并肩合作,设计并实施智能体策略,包括配置、护栏、测试、监控和发布策略。

总结

ElevenAgents 的安全方案采用分层设计,各个要素相互强化:

  • 智能体配置: 通过系统提示词、工作流和流程塑造行为,并将最敏感的操作置于工具调用之后。
  • 护栏: 每个阶段均有独立检查:输入阶段检测操纵行为,决策阶段使用 Focus,输出阶段使用内容和自定义验证器,并提供可配置的退出策略。
  • 测试: 上线前进行对抗模拟、重复运行、渠道专属测试和红队测试。
  • 监控: 分阶段发布,随后持续评估,提供可搜索的日志和转录文本,以及上线后的反馈闭环。
  • 数据保护: 脱敏、Zero Retention Mode、可配置保留期限、数据驻留、私有(VPC)部署和加密。
  • 外部验证: 认证、AIUC-1 的独立对抗测试、智能体保险、红队测试和专家支持。

使用企业级安全控制部署智能体

需要其他帮助?前往 帮助中心

相关内容

用高质量 AI 音频创作