跳至内容

Guardrails 2.0:ElevenAgents 全新控制层

发布时间
最近更新

收听收听本文

随着 语音智能体 在支持、销售、营销、内部 workflow 等领域承担重要工作,团队需要确信它们能在企业规模下保持安全、符合品牌规范并满足合规要求。

ElevenAgents 中的 Guardrails 2.0 是重新设计的控制层,可引导智能体给出正确回复,并在不当回复触达最终用户前将其拦截。

Guardrails Cover

实时分层防护

精心设计的系统提示词能让大多数交互表现可预测。但智能体是非确定性系统,长时间对话中可能偏离目标;用户也可能以各种方式突破边界;即使定义清晰的政策,在模型承受压力时也未必始终有效。

因此,在生产环境部署智能体的团队需要分层防御:以强化的系统提示词为基础,同时独立检查用户输入和智能体回复。

Guardrails 2.0 从 3 个层面保护对话,各层相互增强:

作用
系统提示词强化
在系统提示词中定义允许和禁止的行为。Focus Guardrail 会在整个对话中强化这些指令。
用户输入验证
捕捉提示词注入和操控尝试的安全网,可终止存在安全风险的对话。
智能体回复验证
根据设定的政策实时评估每条回复。若回复违反规则,可在发送前拦截。
Guardrails
系统提示词强化
Focus
用户输入验证
Manipulation
智能体回复验证
Content、Custom Guardrails

预置防护

预置安全措施覆盖最常见的风险领域。

Focus Guardrail 会强化智能体的系统提示词,帮助回复保持明确、相关,并符合定义的目标和指令。在较长或复杂的对话中,智能体更容易偏离预期目标,此功能尤其有用。

Manipulation Guardrails 可检测并拦截用户试图绕过系统指令的行为。启用后,系统会分析用户输入,识别提示词注入或指令覆盖尝试的模式,并可终止存在安全风险的对话。

Content Guardrails 可筛查多个类别的潜在敏感或不安全内容,确保智能体回复恰当。每个类别都可调整阈值,实现精确控制。

Custom Guardrails:自动执行你的规则

Custom Guardrails 支持用自然语言定义特定领域的政策,并在每次通话中自动执行。这有助于减少事故、升级处理以及可能拖慢部署的合规审核周期。

Custom Guardrail Configuration Example

轻量模型会根据设定的规则评估每条智能体回复,并返回拦截或允许的决定;该过程独立运行,并与生成回复并行进行。

全面控制 Guardrails 的运行方式

可控制如何捕捉政策违规行为,以及后续处理方式。

执行模式。可配置速度与严格程度之间的平衡,这对延迟至关重要的语音场景尤为重要。Guardrails 可与回复并行运行,几乎不会增加延迟,但在拦截前可能会播放零点几秒音频。也可等回复完全通过检查后再发送,速度稍慢,但未经检查的内容不会触达用户。

退出策略。 Guardrail 被触发时,可定义后续操作:结束对话、转交给其他智能体、升级至人工处理,或通过修正指令重新生成回复。

内容敏感度级别。 可按不同内容类别调整敏感度。对于高风险用例可加强执行力度;过度拦截会损害用户体验的场景,则可适当放宽。

精细配置。 每个 Guardrail 都可单独启用或停用,不同智能体可使用不同配置。

完整可见性。 每次触发都会记录在对话分析中,包括触发的 Guardrail 及采取的操作。这为团队提供所需数据,可持续优化系统提示词和 Guardrails。

对话历史记录脱敏

通话结束后,可自动从转录文本、录音和 webhook 负载中删除敏感信息。保留分析、QA 和训练所需的所有内容,同时移除不需要的信息。

检测到的实体会在文本中替换为占位符,在音频中替换为哔声。可精确控制到单个实体类型:删除所有姓名或仅删除姓氏,删除所有财务标识符或仅删除支付卡号。

这项功能与更广泛的数据控制措施并行,例如 Zero Retention Mode,可用于合规要求更严格的部署。

Conversation History Redaction Example

对话历史记录脱敏和 Zero Retention Mode 面向企业客户提供。联系销售团队以获取访问权限。

更广泛信任与安全基础的一部分

Guardrails 2.0 和数据隐私功能支持企业部署 ElevenAgents,并为智能体生命周期的每个阶段提供安全工具:

智能体开发

  • 系统提示词设计、Guardrail 配置、红队测试和模拟,在智能体上线前对行为进行压力测试

每次对话

  • 对话期间: Guardrails 2.0(Focus、Manipulation、Content 和 Custom Guardrails)、日志记录、可选的 Zero Retention Mode
  • 对话结束后: 评估标准、监控、可选的对话历史记录脱敏

这些功能共同为团队提供所需控制能力,帮助以更少事故、更快审批周期和更一致的智能体行为,从试点走向生产环境。这些平台基础还支持获得 AIUC-1 认证资格,并获取业内首批智能体保险保单

立即开始使用 Guardrails

过去几个月,我们逐步推出了各项功能。完整的 Guardrails 2.0 套件现已在 ElevenAgents 中以 Alpha 版本提供。

在智能体设置的 安全 选项卡中启用,或通过 智能体设置,通过 API 配置。有关企业部署的更多信息,请联系销售团队

设置指南和最佳实践请参阅:

相关内容

用高质量 AI 音频创作