Guardrails 2.0:ElevenAgents 全新控制层
- 发布时间
- 最近更新
收听收听本文
随着 语音智能体 在客服、销售、营销、内部工作流程等领域承担高影响力工作,团队需要确信它们能在企业级规模下保持安全、符合品牌调性并满足合规要求。
ElevenAgents 中的 Guardrails 2.0 是重新设计的控制层,可引导智能体给出正确回复,并在错误回复触达最终用户前加以阻止。

实时分层防护
精心设计的系统提示词能让大多数交互的行为保持可预测。但智能体是非确定性系统,长时间对话中可能偏离方向;用户也可能用各种巧妙方式突破边界;即使定义明确的策略,在模型承压时也未必始终有效。
因此,将智能体部署到生产环境的团队需要分层防御:以强化的系统提示词为基础,并独立检查用户的输入和智能体的回复。
Guardrails 2.0 从 3 个层面保护对话,彼此相互增强:
预置防护
预置防护措施覆盖最常见的风险领域。
Focus Guardrail 会强化智能体的系统提示词,帮助回复保持明确、相关,并与设定的目标和指令一致。在较长或复杂的对话中,智能体更容易偏离预期目标,此功能尤其有用。
Manipulation Guardrails 可检测并阻止用户绕过系统指令的尝试。启用后,系统会分析用户输入中表明提示词注入或指令覆盖尝试的模式,并可终止存在安全风险的对话。
Content Guardrails 会筛查多类潜在敏感或不安全内容,帮助确保智能体回复恰当。每个类别均可调整阈值,实现精准控制。
Custom Guardrails:自动执行你的规则
Custom Guardrails 让你能用自然语言定义特定领域策略,并在每通通话中自动执行。这有助于减少事故、升级处理以及可能拖慢部署的合规审查周期。
.webp&w=3840&q=80)
轻量级模型会根据规则评估每条智能体回复,并返回拦截或允许的决定。它独立运行,并与回复生成并行进行。
全面掌控防护栏的运行方式
你可以控制如何发现策略违规,以及后续操作。
执行模式。 配置速度与严格程度之间的平衡——这对最看重延迟的语音场景至关重要。你可以让防护栏与回复并行运行,几乎不会增加延迟,但拦截前可能会播放几分之一秒的音频。也可以等待回复完全通过检查后再发送——速度稍慢,但不会有未经检查的内容触达用户。
退出策略。 触发防护栏时,可定义后续操作:结束对话、转接给其他智能体、升级至人工客服,或通过修正指令重新生成回复。
内容敏感度。 可分别调整各内容类别的敏感度:针对高风险用例加强执行力度,在过度拦截会影响用户体验的场景适当放宽。
精细配置。 每项防护栏都可单独启用或停用,不同智能体 可采用不同配置。
全面可见。 每次触发都会记录在对话分析中,包括触发的防护栏及采取的操作。这为团队持续优化系统提示词和防护栏提供所需数据。
对话历史脱敏
通话结束后,可自动从文字记录、录音和 webhook 负载中脱敏敏感信息。保留分析、QA 和训练所需的一切内容,同时移除不需要的信息。
检测到的实体会在文本中替换为占位符,在音频中替换为哔声。你可精细控制到单个实体类型:脱敏所有姓名或仅姓氏,脱敏所有金融标识符或仅支付卡号。
此功能可与更广泛的数据控制措施配合使用,例如 Zero Retention Mode,后者可用于合规要求更严格的部署。
.webp&w=3840&q=80)
对话历史脱敏和 Zero Retention Mode 面向企业客户提供。联系销售团队 获取访问权限。
更广泛信任与安全体系的一部分
Guardrails 2.0 和数据隐私功能支持 ElevenAgents 的企业级部署,并为智能体生命周期的每个阶段提供安全工具:
智能体开发
- 系统提示词设计、防护栏配置、红队测试和模拟,在智能体上线前对其行为进行压力测试
每次对话
- 对话期间: Guardrails 2.0(Focus、Manipulation、Content 和 Custom Guardrails)、日志记录、可选的 Zero Retention Mode
- 对话后: 评估标准、监控、可选的对话历史脱敏
这些功能共同为团队提供所需控制能力,帮助以更少事故、更快审批周期和更一致的智能体行为,从试点顺利进入生产环境。这些平台基础也支持获得 AIUC-1 认证资格,并可获取业界首批 智能体保险保单。
立即开始使用 Guardrails
过去几个月,我们陆续推出了多项功能;现在,完整的 Guardrails 2.0 套件已在 ElevenAgents 中以 Alpha 版提供。
在智能体设置的 安全 标签页中启用,或通过 API 配置。如需了解企业级部署详情,请联系销售团队。
如需设置指南和最佳实践,请参阅:
.webp&w=3840&q=80)


