Guardrails 2.0:ElevenAgentsの新しいコントロールレイヤー
- 公開日
- 最終更新日
聴くこの記事を聴く
音声エージェントがサポート、営業、マーケティング、社内ワークフローなどで重要な業務を担うなか、チームには、エンタープライズ規模でも安全性、ブランド整合性、コンプライアンスを維持できるという確信が必要です。
ElevenAgentsのGuardrails 2.0は、エージェントを適切な応答へ導き、不適切な応答がエンドユーザーに届く前に防ぐために再設計された制御レイヤーです。

リアルタイムの多層保護
適切に作成されたシステムプロンプトにより、大半のやり取りで予測可能な動作を実現できます。ただし、エージェントは非決定論的なシステムであるため、長い会話では本来の目的から逸脱することがあります。ユーザーが独創的な方法で制約を回避しようとする場合もあり、明確に定義されたポリシーでも、モデルに負荷がかかると常に守られるとは限りません。
そのため、本番環境にエージェントを導入するチームには、多層的な防御が必要です。基盤となる堅牢なシステムプロンプトに加え、ユーザーの発言とエージェントの応答を独立してチェックします。
Guardrails 2.0は、互いを補完し合う3つのレベルで会話を保護します。
組み込みの保護機能
組み込みのセーフガードで、最も一般的なリスク領域をカバーします。
Focus Guardrailは、エージェントのシステムプロンプトを強化し、応答を目的に沿った関連性の高いものに保ち、定義した目標や指示との一貫性を維持します。これは、エージェントが本来の目的から逸脱しやすい長時間または複雑な会話で特に役立ちます。
Manipulation Guardrailsは、ユーザーがシステム指示を回避しようとする試みを検出し、ブロックします。有効にすると、プロンプトインジェクションや指示の上書きを示すパターンがユーザー入力にないかを分析し、セキュリティリスクのある会話を終了できます。
Content Guardrailsは、潜在的にセンシティブまたは安全でないコンテンツを複数のカテゴリで検査し、カテゴリごとにしきい値を調整することで、適切なエージェント応答を実現します。
Custom Guardrails:独自のルールを自動で適用
Custom Guardrailsでは、ドメイン固有のポリシーを自然言語で定義し、すべての通話に自動適用できます。これにより、インシデントやエスカレーション、導入を遅らせるコンプライアンスレビューのサイクルを削減できます。
.webp&w=3840&q=80)
軽量モデルがすべてのエージェント応答をルールに照らして評価し、ブロックまたは許可の判定を返します。応答生成とは独立して並行実行されます。
ガードレールの実行を完全に制御
ポリシー違反をどのように検出し、その後に何を行うかを制御できます。
実行モード。速度と厳格さのトレードオフを設定します。レイテンシーが最も重要な音声では特に不可欠です。ガードレールを応答と並行して実行すれば、ほぼ遅延なく処理できますが、検知までに一部の音声が再生されることがあります。あるいは、応答を完全にクリアされるまで保留できます。わずかに遅くなりますが、未確認の応答がユーザーに届くことはありません。
終了戦略。ガードレールが作動した場合の次の対応を定義できます。会話を終了する、別のエージェントに転送する、人間の担当者にエスカレーションする、修正指示とともに応答を再試行する、といった選択肢があります。
コンテンツの感度レベル。コンテンツカテゴリごとに感度を調整できます。高リスクのユースケースでは適用を厳格化し、過剰なブロックがユーザー体験を損なう場合は緩和できます。
きめ細かな設定。各ガードレールは個別に有効化・無効化でき、異なるエージェントで異なる設定を実行できます。
完全な可視性。どのガードレールが作動し、どの対応が取られたかを含め、すべてのトリガーが会話分析に記録されます。これによりチームは、時間をかけてシステムプロンプトとガードレールを改善するために必要なデータを得られます。
会話履歴の匿名化
通話終了後、文字起こし、録音、Webhookペイロードからセンシティブな情報を自動的に匿名化できます。分析、QA、トレーニングに必要な情報は保持しつつ、不要な情報を除去できます。
検出されたエンティティは、テキストではプレースホルダーに、音声ではビープ音に置き換えられます。エンティティタイプごとに詳細度を制御できます。すべての氏名を匿名化するか姓だけにするか、すべての金融識別子を対象にするか決済カード番号だけにするかを選べます。
これは、より広範なデータ管理機能であるZero Retention Modeと併用できます。より厳しいコンプライアンス要件がある導入で利用できます。
.webp&w=3840&q=80)
会話履歴の匿名化とZero Retention Modeは、エンタープライズのお客様にご利用いただけます。営業チームに問い合わせるアクセスをご希望の場合はお問い合わせください。
より広範な信頼性と安全性の基盤の一部
Guardrails 2.0とデータプライバシー機能は、エージェントのライフサイクルのあらゆる段階に対応するセーフティツールとともに、ElevenAgentsのエンタープライズ導入を支援します。
エージェント開発
- エージェントの本番稼働前に動作のストレステストを行うための、システムプロンプト設計、ガードレール設定、レッドチーミング、シミュレーション
すべての会話
- 会話中:Guardrails 2.0(Focus、Manipulation、Content、Custom Guardrails)、ログ記録、任意のZero Retention Mode
- 会話後:評価基準、モニタリング、任意の会話履歴の匿名化
これらを組み合わせることで、チームは必要な制御機能を活用し、インシデントを減らし、承認サイクルを短縮し、より一貫性のあるエージェント動作でパイロットから本番環境へ移行できます。こうしたプラットフォーム基盤は、AIUC-1認証の取得資格や、業界初のエージェント保険ポリシーへのアクセスも支援します。
今すぐGuardrailsを使い始める
過去数か月にわたり機能を順次提供してきましたが、Guardrails 2.0のフルスイートがElevenAgentsでアルファ版として利用可能になりました。
セキュリティタブで有効にするか、エージェントの設定からAPI経由で設定してください。エンタープライズ導入の詳細については、営業チームまでお問い合わせください。
設定ガイドとベストプラクティスについては、以下をご覧ください。
.webp&w=3840&q=80)



