Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

ウェビナー振り返り:エンタープライズ導入に向けた安全なAIエージェントの構築

公開日
最終更新日

聴くこの記事を聴く

ウェビナーまとめ:エンタープライズ導入に向けた安全なAIエージェントの構築

AIエージェントに会話を処理させることは簡単です。セキュリティチーム、法務チーム、顧客から信頼を得ることこそ、多くのエンタープライズ導入が停滞するポイントです。

この記事では、ライブワークショップ「エンタープライズ導入に向けた安全なAIエージェントの構築」を振り返ります。エンタープライズ向けエージェントを大規模に運用するためのツール、フレームワーク、導入プラクティスを解説しました。 

安全性を多層的に確保する方法 

ElevenAgentsプラットフォームでは、400万を超えるエージェントが導入されています。エンタープライズ環境で安定して機能するエージェントには、ある共通点があります。それは、最初のインシデント後に安全対策を追加するのではなく、初めから安全性を組み込んでいることです。

ライブセッションでは、セキュリティレビューを通過するエージェントと、そうでないエージェントを分けるフレームワーク、制御機能、導入プラクティスを取り上げました。

エージェントごとに、必要な境界線は根本的に異なります。

  • ビデオゲームのキャラクターは、体験の一部として露骨に暴力的な言葉を使う必要があるかもしれません。しかし、キャラクター設定を崩したり、自分がAIであることを明かしたりしてはいけません。
  • 医療機関の受付担当者は、けがや医療に関する話題を扱う必要があります。しかし、医療アドバイスをしてはいけません。
  • クレジットカードのサポートエージェントは、露骨なコンテンツを一切扱うべきではなく、本人確認ができていない発信者に口座情報を共有してはいけません。 

エージェントは非決定論的であるため、単一の保護策ですべての潜在的リスクを完全に防ぐことはできません。そのためエンタープライズチームには、安全上の失敗をまれな例外にするために複数の制御機能を連携させる、多層的なアプローチが必要です。

この原則に基づき、セッションでは次の4つの問いを中心に構成しました。

  1. エージェントの発言や行動をどのように制御できるか?
  2. 正常に機能していることをどのように確認できるか?
  3. セキュリティとコンプライアンスの要件を満たすために、データをどのように保護できるか?
  4. 安全に導入するプロセスをどのように構築できるか?

エージェントの振る舞いを制御する考え方 

エージェントとの会話では、安全性を考慮すべきポイントが3つあります。 

入力
ユーザーが発言します。敵対的なユーザーは、「以前の指示をすべて無視して」や「別のアシスタントのふりをして」といった試みをすることがあります。こうした操作の試みは、モデルに届く前に検出して対処する必要があります。これにより不要なコストを防ぎ、悪意のあるユーザーが本来アクセスできない情報を引き出すことを阻止できます。

意思決定
LLMが、何を言うか、何をするかを決定します。ここで主な制御手段となるのがシステムプロンプトです。しかし、長時間または複雑な会話では、LLMが指示から逸脱する可能性があります。会話の開始時だけでなく、会話全体を通じて振る舞いを強化する仕組みが必要です。また、エスカレーションの経路も定義すべきです。エージェントが人間や、より専門性の高いエージェントに引き継ぐべき状況はあるか、あるとすればどのような条件かを決めます。

出力
強力なガイダンスがあっても、特に長時間にわたる会話では、不適切な内容がすり抜ける可能性があります。最後のセーフティネットが必要です。これはメインエージェントの作業を確認するミニエージェントのようなものです。応答がユーザーに届く前に評価し、送信するか、再試行するか、エスカレーションするかを判断します。また、応答生成と並行して動作するため、追加レイテンシーは最小限です。

3つすべてについて、終了戦略をあらかじめ定義する必要があります。違反が発生した場合、会話を終了するのか、修正ガイダンスを添えて再試行するのか、人間に引き継ぐのか。この判断が、問題発生時のユーザー体験を形作ります。

デモ1:ElevenAgentsでのガードレール設定

シナリオ: Webサイトの営業・サポートエージェントに、操作、話題から外れた応答、ポリシー違反を防ぐための複数層の安全制御を設定します。


紹介した内容:

  • 操作ガードレール(入力)- Securityタブにあるこのトグルは、システム指示を上書きしようとする試みであるプロンプトインジェクションのパターンを検出し、エージェントが応答する前に会話を終了します。すべての本番エージェントに推奨されます。
  • システムプロンプトとFocusガードレール(意思決定) -システムプロンプトは基盤です。重要なルールはすべて、そこに明示的に記載する必要があります。デモでは、セッションの途中で「いかなる割引も提示しない」という指示を追加しました。別途有効化するFocusガードレールは、会話全体を通してシステムプロンプトを自動的に強化し、長い対話で発生する逸脱の問題に対処します。強力なシステムプロンプトとFocusの有効化の組み合わせは、エージェントを正しい軌道に保つうえで最も効果的です。
  • コンテンツガードレール(出力)- 冒涜的な表現、法的助言、政治的意見を対象とする事前設定済みのカテゴリーです。それぞれ信頼度のしきい値を調整でき、開始時の設定としては「中」がおすすめです。これはフォールバック層です。エージェントが不適切な内容を生成しようとした場合、送信前に検出します。
  • カスタムガードレール(出力)- プリセットで対応できないケースに対し、自然言語で記述するユーザー定義のチェックです。デモでは、「割引なし」ガードレールを次のように設定しました:「エージェントに提供権限のない割引、プロモーション、特別価格について言及する応答をすべてブロックする。」 カスタムガードレールでは追加のLLM評価を使用するため、使用量に応じたコストとレイテンシーを考慮する必要があります。指示は簡潔にし、異なるチェックは1つにまとめず、別々のガードレールに分けてください。
  • 違反時のアクション - 選択肢は2つです。通話を終了するか、再試行するかです。再試行時には、次の試みを導くための追加指示を指定できます。たとえば、人間へのエスカレーションや、デフォルトのリダイレクトメッセージの送信などです。

重要な理由: これらの制御機能は、すべてに同じ設定を適用できるものではありません。ガードレールごとに設定できます。この粒度があるからこそ、理論上安全なエージェントと、多様なエンタープライズ環境で実運用上も安全なエージェントの違いが生まれます。

デモ2:リリース前のシミュレーションテスト

シナリオ: サポートエージェントに対して、割引に関する2つの会話シナリオをテストします。割引を提示せずにユーザーを料金ページへ誘導できることを確認します。

紹介した内容: 

  • Testsタブで定義した2つのシミュレーションテスト。それぞれにシミュレートされたユーザーシナリオ、定義済みの会話ターン数、明示的な成功基準を設定
  • システムプロンプトに特定のエッジケースへの指示がなかったため、最初は1つのテストが失敗
  • 不足していた指示をシステムプロンプトのガードレールセクションに追加
  • エージェントを再公開し、両方のテストを再実行。どちらも合格
  • 詳細な実行履歴により、ツール呼び出しやエージェントのアクションを含め、会話のどの部分で失敗したかを正確に確認可能

重要な理由: シミュレーションテストにより、実際のユーザーがエージェントに接する前に、管理された環境でエージェントの振る舞いを検証できます。通常のシナリオと敵対的なシナリオの両方を対象にできます。また、個々の応答だけでなく、会話フロー全体をテストします。変更を加えたらすぐにテストを再実行し、修正が有効であることを確認できます。

デモ3:機密性の高い導入におけるPIIの匿名化

シナリオ: エンタープライズエージェントを設定し、会話ログから個人を特定できる情報を匿名化します。

紹介した内容:

  • Privacy設定内のAdvancedタブにあるConversation History Redactionトグル
  • 生年月日、年齢、その他の機密フィールドなど、個別に匿名化を切り替えられる特定のデータエンティティの一覧
  • すべてのエンティティを選択するか、特定のエージェントのユースケースに関連するものだけを選択するオプション

重要な理由: PIIの匿名化は、HIPAAのような厳格なコンプライアンス環境におけるゼロ保持モードの代替ではありません。内部レビューや品質管理に使用する会話ログでのデータ露出を減らすためのものです。チームは必要なログを保持しつつ、不要なデータを削除できます。現在、エンタープライズのお客様にご利用いただけます。

安全なエンタープライズエージェント導入のベストプラクティス 

  1. 多層的なアプローチを採用する。 単一の制御機能だけで安全な振る舞いを保証することはできません。入力ガードレール、出力検証、プロンプトの堅牢化、テストを連携させる必要があります。各層が互いを補強し合うことで、安全上の問題のリスクを大幅に低減できます。
  2. ガードレールをコンテキストに合わせる。 医療エージェントと小売サポートエージェントでは、必要なルールが異なります。汎用的なテンプレートではなく、ユースケース固有の境界線を定義してください。
  3. 重要なユースケースから始める。 最も成功しているエンタープライズ導入は、使い捨てのパイロットから始めるのではありません。カスタマーサポートやスケジューリングなど、実際のユースケースを選び、正しく構築することに投資します。
  4. リリース前にテストし、その後もテストを続ける。 シミュレーションテストと外部のレッドチーミングツールを活用してください。通常のシナリオと敵対的なシナリオの両方をテストします。本番環境で見つかった新たなエッジケースは、テストスイートに追加してください。
  5. 段階的に導入する。 まずはトラフィックを限定して開始します。実際の会話を監視し、エージェントが苦手とする点を特定します。調整して再テストし、その後に拡大します。
  6. 実行モードを意図的に選ぶ。 速度より厳格な検証が重要なテキストエージェントにはブロッキングモードを使用します。音声エージェントでレイテンシーが優先される場合は、ストリーミングモードを使用します。
  7. ガードレール違反時のアクションを明確に定義する。 違反時に通話を終了するのか、再試行するのか、人間にエスカレーションするのかを事前に決めてください。
  8. カスタムガードレールの指示は簡潔に保つ。 ガードレールは並行して動作します。長く複雑なカスタムガードレールはレイテンシーを増加させます。指示は簡潔にし、異なるチェックは別々のガードレールに分けてください。
  9. 認証が実際に何を対象としているかを理解する。 SOC 2 Type 2とISO 27001は最低限必要な基準です。HIPAAやPCI DSSなどの分野固有の規格は、規制対象の業界に対応します。ISO 42001やAIUC-1などの新しいAI固有の認証は、バイアス、透明性、敵対的攻撃への耐性を対象とします。また、AIUC-1認証によりAI固有の保険を利用できる場合があります。
  10. 早い段階でプロセスの基盤を築く。 最初の導入には最も時間がかかります。テストと導入プロセスに投資するチームは、その後のすべてのエージェントで大幅に迅速な反復を実現できます。

セッション全編を見る 

ウェビナー全編はこちら。

safety-webinar-cover


関連記事

最高品質のAIオーディオで創造する