ウェビナーまとめ:欧州最大級の保険会社はいかにAIエージェントを本番導入したか
- 執筆者
- Anna Neely
- 公開日
聴くこの記事を聴く
保険の顧客が電話をかけてくるのは、物事が順調なときではほとんどありません。事故の後、保険金を請求するとき、あるいは深刻な危機の最中に電話をかけます。その会話が、その後のすべてを左右します。そして多くの場合、顧客にとって保険会社との唯一の実質的な接点です。
Admiralは、英国、イタリア、フランス、スペインで毎年数百万件ものこうした会話に対応しています。現在はコンプライアンスを維持しながら、その対応を支援するためにAIエージェントを活用しています。
このウェビナーでは、Admiralのチームがその方法を解説しました。最初のユースケースの選定、初日からの法務・コンプライアンス部門の参画、そして実用的なプロトタイプから、数週間ではなく数時間で本番変更をリリースできる体制への移行です。
主なポイント
- 範囲は絞りつつ、実用的に始める。 Admiralの最初の本番ユースケースは、英国の融資事業における返済見積もりでした。現実的なスケジュールでリリースできるよう範囲を限定しつつ、電話システムやバックエンドのインテグレーションにも対応し、一度にすべてを解決せずにアーキテクチャを実証できました。
- 拡大前に基準を上げ、下げない。 Admiralは初日から本番運用を前提に構築し、技術の進化速度に合わせてガバナンスのサイクルを再構築しました。また、明確に範囲を定めたパイロットに、初日から法務・コンプライアンス部門を参画させました。
- 規制は最低ラインであり、設計のすべてではない。 Admiralは規制要件に独自の社内ルールを重ね、証明が必要な事項には決定論的ロジックを用い、脆弱な状況にある顧客や精神的に困難な状況にある顧客は人間のエージェントへ案内します。
- 本番運用からが、本当の仕事の始まり。 すべてのエージェント変更は完全なシミュレーションテストスイートで検証され、トラフィックの1%から100%へと段階的に展開されます。このサイクルは数週間から数時間へと短縮されました。
範囲は絞る。ただし絞りすぎない
Admiralの最初の本番ユースケースは、英国の融資事業における返済見積もりでした。最も難しい課題ではなく、意図的に管理可能な出発点を選んだのです。Kampaはこのアプローチを、拡大する前に1つの国と1つの事業ラインを選んで試すことだと説明しました。
Neelyは、これこそが本番導入に到達するデプロイと停滞するデプロイを分けるパターンだと述べました。ユースケースは現実的な期間で解決できる程度に範囲を絞りながらも、周辺システムを実際に動かせるほど複雑でなければなりません。返済見積もりが機能したのは、会話の分岐が限られている一方で、電話システムやバックエンドのインテグレーションにも対応し、すべてを一度に解決しようとせずにアーキテクチャを実証できたからです。
この選択では、いくつかの点が重要でした。
- 限定された範囲と、現実の複雑さ。 ユースケースには、単なる台本どおりの理想的なフローではなく、電話システムとバックエンドのインテグレーションをテストできる十分なバリエーションが必要です。
- 迅速な本番導入。 開発中の状態が長引くほど、エージェントを真に改善するフィードバックを実際の会話から得るまでに時間がかかります。Neelyはこれを「最後の20%」、つまり実際の顧客がシステムと話し始めて初めて見えてくる部分と呼びました。
- ボリュームと影響を両立する。 Admiralは、待ち時間の短縮と迅速な解決が顧客体験に目に見える違いをもたらす、シンプルで件数の多い問い合わせから始めました。
拡大前に基準を上げ、下げない
Admiralの経営陣は、AIエージェントによってコンプライアンスとテストの基準を下げるのではなく、上げるべきだと明確に示しました。Kampaは、エージェントが台本から外れたりルールを破ったりするリスクは、人間のエージェントが判断を誤るリスクとは性質が異なるため、検証基準は従来より厳格でなければならないと率直に述べました。
この基準は、チームが早期に定めた3つの方針に表れています。
- 概念実証ではなく、本番運用を前提に構築する。 Kampaはチームに対し、拡大しない小規模な実験を行うのではなく、初日から本番稼働を目指して設計するよう伝えました。
- 技術の進化速度に合わせて動くガバナンス。 Kampaは、承認に6か月かかるガバナンスプロセスでは、リリース時にはすでに時代遅れの技術を承認してしまうリスクがあると指摘しました。Admiralは、基盤となるモデルやツールが変化する速度に合わせ、レビューのサイクルを再構築しました。
- 初日から法務・コンプライアンス部門を参画させる。 法務・コンプライアンス部門がいつプロジェクトに加わったか尋ねられると、KampaとClarkはともに即答しました。初日です。際限のない承認依頼ではなく、明確に範囲を定めたパイロット(一定件数の通話)として進めました。
規制を最低ラインとし、設計のすべてにしない
Clarkは、顧客にAIと話していることを伝えることや、一部の法域で人間へのエスカレーションを提供することなどの規制要件は、英国、イタリア、フランス、スペインで異なると明言しました。Admiralは、解決可能な会話から個々の発信者が「エスカレーション」で抜け出してしまわないようにしつつ、こうした違いに対応できるエージェントを構築しました。
特定の会話は、そもそもエージェントに対応させません。Admiralは、脆弱な状況にある顧客や精神的に困難な状況にある顧客を人間のエージェントへ案内し、AIにはその引き継ぎのきっかけとなるシグナルを検出できるよう学習させています。
Kampaは、より広範なアプローチを階層的なものとして説明しました。「規制はあくまで最低ライン」であり、その上にAdmiral独自の社内ルールや文化的な基準があり、規制要件を上回る場合もあります。
この階層化は、Admiralが決定論的ロジックと非決定論的ロジックをどこで使い分けるかにも影響しました。Clarkは、非決定論的な推論は発信者の意図の理解や困難な状況の検出に適している一方、事業として証明可能である必要があるもの、必須の規制上の説明、あるいは顧客を必ず案内しなければならないフローは、エージェントによる即興を一切許容せず、決定論的に実行する必要があると説明しました。
Neelyは、ElevenLabsのワークフロー構造がこれを実際にどのように支えるかを説明しました。エージェントは専門的なサブエージェントの集合として構築され、認証などの決定論的なゲートによって、条件を満たしているかどうかに応じて機能を有効化または制限します。モデルに許可された行動を推測させるのではありません。
プロセスのオーナーと共同で構築する
AdmiralとElevenLabsは、事業要件をエンジニアリングチームへ従来どおり引き継ぐのではなく、ユースケースを熟知する担当者、エンジニアリングチーム、電話システムチームを同じ場所に集めたオンサイトワークショップを実施しました。Neelyによると、最初のワークショップでは4~5時間以内に、バックエンドと電話システムに接続した動作するエージェントのv0が完成しました。KampaとClarkはこれを社内でデモし、開発継続の承認を得ることができました。
Clarkは、この近さの重要性は最初のプロトタイプにとどまらないと述べました。ワークショップでは、なじみのない新しい仕組みを導入するのではなく、既存の業務プロセスをプラットフォームへ移すものとして扱ったため、現在は業務オーナー自身が一部の変更を加えられるほど技術に近い位置にいます。Kampaはこれをより広い意味でのチェンジマネジメントにも結び付け、リーダー、中間管理職、現場スタッフを早い段階からプロセスに巻き込むことで、技術を副次的なプロジェクトではなく、実際の業務運営の一部にしています。
本番運用からが、本当の仕事の始まり
本番稼働後、Admiralは規模の大小を問わず、すべてのエージェント変更を同じように扱います。顧客に届く前に完全なシミュレーションテストスイートで実行するブランチとして扱うのです。Clarkは、トラフィックの1%から展開を始め、顧客満足度と解決率の指標をリアルタイムで確認し、数値が維持されれば100%まで拡大すると説明しました。このサイクルは数週間から数時間へと短縮されました。
この反復プロセスから、2つの教訓が得られました。
- 単語だけでなく、言語をローカライズする。 Admiralは当初、すべてのプロンプトとワークフローを英語で作成しましたが、フランス、スペイン、イタリアでのパフォーマンスは英国と一致しませんでした。英語から翻訳するのではなく、各市場の言語でプロンプトをネイティブに書き直すことで、現地の顧客の期待や文化に合った応答を実現しました。
- シミュレーションテストは形式的なものとして扱わず、真剣に取り組む。 Neelyは、少数のシミュレーションテストを通過するプロンプトを書くことは簡単に見えるが、エージェントに本当に負荷をかけるテストスイートを構築し、明確な成功基準を事前に定義することのほうが難しく、かつ重要だと述べました。Admiralは現在、すべての変更をリリースする前に、数百から数千件の会話シミュレーションで検証しています。
成果についてKampaは、対応時間を際立った指標として挙げました。AI主導の会話は、人間主導の会話よりも同じ解決により早く到達することが多く、その一因はシステムの読み込み中に無音の時間がないことです。また、一度の大きな飛躍ではなく、テストと調整を繰り返すことで、CSATと解決率が市場ごとに段階的に向上していると説明しました。
これから始める場合に得られること
この取り組みを始めるチームへのNeelyの助言は、範囲を適切に定めたユースケースを1つ選び、迅速に本番導入し、リリース前のテストを増やすのではなく、実際の顧客との会話にエッジケースを見つけてもらうことです。Clarkは、両端のインテグレーション(電話システムと社内システム)が実証されれば、チームは重要な評価と指標をすでに把握しているため、追加のユースケースへの拡大は徐々に速くなると付け加えました。
Kampaは締めくくりに、より先を見据えた展望を示しました。その目標は会話の自動化にとどまらず、ライブ文字起こし、ネクストベストアクションのプロンプト、トレーニングシミュレーションを通じて、同じAIレイヤーで人間のエージェントを直接支援することにも広がっています。
ホストが要約したように、この会話を貫くテーマは、規制とAIは対立するものではないということです。初日から監査可能性、一貫性、人間へのエスカレーションを念頭に構築したことで、Admiralのエージェントは自由度を増すのではなく、より規律あるものになりました。
セッション全編を見る
セッション全編はこちら。ライブ構築の様子と視聴者Q&Aもご覧いただけます。
.webp&w=3840&q=80)



