ウェビナーまとめ:自然に聞こえるAIエージェントの構築
- 執筆者
- Luigi Sambuy
- 公開日
- 最終更新日
聴くこの記事を聴く
多くのチームが、自然に話すエージェントを作りたいと考えています。
多くのチームが直面する課題は、タスクは完了できても、文脈や緊急性、感情を理解できないエージェントです。発信者がそれに気づくと、信頼が損なわれ、やり取りの質も下がります。
最近開催したライブワークショップ:自然に話すAIエージェントの構築で、Luigi Sambuy(Forward Deployed Engineering)が、ロボットのように聞こえるエージェントと、本当に人間らしく感じられるエージェントの違いを解説しました。
自然に聞こえることが見た目以上に難しい理由
エージェントを導入する多くのチームは、すでに精度の問題を解決しています。エージェントは正しい回答をし、正しいテーブルを予約し、正しいフライトをキャンセルできます。
より難しいのは、伝え方を適切にすることです。
発信者の感情に寄り添えず、緊急性をくみ取れず、すべての質問に同じ平坦なリズムで答えるエージェントは、回答がどれほど正確でも不自然に感じられます。顧客は問題を解決してほしいだけではありません。その過程で、自分の話を聞いてもらえていると感じたいのです。
自然に話すエージェントの4つの特性
- リズムと流れ — 単調な読み上げではなく、自然な話すペース、間、速度の変化
- ミラーリング — いら立つ発信者には気遣いを示し、よい知らせには温かく応じること
- コンテキスト — ユーザー履歴、業務システム、文化・地域的な要素を取り込み、画一的な回答を避けること
- アイデンティティ — 既製のデフォルト音声ではなく、ブランドのために作られた音声
デモ:自然に話すエージェントの実例
シナリオ: 顧客がRosette Restaurantに電話し、予約時間の変更を依頼します。結婚5周年の記念日ですが、到着が遅れそうです。
デモの内容:
- エージェントはまず温かく応答し、何より先に記念日であることに触れました
- 伝えられた予約時間と実際に登録されていた時間の小さな食い違いを見つけ、推測せずに確認しました
- 依頼される前に予約を午後9時へ変更し、記念日のために窓側の席も提案しました
- 通話を通じて、自然な間やフィラーを使い、その場に合わせて安心感のある、温かく、急かさないトーンに調整しました
重要な理由: これは別のモデルや、より高性能なプラットフォームによるものではありません。プロンプトによるものです。システムプロンプトによって、文の途中で言い直すこと、「何かを調べている」間に自然に言葉を濁すこと、発信者に合わせて感情的なトーンを変えることがエージェントに許可されていました。これらは、現在プラットフォーム上で開発するどのチームでも利用できる手法です。
自然なエージェントを構築する7つの要素
- 感情タグ — v3会話モデルの表現モードで利用可能。トーンに変化をつけるうえで最も大きな鍵です
- バックグラウンドノイズ — オフィスの環境音、街の音、タイピング音により、親しみやすく人間らしい状況を演出
- システムプロンプト内のトーン — 実際には、違いの大部分はここで生まれます
- 積極性の設定(eager/normal/patient) — やり取りに必要な時間に合わせて設定
- 発音辞書/キーワード — 名前、ブランド名、外国語など、エージェントが誤って発音しがちな言葉に使用します。
- 出力設定 — 従来のコンタクトセンターから移行する顧客は少しこもった音質に慣れているため、クリアすぎるオーディオではなく、あえて背後に電話の着信音を加えるチームもあります
- ボイスデザインまたはクローン — 既製のものを選ぶのではなく、完全にカスタムでブランドに合った音声を作成します。ボイスデザインでは、具体的な音声をプロンプトで指定できます(例:「ヘッドセット越しに話しているように聞こえる30代男性」)。 ボイスクローンには、インスタントクローン(約30秒のオーディオ)から、プロフェッショナルボイスクローン(より多くの素材を使った高忠実度のクローン)まであります。
自然に話すエージェントのベストプラクティス
トーンをシステムプロンプトに直接書き込みましょう。 平坦なエージェントと自然なエージェントの違いの大部分は、実際にはここにあります。文の途中で言い直すこと(「人が実際に話すように」)、何かを調べる間に自然に言葉を濁すこと、重大な内容の後には少し沈黙を置いてから応答することを、エージェントに明示的に許可してください。
感情タグを状況に合わせましょう。 「excited」タグは、深刻な場面やリスクのある場面には不適切です。会話の中で実際に使われる箇所に意図してタグを置き、通話の進行に合わせて発信者の感情状態に適応させます(例:不安な発信者には落ち着いた安心感のあるトーン、急いでいる人には素早く温かいトーン)。
積極性を意図して設定しましょう。eagerはテンポがよく情報量の多いやり取りに、patientは書類や番号を探す時間が必要な場合に適しています。すべてをeagerに設定すると、自然というより押しつけがましい印象を与えることがあります。
ノードごとにLLMを選びましょう。 単純なルーティングには軽量で高速なモデルを、実際の意思決定を行うノードにはより高性能なモデルを使いましょう。
体感レイテンシも「自然さ」の一部として扱いましょう。 モデル選びに加え、推測的ターン生成(発信者がまだ話している間にモデルが応答の組み立てを始めること)とソフトタイムアウト時のフィラーは、基礎となる応答時間が変わらなくても、間が長く感じられるのを抑えられます。
翻訳ではなくローカライズを行いましょう。 対象言語で実際にトレーニングされた音声を選び、発音辞書を使い、単一言語のユースケースではパフォーマンス向上のためにプロンプト自体もその言語で書くことを検討してください。言語間での迅速なレイテンシが表現の幅よりも重要な場合、Multilingual v2は引き続き有力な選択肢です。
エージェントをモニタリングしましょう。 シミュレーションテストで実際の通話なしにエージェントを検証し、通話後の合否判定スコアリングには評価基準を使用します。また、ターンごとの感情分析により、会話のどこでエージェントが誤ったトーンを使ったかを正確に特定し、そのシグナルを使ってプロンプトを調整しましょう。
フルセッションを視聴
ウェビナー全編はこちら。



