コンテンツへ移動

インタラクションモデル:自然な人間とAIの対話を実現

執筆者
Jack Limebear
公開日
最終更新日

聴くこの記事を聴く

AI 音声エージェントの話の途中で割り込もうとしたことがある人なら、人との会話を想定して作られていないシステムがどのようなものか、よく分かるはずです。リズムは不自然で、声と内容は切り離され、情報が正確でもやり取りには違和感があります。知識豊富な人と話すというより、たまたま言葉を使うソフトウェアを操作しているように感じられます。

この不自然さの原因は構造にあります。多くの音声AIシステムは、会話ではなくターンを処理するために作られています。一度に1つの発話を聞き、処理し、応答します。単純なデモでは機能しますが、会話が感情的で予測不能になると破綻します。

インタラクションモデルは、音声とテキストをまたいでリアルタイムにコミュニケーションするよう設計されたAIシステムです。何を言ったかだけでなく、いつ言ったか、その場でどのような感情的応答が求められるかも捉えます。この記事では、インタラクションモデルが従来と何が違うのか、音声AIを導入する企業にとってなぜ重要なのか、そしてElevenLabsがどのように実現を目指しているのかを解説します。

概要

  • 多くの音声AIは、割り込み、沈黙、ターンをまたいで引き継がれるコンテキストを扱えないため、実際の会話ではうまく機能しません。
  • ElevenLabsのインタラクションスタックは、コンテキストを失ったり会話の流れを崩したりすることなく、割り込み、間、発話の重なりを処理できるよう設計されています。
  • ElevenLabsは、高度なカスケードアーキテクチャ、自社開発のスピーチtoテキスト(STT)とテキスト読み上げ(TTS)、低レイテンシーで自然な対話を実現するよう調整されたスタックにより、真のインタラクションモデルの実現を目指しています。

人間とAIの音声コミュニケーションの多くが自然に感じられない理由

多くの音声AIは、会話を個別の入力と出力の連続として扱います。システムはひとまとまりの発話を待ち、それをテキストに変換して処理し、応答します。これは命令と応答のやり取りには有効ですが、実際の会話は整然としたテキスト交換の連続ではありません。間や相づちを含む、途切れないやり取りです。 

ターン間の流れと、ターンをまたいで引き継がれるコンテキストを取り除くと、具体的に次の3つの問題が生じます。

  • 途中で割り込むか、待たせる: システムは、考えるための間と発話が終わったことを区別できません。そのため、まだ話している途中に割り込んだり、話し終えた後に無音のままになったりします。文の途中で考えをまとめようとすると遮られ、話し終えると無音の時間を待つことになります。
  • 話し始めると反応できない: システムは応答を始めた瞬間に、聞くことをやめます。話題を変えるために割り込んでも、何かが変わったことを認識できないため、すでに関心がなくなった質問への回答を続けます。
  • 会話が進むにつれて忘れる: 各ターンが個別に処理されるため、5回前のやり取りのコンテキストは引き継がれません。同じことを繰り返す羽目になるか、システムがまるで会話が始まったばかりのように応答します。

その結果、機能的には正しくても、違和感のある会話になります。 

従来の音声AIにはできないインタラクションモデルのこと

従来の音声AIが一度に1ターンを処理するのに対し、インタラクションモデルは会話全体を動かし、何が話されているか、次に何をすべきかを同時に捉えます。機能上の違いは、インタラクションモデルが直近の入力だけでなく、やり取りの実際の状態に応答することです。

インタラクションモデルの特徴:

  • リアルタイム応答: システムは会話の速度で応答するよう設計されており、設定によってはエンドツーエンドのサイクルを1秒未満で実行できます。
  • 割り込み、沈黙、発話の重なりを自然に処理: 考えるための間と発話終了を区別するため、相手を遮ったり無音を残したりしません。顧客が話題を変えるために重ねて話しても、コンテキストを失ったり会話が破綻したりせずに処理します。
  • やり取り全体での継続性: ターンごとにコンテキストをリセットするのではなく、会話履歴を引き継ぎます。そのため、10ターン目の発言にも、最初のターン以降に起きたすべてのことが反映されます。
  • 適応的な話し方: 実行しているタスクに応じて、音声をより落ち着いた、より直接的な、より安心感のある話し方へと変えるようプログラムできます。
  • 並行タスク実行: 情報の取得やツール呼び出しを実行しながら話し続けるため、何かを調べる間に無音になることはありません。

インタラクションモデルが試されるのは、うまくいっていない通話です。以下の録音では、顧客がフライトの欠航について電話をかけています。顧客は緊張しており、問題をすぐに解決する必要があります。

mark screenshot w caption space

エージェントは、顧客が使う言葉から緊急性と苛立ちをすぐに認識します。口調を調整し、話の位置を見失うことなく割り込みを処理し、接続されたツールを使って欠航便に対する実際の解決策を提案します。最終的に、顧客は人間のエージェントを必要とせず問題を解決できます。

これを、現在一般的に使われているターンベースのエージェントと比べてみましょう。こうしたシステムは各々の間を待ち、中立的な基準で回答するため、顧客が感じている苛立ちを完全に見逃します。発信者が実際に感じていることに応えないやり取りが数回続けば、通話は人間に引き継ぐ必要が生じる可能性が高く、顧客は最初よりもさらに不満を感じることになります。

ElevenLabsがインタラクションモデルを実現するまで

会話パイプラインには、高度なカスケードアーキテクチャを採用しています。単一のモデルがすべてを処理する融合型とは異なり、各ステージが専門化された独自のコンポーネントです。

このアプローチの利点は、システム全体を作り直すことなく、パイプラインの各ステージを個別に最適化し、任意のコンポーネントをより優れたモデルに入れ替えられることです。また、これらのコンポーネントを自社で開発しているため、単なるデータではなく豊富なコンテキストを相互に渡せるよう共同で最適化されています。これにより、パイプラインは個別ツールの連鎖ではなく、一貫した1つの会話として動作します。

カスケードモデルの構造

Flowchart of an audio processing system: Audio, Speech-to-Text, LLM, Text-to-Speech, Audio in an interaction model

融合モデルの構造

Audio processing flowchart: Audio > Combined System (STT, LLM, TTS, Tools) > Audio.

画像:カスケードモデルと融合モデル

現在、パイプラインを構成する技術は次のとおりです。

  • Scribe v2 Realtime: 自社開発のSTTモデルは、90以上の言語で約150msの音声文字起こしを実現します。バックグラウンドノイズ、アクセント、割り込み、笑い声や間などの非言語イベントにも対応します。医療用語から金融業界の専門用語まで、分野固有の語彙も処理できるよう構築されています。
  • 推測的ターンテイキング: このシステムは固定的な無音しきい値に依存せず、会話の流れを読み取って、話す、間を置く、待つべきタイミングを判断します。音声活動検出モデルの改善により、バックグラウンドの発話や短い応答をより適切に除外し、ターンテイキングをより自然にします。
  • Eleven v3 Conversational: ライブの双方向対話向けに構築された、最も表現力豊かなTTSモデルです。会話の感情的な温度感をターンをまたいで引き継ぐため、10ターン目のエージェントの話し方には、直近の応答だけでなく、それまでのすべてが反映されます。
  • Expressive Mode: Eleven v3 Conversationalとターンテイキングシステムを基盤とするExpressive Modeは、その瞬間のエージェントの話し方を制御します。顧客が不満を感じているときは緊張を和らげ、混乱しているときは安心感を与え、明確さが必要なときは直接的に伝えます。また、表現タグも読み取るため、[laughs]、[whispers]、[sighs]のような合図をもとに、特定の場面での話し方を調整できます。
  • Flash v2.5: 低レイテンシーTTSモデルは32言語に対応し、75ms未満で音声を生成します。レイテンシーが優先される場合でも、自然な人間のリズムに収まる応答時間を維持します。
  • Speech Engine: スタック全体をつなぐ接続レイヤーです。サーバーをElevenAPIへWebSocket経由で接続します。会話ごとに1接続です。ElevenLabsがSTTとTTSを処理する一方で、サーバー側でLLMを実行できるため、技術チームは独自のモデルを導入し、会話ロジックを自社インフラ上に保持できます。

これらのモデルは継続的に改善されており、新バージョンも定期的にリリースされています。応答の高速化、より的確な感情認識、対応言語の拡大、より滑らかな話し方によって、リリースのたびにソフトウェアと話すことと人と話すことの差が縮まっています。

考えながら話す

インタラクションモデルのすべてが厳密な順序で実行される必要はありません。ElevenAgentsは、質問と回答の間に無音になるのではなく、会話を続けながらバックグラウンドで作業を進められます。 

いくつかのコアシステムが連携し、話すことと思考を同時に可能にします。

  • 並行ツール呼び出し: エージェントは、話している最中でもデータベースへのクエリ、ツールの実行、注文状況の確認を行えるため、情報取得が会話の無音時間のように感じられることはありません。 
  • ソフトタイムアウト: LLMが応答生成に予想より時間がかかる場合、エージェントは気まずい沈黙を残す代わりに、「少々お待ちください」や「うーん」といった短いつなぎの言葉を発します。 ソフトタイムアウトは、自然な会話の流れを維持し、割り込みが起きる可能性を減らします。 
  • 割り込み無視語句: 固定の無音しきい値を使うのではなく、システムは発話の意味を読み取り、ターンが実際に終わったタイミングを判断します。同様に、「はい」や「うん」といった短い肯定の相づちは、完全な割り込みをトリガーせずに通過させるよう設定できます。これにより、発信者が相づちを打つたびにエージェントが話の位置を見失うことはありません。

これらのシステムが連携することで、エージェントが応答をバッファリングまたは読み込み中であるように感じさせません。人がそうするように自然に間を埋めつつ、バックグラウンドで情報を処理し考えをまとめる、効率的な会話エンジンを形成します。

ElevenLabsで会話が実際にどのように進むか

上記のコンポーネントは、整然と1つずつ順番に動くわけではありません。互いに重なり合います。サポート通話の途中で発信者が「注文はもう発送されましたか?それともまだ処理中ですか?」と尋ねた場合、ElevenLabsのエージェントは次のように対応します。

  1. 発信者が話す: 音声はWebSocket接続を通じてElevenLabsにストリーミングされ、Scribeは音声から約150ms遅れてリアルタイム文字起こしを開始します。 
  2. システムが流れを読む: Scribeがまだ文字起こしをしている間に、推測的ターンテイキングは発信者が話し終えたか、まだ考えの途中かをすでに評価しています。語尾の「それともまだ処理中ですか?」は間ではなく引き渡しと判断されるため、無音で待つことなく次のステップに進みます。
  3. LLMがコンテキストを組み立てて応答する: 文字起こしされた質問は、会話履歴、企業独自のシステムからRAGを通じて取得した注文記録、通話前半のツール出力、システムプロンプトとともにLLMへ送られます。これらすべてを推論し、一般的なステータスメッセージではなく、発信者の実際の注文に基づいた応答を生成します。
  4. Eleven v3が応答を合成する: テキストは自然な音声になります。Expressive Modeが有効な場合、応答にはその場に合った話し方の合図が含まれるため、通常の更新案内も単調ではなく、自然で落ち着いた調子で聞こえます。レイテンシーを優先する場合は、Flashが75ms未満で合成します。
  5. 応答がストリーミングで返る: 合成が完了する前に音声の再生が始まるため、発信者は残りの部分が生成されている間に回答の冒頭を聞けます。 
  6. サイクルを繰り返す:新しいターンごとに、会話の口調、コンテキスト、履歴が引き継がれます。

この高速なプロセス全体を通じて、会話は自然に感じられます。発信者は機械に合わせる必要がなくなります。ゆっくり話したり、過度にはっきり発音したり、ビープ音を待ったりしません。人と話すときと同じように、ただ話すだけです。

ビジネス全体に自然な音声エージェントを導入

ここで説明したすべての機能は、ロードマップ上の構想ではなく、現在すでに本番環境で稼働しています。カスケードアーキテクチャから1秒未満のパイプラインまで、世界中の企業がすでにElevenAgentsを活用し、大規模に実際の顧客対応を行っています。

エージェントアーキテクチャはガードレール、監査ログ、コンプライアンス管理に対応しているため、規制下にある重要度の高い環境でも利用できます。ElevenLabsはSOC 2 Type II、ISO 27001、HIPAA、PCI DSS Level 1の認証を取得しており、特定の境界内にデータをとどめる必要があるチーム向けに、Zero Retention Modeと地域別データレジデンシーを提供しています。

エージェントを活用する準備はできていますか?エージェントを作成してコンソールで構築を始めるか、営業チームに相談して、ご利用環境に合わせた導入についてお問い合わせください。

インタラクションモデルに関するよくある質問

関連記事

最高品質のAIオーディオで創造する