会話インテリジェンスとは?ビジネス向けガイド
- 公開日
- 最終更新日
営業やサポートの会話では、話された内容の大半が会話後に活用されることはほとんどありません。通話が終わると、誰かがCRMで完了としてマークし、その会話は二度と確認されない録音ファイルになります。
会話インテリジェンスは、このような状況を防ぐためのレイヤーです。会話を取得して文字起こしし、AI分析を適用することで、チームや経営陣と活用・共有できる社内リソースに変換します。これにより、社内レビュー用に選ばれた一部の会話だけでなく、すべての会話について、感情、反論、アクション項目のタグが付いた発言記録を残せます。
このガイドでは、会話インテリジェンスの概要、仕組み、主な活用場面を解説します。顧客との会話に導入する際にお役立てください。

概要
- 通話量が管理者が手動でモニタリングできる範囲を超え、重要なインサイトを見逃すようになると、会話インテリジェンスの価値が高まります。
- 営業コーチングやサポート品質から、規制業界のコンプライアンス、社内会議まで、会話を軸に業務を行うあらゆるチームで同じパイプラインを活用できます。
- プラットフォームの有用性は、話者別に計測した単語誤り率で評価される実際の音声に対する精度に左右されます。すべてのスコアと要約は、基となる文字起こしに依存するためです。
- 効果的なプラットフォームには、リアルタイムおよびバッチモード、多言語対応、エンティティ検出、CRMインテグレーションも必要です。ElevenLabsは、SOC 2、HIPAA、GDPR、EUデータレジデンシーに対応したScribe v2とScribe v2 Realtimeでこれらを提供します。
会話インテリジェンスとは?どのように使われるのか
会話インテリジェンスとは、顧客との会話を録音・文字起こしし、AIを使って感情、トピック、アクション項目、反論などの構造化されたインサイトに変換するソフトウェアです。これは、正確な文字起こしと、会話の文字起こしから意味を読み取る解釈レイヤーという2つのレイヤーで構成されています。
この解釈レイヤーこそが、録音や単なる文字起こしとの違いです。たとえば通話録音は通常、音声だけを保存しますが、文字起こしでは同じ音声を読めるようになります。会話インテリジェンスは、誰が話したか、どのトピックが話されたか、未解決の質問は何か、会話が目的にどの程度沿っていたかを特定し、分析を強化します。
実際の動きをさらに詳しく見るために、1件の営業電話を例に考えてみましょう。会話インテリジェンスシステムは次のことを行います。
- 音声を文字起こし: 通話を、会話中の各話者が適切にラベル付けされた、正確でタイムスタンプ付きのテキストに変換します。
- 重要な場面を検出: 価格に関する質問、競合他社への言及、合意済みの次のステップなど、重要な話し合いの場面にフラグを付けます。
- 会話をスコアリング: 会話を取り込み、話す・聞く比率やディスカバリー質問の網羅率など、定義されたフレームワークに照らして評価します。
- CRMに同期: 会話の要約とアクション項目を、手動でデータ入力することなくレコードに記録します。
社内の各チームは、会話インテリジェンスで同じパターンを活用できます。収益チームは営業電話で、サポートチームはサービス対応で、コンプライアンス部門はデータプライバシーの維持を確認するために規制対象の会話で活用します。プロダクトチームは、プロダクト改善のために顧客フィードバックをより深く理解するために利用します。
会話インテリジェンスが重要な理由:会話インテリジェンスのメリット
会話インテリジェンスのメリットは、社内リソースとして活用したい会話の量が多いほど大きくなります。
会話インテリジェンスが最も効果を発揮するのは、非構造化の対話を、企業が測定・改善できるデータに変換するときです。チームが導入すると、いくつかのメリットが一貫して得られます。
- コーチングとオンボーディングの改善: 管理者は、同席できる数件の通話だけでなく、チーム全体にわたるパターンを確認できます。これにより、新入社員や他のチームメンバーは、理論ではなく優れた通話の実例から学べます。
- 管理業務の時間を削減し、CRM入力を迅速化: Salesforceの「State of Sales」レポートの最近のデータによると、営業担当者が週の業務時間のうち直接的な営業活動に使う時間は30%未満です。残りの時間は、管理業務、社内会議、手動での調査、データ入力に費やされています。メモ作成、CRM更新、その他の重要な管理業務を自動化することで、営業担当者は販売により多くの時間を使えます。
- 購買シグナルと顕在化した反論にフラグ付け: 会話インテリジェンスの分析レイヤーは、価格への反発、競合他社への言及、その他の注目すべきポイントにフラグを付け、重要なトピックを見逃さないようにします。価格や競合他社への言及が繰り返される会話を経営層が確認し、改善策を立てるのに役立ちます。
- チーム横断のコラボレーション:このメリットにより、通話から得られたインサイトを1つの部門に閉じ込めず、マーケティング、プロダクト、経営層まで届けられます。他部門が支援できる領域を特定することで、社内の営業・サポートプロセスの強化にもつながります。
同じ分析をすべての会話に適用するため、これらのメリットは時間とともに積み重なります。会話から学び、インサイトを引き出すことこそ、会話インテリジェンスの目的です。

会話インテリジェンスの仕組み
現在市場にある会話インテリジェンスプラットフォームの大半は、ベンダーに関わらず5段階のプロセスに従っています。このパイプラインには次が含まれます。
- データ取得: 電話、チャットスクリプト、ZoomやTeamsなどのビデオ会議プラットフォームといった発生元から、録音または収集された会話を取り込みます。
- 文字起こし: 音声認識技術が音声をテキストに変換し、検索可能な記録を作成します。
- AI分析: 自然言語処理(NLP)と機械学習(ML)モデルがテキストを処理して、感情を特定し、重要な場面やアクション項目を抽出します。一部のプラットフォームでは、この分析をライブで実行し、通話中の担当者にガイダンスを提供します。
- インサイト: 会話を分析し、繰り返される反論、価格に関する質問、その他の関連シグナルなど、活用可能なアウトプットを生成します。
- CRMインテグレーション: インサイトと通話要約をSalesforceやHubSpotなどのCRMプラットフォームに同期し、継続的な手動入力なしでレコードを更新します。
文字起こしレイヤーの内部
5段階のフローがパイプライン全体をカバーする一方で、第2段階の「文字起こし」は特に重要であり、後続の段階の有効性はそこで何が行われるかに左右されます。会話インテリジェンスの文脈で文字起こしがどのように機能するのか、技術的に詳しく見てみましょう。
- 話者ダイアライゼーション: 文字起こしの各セグメントを特定の話者に割り当て、誰が何を言ったかをラベル付けします。営業電話では、この機能によってコーチングツールが話す・聞く比率を計算し、営業担当者が質問の大半をしていたかを確認できます。 ダイアライゼーションは、完成した録音では比較的簡単です。モデルが通話の開始時と終了時の声を比較できるためです。一方、リアルタイムでは、次に何が話されるかを聞く前にシステムが話者ラベルを割り当てる必要があるため、難しくなります。
- エンティティ検出: 文字起こし内の氏名、日付、金額、口座番号など、特定の情報カテゴリを識別し、それぞれに正確なタイムスタンプを付与します。これにより、誰かがすべての文字起こしを読んだり通話を聞いたりしなくても、「競合他社に言及したすべての通話」の検索可能なインデックスを構築できます。また、PCIやPHIのデータを扱うコールセンターがコンプライアンス要件を満たすために、情報を編集できるようにするのもこの機能です。
- 多言語対応: 通話内での自動言語識別と、チームが顧客とのやり取りで実際に使用する言語における正確な文字起こしの両方をカバーします。英語のみに限定されたプラットフォームでは、サポートチームがスペイン語、ポルトガル語、日本語での電話対応を始めた時点で、会話を完全に取りこぼしてしまいます。
ElevenLabsの スピーチtoテキスト機能は、最大32人の話者に対応するダイアライゼーション、エンティティ検出、PII、PHI、PCIカテゴリにわたるエンティティタイプ、90以上の言語での文字起こしを、単一のAPIで提供します。

会話インテリジェンスと会話型AIの違い
この2つの用語は混同されがちです。両者の違いは、会話型AIが音声会話を行うのに対し、会話インテリジェンスはその会話を分析する点です。
会話型AIには、質問への回答やサポート上の問題への対応を通じて、顧客と直接会話できるチャットボットや音声エージェントが含まれます。会話インテリジェンスはバックグラウンドで機能し、顧客と直接やり取りしません。すでに行われている会話を聞き、そこからインサイトを抽出します。
両者は競合するのではなく、補完し合う関係です。会話に関わるビジネスにおいて、それぞれ独立した役割を果たします。たとえば、ElevenAgentsのようなプラットフォームで音声エージェントを運用するサポートチームは、人間が対応した通話と同じように、エージェントが対応した通話にも会話インテリジェンスを適用できます。会話インテリジェンスの目的は、エージェントが問い合わせを適切に処理できた箇所と、エスカレーションされた箇所を確認することです。

会話インテリジェンスのユースケース
会話インテリジェンスの動作やメリットは、チームが利用する具体的なユースケースによって異なります。主なユースケースには次のようなものがあります。
営業コーチング
営業リーダーは、特定のスキルに基づいて整理された通話ライブラリを構築できます。たとえば、反論への対応やディスカバリー質問といったスキルを活用し、新しい営業担当者のオンボーディングを迅速化するとともに、チーム全体における成功の基準を明確にできます。
カスタマーサポートの品質
サポートリーダーは、これまで以上の規模でエージェントの通話をレビューできます。会話インテリジェンスにより、通話にリアルタイムで参加しなくても、トーンの問題、不完全な解決、スクリプトの不足を検出できます。請求に関する質問が出た後に感情スコアが下がる場合、複数の会話で見られるなら対応すべきパターンです。
コンプライアンスとリスクの検出
医療や金融サービスなど、多くの規制業界では、必要な開示が行われたことを確認し、機密情報を含む通話にフラグを付けるために会話インテリジェンスを活用しています。これは特に、適切な機密データ処理なしに社会保障番号(SSN)や診断結果などの個人識別情報(PII)が話されたケースで重要です。エンティティ検出により、担当者がすべての事例を確認するのではなく、このユースケースを大規模に実用化できます。
プロダクトフィードバックのマイニング
プロダクトチームは、他では正式に記録されない、繰り返し寄せられる機能要望や混乱が生じる領域を特定するために、サポートや営業の文字起こしを確認します。苦情が一度だけなら単なるノイズです。しかし、同じ苦情が40件の通話にわたって出ている場合は、対応すべきロードマップ項目です。このような苦情は、プロダクトの機能や性能にどのようなギャップがあるかをプロダクトチームに示します。

ElevenLabs APIで会話インテリジェンスを構築
会話インテリジェンスプラットフォームを支えるインフラは、主にスピーチtoテキストの課題であり、その上にいくつかの特定要件が加わります。
複数の録音済み通話を文字起こしする場合、Scribe v2は、話者ダイアライゼーション、単語レベルのタイムスタンプ、エンティティ検出を組み込んで、オーディオファイルとビデオファイルを処理します。ライブ分析では、Scribe v2 Realtimeが約150msのレイテンシーで文字起こしをストリーミングするため、通話後ではなく通話中にリアルタイムのコーチングプロンプトやコンプライアンスアラートを提供できます。
会話インテリジェンスプラットフォームがインフラレイヤーに求める要件:
- ダイアライゼーションと話者ロールのラベル付けによって顧客とエージェントの発話を分離すること。これは、話者の識別が必要なあらゆるコーチング指標の基本となります。
- エンティティ検出を導入すれば、文字起こしを保存・共有する前に手動でレビューするのではなく、機密情報を自動的に識別してマスキングできます。
- コンプライアンスレビューとライブコーチングでは必要なレイテンシーが異なるため、バッチとリアルタイムの両方のオプションが利用可能です。
- 本社で使用される言語だけでなく、チームの顧客が話す言語に対応する多言語サポート。
これらの機能が組み合わさり、会話インテリジェンスプロダクトの基盤となる文字起こしレイヤーを構成します。分析とコーチングのロジックは、チームが自社で構築するか、専用のCIベンダーから購入するコンポーネントです。
ElevenAPIを始める
Scribe v2とScribe v2 Realtimeは、ダイアライゼーション、エンティティ検出、単語レベルのタイムスタンプを単一のAPIで提供し、会話インテリジェンスの文字起こしレイヤーを実現します。ElevenLabs スピーチtoテキストで、対応モデルと言語をご確認ください。
独自のプロダクトや社内ツールに会話インテリジェンスを組み込む場合は、無料アカウントを作成して、最初の通話の文字起こしを始めましょう。 スピーチtoテキストAPIリファレンスでは、ダイアライゼーション、エンティティ検出、言語サポートのすべてのパラメータを確認できます。
よくある質問
Jack LimebearはGrowthチームに所属し、ブログやインサイトページのコンテンツライター兼ストラテジストとして活躍しています。ElevenLabsに入社する前は、急成長中のSaaSスタートアップからFortune 500企業まで、さまざまな組織で10年以上にわたりコンテンツ戦略をリードしてきました。ケンブリッジ大学で英文学の修士号を取得しています。



