대화 인텔리전스란? 비즈니스를 위한 가이드
- 게시일
- 최종 업데이트
대부분의 영업 및 지원 대화에서는 대화 중 논의된 내용 대부분이 대화 이후 활용되지 않습니다. 통화가 끝나면 누군가 CRM에서 완료로 표시하고, 대화는 다시 검토되지 않는 녹음 파일로 남게 됩니다.
대화 인텔리전스는 이러한 상황을 막아 주는 계층입니다. 대화를 캡처하고 전사한 뒤 AI 분석을 적용해 팀 및 경영진과 활용하고 공유할 수 있는 내부 리소스로 전환하는 것이 목표입니다. 이를 통해 기업은 내부 검토를 위해 선택된 일부 대화만 기록하는 대신, 각 대화에서 어떤 내용이 오갔는지 감정, 이의 제기, 실행 항목으로 태그된 기록을 확보할 수 있습니다.
이 가이드에서는 대화 인텔리전스의 정의, 작동 방식, 주요 활용 분야를 살펴보고 고객과의 대화에 적용하는 방법을 안내합니다.

요약
- 통화량이 관리자가 수동으로 모니터링할 수 있는 수준을 넘어서 중요한 인사이트를 놓치기 시작할 때 대화 인텔리전스의 가치가 커집니다.
- 이 동일한 파이프라인은 영업 코칭과 지원 품질부터 규제 산업의 컴플라이언스, 내부 회의까지 대화를 기반으로 운영되는 모든 팀에 활용됩니다.
- 플랫폼의 유용성은 화자별로 측정한 실제 환경 오디오의 정확도, 즉 단어 오류율에 달려 있습니다. 모든 점수와 요약은 기반이 되는 전사본에 의존하기 때문입니다.
- 효과적인 플랫폼에는 실시간 및 배치 모드, 다국어 지원, 엔터티 감지, CRM 통합도 필요합니다. ElevenLabs는 SOC 2, HIPAA, GDPR 및 EU 데이터 레지던시를 지원하는 Scribe v2와 Scribe v2 Realtime을 통해 이를 제공합니다.
대화 인텔리전스란 무엇이며 어떻게 활용되나요?
대화 인텔리전스는 고객 대화를 녹음하고 전사한 다음, AI를 사용해 감정, 주제, 실행 항목, 이의 제기와 같은 구조화된 인사이트로 전환하는 소프트웨어입니다. 이는 정확한 전사와 대화 전사본에서 의미를 읽어내는 해석 계층이라는 두 가지 요소로 구성됩니다.
이 해석 계층이 녹음이나 일반 전사본과 대화 인텔리전스를 구분합니다. 예를 들어 통화 녹음은 일반적으로 오디오만 보존하지만, 전사본은 같은 오디오를 읽을 수 있게 합니다. 대화 인텔리전스는 누가 말했는지, 어떤 주제를 논의했는지, 남은 질문은 무엇인지, 대화가 목표와 얼마나 부합했는지를 파악해 분석을 강화합니다.
실무에서 어떻게 작동하는지 더 자세히 살펴보기 위해 하나의 영업 통화를 예로 들어 보겠습니다. 대화 인텔리전스 시스템은 다음을 수행합니다.
- 오디오 전사: 통화를 대화 참여자별 화자 레이블이 포함된 정확한 타임스탬프 텍스트로 변환합니다.
- 핵심 순간 감지: 시스템이 가격 관련 질문, 경쟁사 언급, 합의된 다음 단계 등 주요 논의 시점을 표시합니다.
- 대화 점수화: 대화를 발화-청취 비율이나 발견 질문 커버리지와 같은 정의된 프레임워크에 따라 측정합니다.
- CRM 동기화: 수동 데이터 입력 없이 대화 요약과 실행 항목을 기록에 작성합니다.
기업 전반에서 팀은 대화 인텔리전스를 같은 방식으로 활용합니다. 수익 팀은 영업 통화에 적용하고, 지원 팀은 서비스 상호작용에 사용하며, 컴플라이언스 부서는 데이터 프라이버시가 유지되도록 규제 대상 대화에 적용합니다. 제품 팀은 제품 개선을 위해 고객 피드백을 더 잘 이해하는 데 활용합니다.
대화 인텔리전스가 중요한 이유: 대화 인텔리전스의 이점
대화 인텔리전스의 이점은 기업이 내부 리소스로 활용하려는 대화의 양이 많아질수록 커집니다.
대화 인텔리전스는 비정형 대화를 기업이 측정하고 개선할 수 있는 데이터로 전환할 때 가장 효과적입니다. 팀이 도입하면 다음과 같은 이점이 일관되게 나타납니다.
- 코칭 및 온보딩 개선: 관리자는 직접 참여할 수 있는 몇 건의 통화가 아니라 팀 전체의 패턴을 검토할 수 있습니다. 이를 통해 신규 입사자와 다른 팀원들은 이론이 아닌 우수 통화의 실제 사례로 학습할 수 있습니다.
- 관리 업무 시간 감소 및 더 빠른 CRM 입력:Salesforce의 최근 State of Sales 보고서에 따르면 영업 담당자는 주간 업무 시간 중 직접적인 판매 활동에 30% 미만을 사용합니다. 나머지 시간은 관리 업무, 내부 회의, 수동 조사, 데이터 입력에 쓰이는 것으로 나타났습니다. 자동 메모 작성, CRM 업데이트 및 기타 필수 관리 업무를 자동화하면 영업 담당자가 판매에 더 많은 시간을 쓸 수 있습니다.
- 구매 신호 및 표면화된 이의 제기 표시: 대화 인텔리전스의 분석 계층은 가격 저항, 경쟁사 언급 및 기타 관심 지점을 표시해 중요한 주제를 놓치지 않도록 합니다. 가격이나 경쟁사에 대한 언급이 반복되는 대화를 검토하고 개선 전략을 수립하는 데 도움이 됩니다.
- 팀 간 협업: 이 이점은 통화 인사이트가 한 부서에 고립되지 않고 마케팅, 제품, 경영진에게 전달되도록 합니다. 다른 부서가 지원할 수 있는 영역을 파악해 회사 내 영업 및 지원 프로세스를 개선하는 데 도움이 됩니다.
이러한 이점은 모든 대화에 동일한 분석이 적용되므로 시간이 지날수록 누적됩니다. 대화에서 학습하고 인사이트를 도출하는 것이 바로 대화 인텔리전스가 설계된 목적입니다.

대화 인텔리전스의 작동 방식
현재 시장에 있는 대다수의 대화 인텔리전스 플랫폼은 공급업체와 관계없이 5단계 프로세스를 따릅니다. 이 파이프라인은 다음과 같습니다.
- 데이터 캡처: 전화 통화, 채팅 스크립트, Zoom 또는 Teams와 같은 화상 회의 플랫폼 등 원본에서 녹음되거나 수집된 대화를 가져옵니다.
- 전사: 음성 인식 기술로 오디오를 텍스트로 변환해 검색 가능한 기록을 생성합니다.
- AI 분석: 자연어 처리(NLP) 및 머신러닝(ML) 모델이 텍스트를 처리하여 감정 파악, 핵심 순간 및 실행 항목을 수행합니다. 일부 플랫폼은 이 분석을 실시간으로 수행하고 통화 중 담당자에게 안내를 제공합니다.
- 인사이트: 대화를 분석해 반복되는 이의 제기, 가격 관련 질문 또는 기타 관련 신호와 같은 활용 가능한 결과를 제공합니다.
- CRM 통합: 인사이트와 통화 요약을 Salesforce나 HubSpot 같은 CRM 플랫폼에 동기화하여 지속적인 수동 입력 없이 기록을 업데이트합니다.
전사 계층 내부
5단계 흐름이 전체 파이프라인을 포괄하지만, 두 번째 단계인 '전사'는 매우 중요한 역할을 하며 이후 단계의 효과는 이 단계에서 일어나는 일에 달려 있습니다. 대화 인텔리전스 맥락에서 전사가 어떻게 작동하는지 기술적으로 더 자세히 살펴보겠습니다.
- 화자 분리: 전사본의 각 구간을 특정 화자에게 할당하여 누가 무엇을 말했는지 표시합니다. 영업 통화에서는 이 기능을 통해 코칭 도구가 발화-청취 비율을 계산하고 영업 담당자가 대부분의 질문을 했는지 확인할 수 있습니다. 화자 분리는 모델이 통화 시작 시점의 음성과 종료 시점의 음성을 비교할 수 있으므로 완료된 녹음에서는 비교적 쉽습니다. 하지만 다음 내용을 듣지 못한 상태에서 시스템이 화자 레이블을 할당해야 하므로 실시간으로 수행하기는 어렵습니다.
- 엔터티 감지: 전사본에서 이름, 날짜, 금액, 계좌 번호처럼 특정 범주의 정보를 식별하고 각각에 정확한 타임스탬프를 연결합니다. 이를 통해 누군가 모든 전사본을 읽거나 각 통화를 들을 필요 없이 '경쟁사가 언급된 모든 통화'의 검색 가능한 색인을 만들 수 있습니다. 또한 PCI 또는 PHI 데이터를 처리하는 콜센터가 컴플라이언스 요건을 충족하기 위해 필요한 마스킹을 가능하게 합니다.
- 다국어 처리: 통화 내 자동 언어 식별과 팀이 실제로 고객과 사용하는 언어 전반의 정확한 전사를 모두 포함합니다. 지원 팀이 스페인어, 포르투갈어 또는 일본어 통화를 받기 시작하면 영어만 지원하는 플랫폼은 해당 대화를 완전히 놓치게 됩니다.
ElevenLabs의 음성-텍스트 변환 기능은 단일 API에서 이 세 가지를 모두 지원하며, 최대 32명의 화자 분리, 엔터티 감지를 통해 PII, PHI, PCI 범주에 걸친 엔터티 유형과 90개 이상의 언어 전사를 제공합니다.

대화 인텔리전스와 대화형 AI 비교
이 두 용어는 자주 혼동됩니다. 차이점은 대화형 AI는 음성 대화에 참여하고, 대화 인텔리전스는 이를 분석한다는 점입니다.
대화형 AI에는 질문에 답하거나 지원 문제에 대응하여 고객과 직접 대화할 수 있는 챗봇과 음성 에이전트가 포함됩니다. 대화 인텔리전스는 백그라운드에서 작동하며 고객과 상호작용하지 않습니다. 이미 진행 중인 대화를 듣고 그로부터 인사이트를 추출합니다.
둘은 경쟁 관계가 아니라 상호 보완적입니다. 비즈니스의 대화 영역에서 각각 독립적인 기능을 수행합니다. 예를 들어 ElevenAgents 와 같은 플랫폼에서 음성 에이전트를 운영하는 지원 팀은 사람의 통화와 동일한 방식으로 에이전트가 처리한 통화에 대화 인텔리전스를 적용할 수 있습니다. 대화 인텔리전스의 목표는 에이전트가 문의를 잘 처리한 부분과 에스컬레이션된 부분을 검토하는 것입니다.

대화 인텔리전스 활용 사례
대화 인텔리전스는 팀이 사용하는 구체적인 활용 사례에 따라 다르게 작동합니다. 도입한 활용 사례에 따라 이점도 달라집니다. 주요 활용 사례는 다음과 같습니다.
영업 코칭
영업 리더는 특정 역량을 기준으로 구성된 통화 라이브러리를 만들 수 있습니다. 이의 제기 처리나 발견 질문 등이 이러한 역량에 포함되며, 이를 활용해 신규 담당자를 더 빠르게 온보딩하고 팀 전체에서 성공의 기준을 정립할 수 있습니다.
고객 지원 품질
지원 리더는 그 어느 때보다 큰 규모로 에이전트 통화를 검토할 수 있습니다. 대화 인텔리전스를 통해 어조 문제, 불완전한 해결 또는 스크립트의 공백을 포착할 수 있습니다. 이 모든 것은 실시간 통화에 참여하지 않아도 가능합니다. 청구 관련 질문이 제기된 뒤 나타나는 감정 하락이 여러 대화에서 발견된다면 조치할 가치가 있는 패턴입니다.
컴플라이언스 및 위험 감지
의료 및 금융 서비스 같은 많은 규제 산업에서는 필수 고지가 이루어졌는지 확인하고 민감한 정보가 포함된 통화를 표시하기 위해 대화 인텔리전스를 사용합니다. 특히 사회보장번호(SSN)나 의료 진단처럼 민감한 데이터 처리 없이 논의된 개인 식별 정보(PII)의 경우에 해당합니다. 엔터티 감지를 사용하면 사람이 모든 사례를 찾아내는 대신 이 활용 사례를 대규모로 실용적으로 운영할 수 있습니다.
제품 피드백 마이닝
제품 팀은 다른 곳에 공식적으로 기록되지 않는 반복적인 기능 요청이나 혼란 영역을 파악하기 위해 지원 및 영업 전사본을 검토합니다. 불만이 한 번만 나타나면 단순한 노이즈일 수 있습니다. 하지만 같은 불만이 40건의 통화에서 나타난다면 해결해야 할 로드맵 항목입니다. 이러한 불만은 제품 기능과 성능에 어떤 공백이 있는지 제품 팀에 알려줄 수 있습니다.

ElevenLabs API로 대화 인텔리전스 구축
대화 인텔리전스 플랫폼을 뒷받침하는 인프라는 주로 여러 구체적 요구 사항이 더해진 음성-텍스트 변환 문제입니다.
여러 녹음 통화를 전사할 때 Scribe v2는 화자 분리, 단어 수준 타임스탬프, 엔터티 감지를 포함해 오디오 및 비디오 파일을 처리합니다. 실시간 분석에는 Scribe v2 Realtime이 약 150ms의 지연 시간으로 전사 결과를 스트리밍하여, 통화 후가 아닌 통화 중에 실시간 코칭 프롬프트나 컴플라이언스 알림을 제공할 수 있습니다.
대화 인텔리전스 플랫폼의 인프라 계층에 필요한 요소:
- 화자 식별이 필요한 모든 코칭 지표의 기반이 되는 화자 분리 및 화자 역할 레이블링을 통한 고객과 에이전트 발화의 구분.
- 전사본을 저장하거나 공유하기 전에 수동 검토에 의존하는 대신, 엔터티 감지를 배포해 민감한 세부 정보를 자동으로 식별하고 마스킹할 수 있습니다.
- 컴플라이언스 검토와 실시간 코칭에는 서로 다른 지연 시간 수준이 필요하므로 배치 및 실시간 옵션을 모두 제공합니다.
- 본사에서 사용하는 언어뿐 아니라 팀 고객이 사용하는 언어에 맞춘 다국어 지원.
이러한 기능이 함께 대화 인텔리전스 제품의 기반이 되는 전사 계층을 구성합니다. 분석 및 코칭 로직은 팀이 직접 구축하거나 전용 CI 공급업체에서 구매하는 구성 요소로 남습니다.
ElevenAPI 시작하기
Scribe v2와 Scribe v2 Realtime은 단일 API에서 화자 분리, 엔터티 감지, 단어 수준 타임스탬프를 제공하는 대화 인텔리전스용 전사 계층입니다. ElevenLabs 음성-텍스트 변환에서 지원 모델과 언어를 확인하세요.
자체 제품이나 내부 도구에 대화 인텔리전스를 구축하고 있다면 무료 계정 만들기를 통해 첫 통화 전사를 시작하세요. 음성-텍스트 변환 API 레퍼런스에서는 화자 분리, 엔터티 감지, 언어 지원을 위한 전체 파라미터를 확인할 수 있습니다.
FAQ
Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.



