AI 음성 에이전트란 무엇이며, 어떻게 작동하나요?
- 게시일
- 최종 업데이트
기업은 그 어느 때보다 많은 고객 상호작용을 처리하고 있습니다. 지원해야 할 언어는 늘어나고, 사무실 불이 꺼진 한참 뒤에도 전화가 걸려오면서 대부분의 팀이 혼자 감당할 수 있는 속도를 넘어섰습니다.
AI 음성 에이전트는 일상적인 질문에 답하고 일반적인 작업을 완료하며, 필요할 때 더 복잡한 상황을 상담원에게 이관해 이러한 문제를 해결하는 데 도움을 줍니다.
이 글에서는 AI 음성 에이전트의 정의와 작동 방식, 가장 유용한 활용 분야, 그리고 ElevenAgents를 사용해 구현하는 방법을 다룹니다.
요약
- AI 음성 에이전트를 사용하면 고객은 전화나 브라우저에서 키패드 메뉴를 탐색하는 대신 자연스럽게 말할 수 있습니다.
- AI 음성 에이전트는 이미 대규모로 실제 고객 상호작용을 처리하고 있습니다. Revolut은 티켓 해결 시간을 8배 단축했으며, Zingage는 HIPAA를 준수하면서 통화의 90% 이상을 처리하고 있습니다.
- 일반적인 사용 사례로는 고객 지원, 예약 일정 관리, 리드 검증, 결제 알림, 내부 헬프데스크 workflow 등이 있습니다.
- ElevenAgents와 같은 플랫폼을 사용하면 기반 인프라를 처음부터 구축하지 않고도 음성 에이전트를 배포할 수 있으며, 첫 오디오까지 걸리는 시간은 일반적으로 1초 미만입니다.
AI 음성 에이전트란 무엇인가요?
AI 음성 에이전트는 인공지능을 사용해 자연어 음성을 이해하고 그에 맞게 응답하는 시스템입니다. 메뉴를 탐색하는 것보다 사람과 대화하는 데 가까운 경험을 제공합니다.
음성 에이전트는 전화나 웹으로 기업과 상호작용하는 모든 곳에서 특히 유용합니다. 예를 들면 다음과 같습니다.
- 고객 지원: 청구 관련 질문에 답하고, 주문 현황을 제공하며, 고객의 계정 정보 접근을 지원합니다.
- 일정 관리 workflow: 예약을 잡거나 변경 또는 취소할 수 있습니다.
- 영업: 리드를 검증하고 적합한 담당자에게 연결할 수 있습니다.
- 운영: 아웃바운드 캠페인, 결제 알림, 인증 전화를 대규모로 처리할 수 있습니다.
중요한 점은 에이전트가 단순히 "말만" 하는 것이 아니라는 것입니다. 듣고, 추론하고, 행동합니다. 이것이 음성 AI를 기존 자동화 도구 및 대부분의 챗봇과 구분하는 차이입니다.
AI 음성 에이전트는 IVR 및 챗봇과 어떻게 다른가요?
대화형 음성 응답(IVR) 시스템은 발신자를 미리 정해진 메뉴로 안내하지만, 이는 사람들이 자연스럽게 소통하는 방식과는 거리가 멉니다. AI 챗봇은 텍스트를 잘 처리하지만 고객이 읽고 입력할 수 있는 환경에서만 작동합니다.
AI 음성 에이전트는 자연스러운 대화, 음성, 행동 수행을 결합하므로 말하는 것이 가장 자연스러운 상호작용 방식인 모든 상황에 더 적합합니다.
AI 음성 에이전트의 이점은 무엇인가요?
음성 에이전트는 고객과의 대화를 개선하는 동시에 기업이 더 많은 상호작용을 효율적으로 처리하도록 돕습니다. 더 나은 대화는 고객 경험 개선, 더 빠른 해결, 더 강력한 운영 성과로 이어지는 경우가 많습니다.
자연스러운 운율과 톤
고품질 음성 합성은 통화 내내 자연스러운 리듬, 강조, 대화 흐름을 유지합니다. 상호작용이 로봇처럼 들리지 않고 자연스럽게 들릴 때, 고객은 계속 대화에 참여할 가능성이 높아지며 신뢰는 높고 불만은 줄어듭니다.
끼어들기와 자연스러운 턴테이킹
실제 대화에는 끼어들기, 멈춤, 주제 변경이 있습니다. 끼어들기와 턴테이킹을 지원하는 음성 에이전트는 대화 흐름을 끊지 않고 이러한 변화에 적응하여 발신자가 더 빠르게 답을 얻도록 돕습니다.
원어민 억양의 다국어 지원
고객이 선호하는 언어로 상호작용하고 자연스러운 발음과 억양으로 응답을 들으면 의사소통은 더 명확하고 접근하기 쉬워집니다. 기업은 언어마다 별도의 workflow를 만들지 않고도 다양한 고객층을 지원할 수 있습니다.
대규모 24시간 연중무휴 지원
음성 에이전트는 업무 시간 이후에도 전화를 받고, 수요 급증을 관리하며, 아웃바운드 캠페인을 지원할 수 있습니다. 고객은 필요할 때 도움을 받고, 기업은 놓친 기회와 인력 부족 비용을 피할 수 있습니다.
상담원 이관 시 전체 맥락 제공
대화를 이관해야 할 때 다음 담당자는 대화 기록, 감지된 의도, 에이전트가 이미 수집한 정보를 받습니다. 반복을 줄이고 고객이 처음부터 다시 시작하지 않아도 상담원이 대화를 이어갈 수 있게 합니다.
향상된 최초 문의 해결률
음성 에이전트는 일반적인 질문에 답하고 일상적인 작업을 즉시 완료하므로, 고객은 첫 번째 상호작용에서 필요한 것을 얻을 수 있습니다. 재문의가 줄어들면 고객 만족도와 운영 효율성이 모두 높아집니다.
AI 음성 에이전트와 상담원은 언제 각각 사용해야 하나요?
유용한 원칙은 처리량이 많고 반복적이며 구조화된 작업에는 AI를 사용하고, 판단력, 공감, 협상 또는 예외 처리가 필요한 상황에는 사람을 배정하는 것입니다.
가장 효과적인 전략은 사람과 AI 음성 에이전트를 함께 활용하는 것입니다. 예를 들어 컨택 센터는 고객 서비스 AI 음성 에이전트를 사용해 주문 추적, 비밀번호 재설정, 예약 알림을 처리하고, 청구 분쟁이나 감정적으로 민감한 통화는 상담원에게 직접 연결할 수 있습니다.
AI는 대기 시간을 줄이고 일상적인 통화에 일관된 답변을 제공하며, 사람은 가장 중요한 순간에 판단력과 공감을 발휘합니다.
AI 음성 에이전트는 어떻게 작동하나요?
누군가 AI 음성 에이전트에게 말하면 여러 시스템이 밀리초 단위로 함께 작동해 요청을 이해하고 응답을 생성하며 대화를 자연스럽게 이어갑니다. ElevenAgents에서 Flash 모델은 약 75ms의 모델 추론 지연 시간을 달성하며, 전체 파이프라인에서 첫 오디오까지 걸리는 시간은 일반적으로 1초 미만입니다.
ElevenAgents가 이 파이프라인을 관리하는 방법을 자세히 알아보려면 ElevenAgents 오케스트레이션 엔진 살펴보기를 참조하세요.
1. 발신자가 말하면 오디오가 텍스트로 변환됩니다
상호작용은 발신자가 말하는 순간 시작됩니다. 에이전트는 음성 텍스트 변환(STT) 모델을 사용해 발신자의 오디오를 실시간으로 텍스트로 변환하므로 시스템이 즉시 요청 처리를 시작할 수 있습니다.
ElevenAgents에서는 이 단계를 Scribe가 처리합니다. Scribe는 ElevenLabs의 음성 인식 모델입니다. Scribe v2 Realtime은 약 150ms의 지연 시간을 제공하므로 발신자 관점에서는 전사가 사실상 즉각적으로 이루어집니다.
2. 에이전트가 요청을 해석하고 행동합니다
음성이 텍스트로 변환되면 대규모 언어 모델(LLM)이 응답에 필요한 모든 맥락과 함께 요청을 처리합니다. 에이전트는 다음을 포함한 맥락을 하나의 요청으로 구성합니다.
- 에이전트가 이미 논의된 내용을 파악할 수 있도록 하는 대화 기록.
- 다음을 통해 검색한 관련 비즈니스 지식 검색 증강 생성(RAG)을 통해 제품 정보, 정책, 절차, 가격, 지원 콘텐츠를 기반으로 답변합니다.
- 대화 앞부분에서 사용할 수 있게 된 도구 출력 또는 동적 변수.
- 에이전트의 시스템 프롬프트, 역할, 톤, 규칙을 정의합니다.
이러한 맥락을 바탕으로 에이전트는 응답 방식을 결정합니다. 검색한 지식으로 직접 답할 수 있으면 그렇게 합니다. 요청에 행동이 필요하면 통합 도구를 통해 실행한 뒤 그 결과로 응답을 구성합니다. 일반적인 작업은 다음과 같습니다.
- 고객 정보 조회.
- 예약 일정 관리.
- 기록 업데이트.
- 확인 메시지 발송.
- 대화 라우팅.
ElevenAgents는 ElevenLabs 호스팅 LLM뿐 아니라 Anthropic, OpenAI, Google의 다른 주요 모델도 지원합니다.
3. 응답이 다시 음성으로 변환됩니다
응답을 생성한 후 Eleven V3, ElevenLabs의 텍스트 음성 변환 모델이 텍스트를 자연스러운 오디오로 변환해 발신자에게 실시간으로 스트리밍합니다. 덕분에 에이전트는 기존 자동 전화 시스템처럼 들리지 않고 자연스러운 속도, 강조, 대화 흐름으로 응답할 수 있습니다.
4. 턴테이킹으로 자연스러운 대화 유지
전용 턴테이킹 모델이 끼어들기, 멈춤, 무음 감지, 대화 타이밍을 관리합니다. 이를 통해 발신자는 자연스럽게 말을 끊거나 생각하며 멈추고, 대화 중간에 방향을 바꿀 수 있으며, 기존 음성 시스템에서 흔히 느껴지는 경직된 경험을 피할 수 있습니다.
5. 음성사서함 감지로 아웃바운드 통화를 지능적으로 처리
아웃바운드 workflow에서는 시스템이 실제 사람에게 연결됐는지 음성사서함에 연결됐는지 판단합니다. 전체 상호작용 흐름을 음성사서함에 전달하는 대신, 에이전트는 적절한 메시지를 남기고 결과를 정확히 기록한 후 다음 통화를 자동으로 이어갑니다.
AI 음성 에이전트는 주로 어디에서 사용되나요?
AI 음성 에이전트는 통화가 빈번하거나 반복적이거나 시간에 민감한 산업에서 가장 효과적입니다. 이관 없이 처리할 수 있는 명확한 workflow와 일반적인 질문에 적합합니다. 또한 기본 제공되는 컴플라이언스 인증과 감사 로그 덕분에 배포 전에 업계 표준을 더 쉽게 충족할 수 있어 규제가 엄격한 환경에도 적합합니다.
AI 음성 에이전트는 어떻게 구현하나요?
AI 음성 에이전트를 성공적으로 구현하려면 올바른 모델을 선택하는 것만으로는 부족합니다. 사용 사례를 정의하고, 명확한 성공 기준을 설정하며, 에이전트의 행동을 구성하고, 고객과 대화하기 전에 실제 환경 조건에서 테스트해야 합니다.
전체 과정을 살펴보려면 1시간 이내에 비즈니스용 AI 에이전트를 만드는 방법을 참조하세요.
1단계: 사용 사례와 성공 기준 정의
모든 고객 상호작용을 한 번에 자동화하려 하기보다 한두 가지 구체적인 workflow부터 시작하세요.
예시는 다음과 같습니다.
- 예약 일정 관리.
- 주문 상태 문의.
- 청구 문의.
- 리드 검증.
- 내부 IT 지원.
각 workflow에 대해 구현 전에 성공 지표를 정의하세요. 사용 사례에 따라 해결률, 자체 해결률, 평균 처리 시간, 예약 완료율, CSAT 또는 상담원 이관률 등이 될 수 있습니다. 명확한 지표가 있으면 배포가 실제로 성과를 개선하는지 판단하기 쉽습니다.
ElevenAgents는 사전 구축 템플릿도 제공하여 더 빠르게 시작할 수 있도록 돕습니다.
2단계: 고객이 에이전트와 상호작용할 위치 선택
workflow를 정의했다면 고객이 어디에서 가장 많이 이용할지 결정하세요.
- SIP 전화: 고객 지원, 예약 일정 관리, 청구 문의, 서비스 요청 및 기타 대량 음성 workflow에 가장 적합합니다. 기존 고객 행동과 일치하므로 기업이 가장 먼저 자동화하는 채널인 경우가 많습니다. ElevenAgents는 Twilio 및 기타 SIP 제공업체를 통해 연결됩니다. 미국의 TCPA나 유럽 통화 녹음의 GDPR처럼 아웃바운드 전화에는 컴플라이언스 요건이 적용된다는 점에 유의하세요.
- 웹 위젯: 고객이 지원팀에 문의하기 전에 웹사이트를 자주 방문하는 경우 유용합니다. ElevenAgents의 웹 위젯은 브라우저에서 음성과 채팅 상호작용을 모두 지원하므로 방문자는 전화를 걸지 않고도 원하는 방식으로 이용할 수 있습니다.
- WhatsApp: 메시징 중심 workflow, 다국어 고객층, WhatsApp이 주요 고객 채널인 시장에 적합합니다. 일부 고객은 음성보다 텍스트로 기업과 소통하기를 선호하므로 훌륭한 추가 채널이기도 합니다.
음성 에이전트가 운영되면 추가 채널로 확장하는 데는 최소한의 수정만 필요합니다. ElevenAgents를 사용하면 처음부터 다시 구축하지 않고도 동일한 에이전트를 전화, 웹, WhatsApp 등에 배포할 수 있습니다.
3단계: 에이전트의 지식, 음성, 행동 구성
채널을 선택한 후 LLM, 지식 소스, 음성, 시스템 프롬프트 등 에이전트의 행동을 결정하는 구성 요소를 설정하세요.
- LLM: 에이전트의 추론 엔진입니다. 주요 절충점은 지연 시간과 성능 간의 균형입니다. 작고 빠른 모델은 유연하고 자연스러운 대화에 적합합니다. 추론 능력이 더 강한 대형 모델은 복잡한 도구 호출, 상세한 시스템 프롬프트, 여러 단계의 workflow에 더 적합합니다. 사용 사례에 가장 적합한 모델을 찾으려면 전체 모델 목록과 절충점을 확인하세요.
- 지식 베이스: 에이전트가 정확한 답변을 위해 참조하는 문서, FAQ, SOP입니다. 주요 절충점은 범위와 정확성 간의 균형입니다. 더 폭넓은 지식 베이스는 에이전트가 활용할 정보를 늘려 주지만, 초점 없는 콘텐츠가 너무 많으면 검색 품질이 떨어질 수 있습니다. 정의한 사용 사례와 가장 관련 있는 콘텐츠부터 시작해 확장하세요.
- 음성: 발신자에게 에이전트가 들리는 방식입니다. ElevenAgents는 10,000개 이상의 음성을 억양, 언어, 스타일별로 제공하며, 직접 복제할 수도 있습니다. 음성을 브랜드와 고객층에 맞추고, 고객에게 친숙하게 들리도록 지역별로 다른 음성을 선택하는 것도 고려하세요.
- 시스템 프롬프트: 에이전트의 운영 지침으로, 역할, 톤, 수행해야 할 작업, 절대 수행해서는 안 될 작업, 이관 요건, 컴플라이언스 제약을 정의합니다. 강력한 프롬프트는 예측 가능한 행동을 만듭니다. 모호한 프롬프트는 일관성 없는 대화를 만듭니다. 자세한 내용은 ElevenAgents 프롬프팅 가이드를 확인하세요.
이 네 가지 구성 요소는 함께 작동합니다. LLM은 추론하고, 지식 베이스는 정확한 답을 제공하며, 음성은 답변을 전달하고, 시스템 프롬프트는 모든 것이 올바른 방향을 유지하도록 합니다. 출시 전에 각각을 제대로 갖추는 것이 신뢰할 수 있는 에이전트와 일관성 없는 에이전트를 가르는 기준입니다.
4단계: 이관 규칙 정의
에이전트는 언제 사람의 도움이 필요한지 정확히 알아야 합니다. 일반적인 이관 트리거는 다음과 같습니다.
- 발신자가 상담원을 요청하는 경우.
- 에이전트의 응답 신뢰도가 낮은 경우.
- 같은 질문에 답하려는 시도가 여러 번 실패한 경우.
- 민감한 청구 또는 컴플라이언스 관련 상황.
- 감정이 격해진 고객 상호작용.
ElevenAgents에서는 이관 로직을 시각적 편집기인 Workflows에서 정의합니다. 이 기능을 사용하면 비기술 팀도 AI 에이전트의 대화 처리 방식을 설계할 수 있습니다. 각 단계를 정의하고, 대화를 한 에이전트에서 다음 에이전트로 이동시키는 조건을 설정하며, 트리거가 충족되면 사람에게 라우팅할 수 있습니다.

또한 멀티 에이전트 라우팅도 지원하므로 하나의 에이전트가 전체 통화를 처리하는 대신 특정 작업 전용의 전문 에이전트를 만들 수 있습니다. 예를 들어 트리아지 에이전트가 전화를 받고 발신자에게 필요한 사항을 파악한 다음, 결제 문의 전담 청구 에이전트에게 연결합니다. 각 에이전트는 자체 프롬프트와 지식 베이스를 기반으로 작동하므로 모든 것을 한꺼번에 처리하려 하지 않고 담당 영역에 집중해 정확성을 유지합니다.
5단계: 대화 평가 및 시뮬레이션
고객에게 시스템을 제공하기 전에 미리 정의한 평가 기준으로 테스트하세요. 실제 운영에서 발생하는 대부분의 실패는 잘못된 LLM이나 좋지 않은 음성 때문이 아닙니다. 엣지 케이스에서만 드러나는 시스템 프롬프트나 지식 베이스의 공백에서 비롯됩니다. 출시 전 테스트를 통해 실제 고객보다 먼저 이러한 공백을 찾을 수 있습니다.
ElevenAgents는 에이전트를 테스트하는 세 가지 상호 보완적인 방법을 제공합니다.
- 다음 응답 테스트: 정의된 성공 기준에 따라 대화 응답을 평가합니다. 시나리오를 정의하고 좋은 응답의 기준을 설정하면 LLM 평가자가 통과 또는 실패를 판정합니다.
- 도구 호출 테스트: 에이전트가 올바른 도구를 올바른 파라미터로 호출하는지 검증합니다. 이관, 데이터 조회, 결제 처리처럼 중요한 작업에 필수적입니다.
- 시뮬레이션 테스트: 시뮬레이션 사용자를 통해 전체 멀티턴 대화를 실행하여 단일 응답만이 아니라 전체 상호작용이 의도한 결과에 도달하는지 검증합니다.
출시 전에 세 가지 테스트를 모두 실행한 다음, 실패한 경우 원인을 추적하세요. 프롬프트의 공백, 누락된 지식 베이스 콘텐츠 또는 도구 로직 문제일 수 있습니다. 기준을 일관되게 통과할 때까지 반복하세요. 목표는 실제 고객 통화가 아니라 시뮬레이션 환경에서 문제를 발견하는 것입니다.
6단계: 배포, 모니터링 및 개선
출시 후에는 ElevenAgents 분석 대시보드에서 고객 성과와 운영 지표를 모두 모니터링하세요.
주요 지표는 다음과 같습니다.
- 해결률.
- 자체 해결률.
- 이관률.
- CSAT.
- 평균 처리 시간.
- 재문의율.
가장 성공적인 배포 사례는 실제 고객 대화를 바탕으로 프롬프트, 지식 소스, workflow를 계속 개선합니다.
ElevenAgents로 첫 AI 음성 에이전트 구축하기
많은 지원 및 운영 팀이 고객 대화를 자동화하고 싶어 하지만, 전체 음성 AI 스택을 내부적으로 구축하고 유지할 리소스가 부족합니다.
ElevenAgents는 실시간 대화의 복잡성 대부분을 처리하면서 코드 없이 음성 에이전트를 배포할 수 있는 방법을 제공합니다. 팀은 하나의 플랫폼에서 비즈니스 지식을 연결하고, workflow를 정의하며, 이관 로직을 구성하고, 성능을 테스트한 뒤 전화 및 웹 기반 음성 경험에 배포할 수 있습니다.
더 긴밀한 지원을 원하는 팀을 위해 ElevenAgents는 Forward Deployed Engineers를 제공합니다. 이들은 팀에 직접 참여해 프로덕션 준비가 된 에이전트의 범위 설정, 구축, 배포를 지원하는 ElevenLabs 전문가입니다. 플랫폼을 넘겨주고 물러나는 대신 출시 이후에도 계속 참여하며, 팀이 추적하는 동일한 KPI에 책임을 집니다.
다음 단계로 나아갈 준비가 되었다면 지금 바로 에이전트를 구축하거나 영업팀에 문의하여 구현을 가장 효과적으로 지원할 방법을 논의해 보세요.



