보이스 에이전트 평가 프레임워크: 6가지 핵심 요소 설명
- 게시일
- 최종 업데이트
음성 에이전트는 거의 동시에 작동하는 여러 도구를 조율해야 합니다. 실시간 음성 텍스트 변환(STT)으로 고객의 말을 기록하고, 대규모 언어 모델(LLM)로 맥락을 파악해 응답을 생성한 뒤, 텍스트 음성 변환(TTS) 소프트웨어로 오디오 파일을 만드는 섬세한 과정입니다.
이렇게 많은 요소가 움직이는 상황에서 음성 에이전트의 성능을 어떻게 정확히 평가할 수 있을까요?
이 글에서는 에이전트의 성공을 평가할 때 무엇을 측정해야 하는지 정확히 설명하는 6가지 핵심 축의 음성 에이전트 평가 프레임워크를 제안합니다. 또한 산업별로 이 축의 중요도를 다르게 두어야 하는 이유와 평가 시 주의할 일반적인 실수도 살펴보겠습니다.
요약
- 음성 에이전트 평가의 6가지 주요 축은 TTS 음성 품질, 대화 품질, 도구 사용 및 작업 완료, 지능, 규정 준수 및 안전, 신뢰성입니다.
- 가장 중요한 프로덕션 목표는 MOS 4.3, TSR 85% 초과, 첫 오디오 생성 시간 500ms 미만입니다.
- 산업마다 각 축의 비중은 다르며, 일부 배포 환경에서는 특정 축이 다른 축보다 더 중요할 수 있습니다.
- 일반적인 테스트 실수로는 깨끗한 오디오만 평가하거나 P99 지연 시간 급증을 무시하는 것이 있습니다.
- ElevenLabs는 가장 중요한 지표에서 앞서갑니다. Scribe v2는 2.2%로 업계 최저 WER을 달성했고(Artificial Analysis, 2026년 6월), Flash v2.5와 Turbo v2.5는 속도 부문 최상위 모델이며(Artificial Analysis, 2026년 6월), ElevenAgents는 약 75ms의 모델 추론 지연 시간을 제공합니다.
음성 에이전트 평가 프레임워크란?
AI 음성 에이전트 평가 프레임워크는 여러 차원에서 성능을 테스트할 수 있는 체계적인 시스템입니다. 포괄적인 프레임워크에는 오디오 충실도부터 대화 흐름, 규정 준수까지 평가하는 지표가 포함됩니다.
텍스트 챗봇과 달리 음성 에이전트는 모든 상호작용을 최소 3개의 기술 스택으로 처리합니다. 자동 음성 인식(ASR)은 사용자의 말을 텍스트로 변환하고, LLM은 응답을 구성하며, TTS 시스템은 그 응답을 다시 오디오로 변환합니다. 이 시스템 중 하나라도 실패하면 전체 경험의 품질이 저하됩니다.
이러한 복잡성 때문에 기업은 제공업체를 선택하고 배포하기 전에 음성 에이전트를 평가해야 합니다. 추가 지연 시간이나 부정확한 응답은 고객 이탈, 심하면 규제 벌금과 평판 손상 같은 실제 문제로 이어질 수 있습니다.
음성 에이전트 평가 프레임워크는 벤치마킹과 측정 가능한 데이터를 사용해 에이전트가 특정 사용 사례에 적합한지 판단합니다. 비즈니스 관점에서는 다양한 음성 모델을 평가할 수 있어 고객에게 가장 적합한 모델을 선택할 수 있습니다.
평가해야 할 음성 에이전트의 6가지 핵심 축
AI 에이전트 생성 및 배포가 그 어느 때보다 간편해졌지만, 내부에서 진행되는 활성 프로세스는 상당히 복잡합니다. 여러 구성 요소가 함께 작동해 사용자의 말을 듣고, 요구를 이해하며, 정보를 LLM에 전달한 후 오디오 응답을 생성하므로 거의 동시에 많은 작업이 이루어집니다.
최고의 음성 에이전트와 협력하려는 기업에는 비교 기준이 될 엄격한 프레임워크가 필요합니다.
테스트 결과를 확인하고 싶다면 Artificial Analysis에서 구성 요소별 여러 에이전트 비교 결과를 제공합니다. 아래에서는 모델 간 속도 비교 결과를 볼 수 있으며, ElevenLabs Turbo v2.5와 Flash v2.5가 초당 처리 문자 수에서 큰 차이로 앞서고 있습니다.

자체 실험을 진행하려는 개발자나 기업을 위해, 활용할 AI 에이전트 평가 프레임워크의 6가지 축을 소개합니다.
- TTS 음성 품질: 최종 사용자에게 합성 음성이 얼마나 자연스럽고 명확하며 표현력 있게 들리는지를 의미합니다. Eleven v3와 같은 업계 최고 모델은 70개 이상의 언어에서 사람 같은 감성적 전달을 제공합니다.
- 대화 품질: 모델이 사람의 말을 이해하고 의미를 처리하며 여러 턴에 걸쳐 맥락에 맞게 신속히 응답하나요?
- 도구 사용: AI 에이전트가 사람의 개입 없이 가용 리소스를 활용해 작업을 완료하는 정도입니다.
- 지능: 모델이 얼마나 잘 추론하고 새로운 입력을 처리하며 부정확하거나 환각된 응답 생성을 피하는지를 의미합니다.
- 규정 준수 및 안전: 모든 기능과 함께 AI 음성 에이전트는 능동형 가드레일을 포함한 모든 규제 및 규정 준수 요건을 지켜야 합니다.
- 신뢰성: 총 가동 시간과 부하 상황에서의 일관된 성능 등을 통해 대화형 AI 에이전트가 수요에 맞춰 확장할 수 있는지 판단합니다.
각 축은 독립적이지만, 서로 연결되어 사용자에게 고품질의 최종 경험을 제공합니다. 예를 들어 모델의 음성 품질이 개선되더라도 지연 시간이 높으면 고객은 모델이 음성을 전달하기 전까지 어색한 대기 시간을 겪게 됩니다.
각 음성 AI 평가 축을 더 자세히 살펴보겠습니다.
TTS 음성 품질
음성 품질부터 시작하겠습니다. 사람이 AI 대화형 에이전트와 상호작용할 때 가장 먼저 알아차릴 가능성이 높기 때문입니다. 로봇 같거나 어색하게 느껴진다면 에이전트에 대한 주관적 경험은 크게 나빠집니다.
국제전기통신연합 전기통신 표준화 부문(ITU-T)이 정의한 초기 평가 지표 중 하나는 평균 의견 점수(MOS)입니다. MOS는 1~5점 척도이며, 1은 사용할 수 없는 수준이고 5는 우수함을 뜻합니다. 주관적 측정 방식으로, 사람 청취자가 통화 후 피드백을 제공합니다.
이 척도에서 MOS 3.5 미만은 특히 현대 기준으로는 상당히 낮은 수준이며, 고객 만족도에 영향을 줄 가능성이 큽니다.
MOS는 사람 중심 지표이지만, 이 점수에는 여러 기술 요건이 반영됩니다.
- 피치 일관성 및 지터: 피치와 지터는 사람이 들을 때 자연스럽게 인지하는 두 가지 언어 요소입니다. ‘피치’는 질문할 때 자연스럽게 목소리를 높이는 것처럼, 말하는 동안 달라지는 억양을 뜻합니다. 지터는 음성 모델의 피치 이해가 흔들려 문장 전체에서 일관된 운율을 유지하지 못하는 현상입니다. 업계 지터 기준선은 30ms입니다.
- 감정 표현력: 음성이 명확하고 정확해도 문장의 의도된 감정 톤과 맞지 않으면 어색하게 들립니다. 정확한 톤 신호가 없으면 사람 청취자는 AI 대화형 에이전트와 친밀감을 덜 느끼고 더 낮게 평가합니다. ElevenAgents는 사람에 가까운 표현력을 제공해 모든 응답에 분명한 감정적 의도를 담습니다.
- 배경 소음: 음성 에이전트의 배경 소음에는 평가할 만한 두 가지 차원이 있습니다. 출력 측면에서는 에이전트를 더 자연스럽게 들리도록 응답에 주변 배경 소음을 미묘하게 추가합니다. 입력 측면에서는 STT 레이어의 배경 소음 필터링이 정확도를 높이는 선택형 토글입니다. 에이전트를 평가할 때는 둘 다 테스트하세요. 주변 소리가 자연스러운지 듣고, 소음 필터를 켠 경우와 끈 경우의 STT 정확도를 평가해야 합니다.
MOS를 계산할 때는 이러한 모든 지각 범주에서 높은 점수를 의미하는 4.3~4.5를 목표로 해야 합니다. 사람 패널 없이 대규모로 MOS를 예측하려면 UTMOS 및 NISQA 같은 도구를 사용할 수 있습니다.
대화 품질
대화 품질은 음성 품질과 작업 완료 사이에 위치하는 복합적인 축입니다. 음성 에이전트가 사용자의 요구를 얼마나 효과적으로 이해하고, 맥락에 맞춰 끼어들며, 여러 턴의 대화에서 이를 완료까지 이어 가는지 측정합니다.
여기서 주요 지표는 의도 분류 정확도입니다. 일반적으로 85%~92% 수준이며, 최상위 성능은 96% 이상에 이릅니다. 85%가 높아 보일 수 있지만, 이는 유입 트래픽의 15%가 잘못 분류되어 잘못된 리소스로 라우팅된다는 뜻입니다.
높은 의도 분류 정확도에 기여하는 기술 요소는 다음과 같습니다.
- 턴 테이킹: 턴 테이킹은 음성 에이전트가 자연스러운 대화 흐름을 얼마나 잘 관리하는지 결정합니다. 언제 듣고, 응답하고, 추가 입력을 기다려야 하는지 판단하는 능력을 평가합니다. 또한 모델이 진행 중인 응답을 지우고 새 입력을 바탕으로 새로운 응답을 생성하는 끼어들기 처리도 포함합니다. ElevenLabs는 멀티 컨텍스트 웹소켓을 사용해 이러한 자연스러운 중단을 매끄럽게 처리합니다.
- 지연 시간: 지연 시간은 사용자가 문장을 끝낸 시점부터 에이전트가 오디오 응답을 시작하는 시점까지의 엔드투엔드 지연을 말합니다. 프로덕션급 음성 에이전트는 첫 오디오 생성 시간을 500ms 미만으로 목표로 해야 하며, 300ms 미만이면 더욱 우수합니다. ElevenLabs Flash 모델은 업계 최고 수준인 약 75ms의 모델 추론 시간을 제공해 이 항목에서 성공할 수 있도록 지원합니다.
- 폴백 비율: 폴백 비율은 AI 에이전트가 사용자를 이해하지 못해 명확한 설명이나 반복을 요청하는 빈도를 나타냅니다. 음성 인식 레이어가 고객의 말을 잘못 듣거나 잘못 표현하면 LLM이 손상된 입력을 받게 되므로, 이는 주로 STT 정확도에서 비롯되는 결과입니다. 폴백 비율은 다음 공식으로 계산합니다. 폴백 비율(%) = (폴백 수 / 총 상호작용 수) * 100.
ElevenLabs Scribe V2는 Artificial Analysis 음성 텍스트 변환 모델 평가에서 2.2%로 가장 낮은 WER을 기록했습니다

Artificial Analysis 음성 텍스트 변환 모델 평가
대화 품질을 측정하는 한 가지 방법은 구성 요소별 업계 벤치마킹 기준을 살펴보는 것입니다. 보시다시피 ElevenLabs의 Scribe v2는 2026년 6월 기준 2.2%로 가장 낮은 단어 오류율을 기록했습니다. 즉, 잘못 듣는 경우와 폴백이 줄고 의도 분류가 더 정확해집니다.
기업은 대화 품질이 음성 에이전트가 작동하는 워크플로에 따라 달라질 수도 있음을 알 수 있습니다. 예를 들어 고객 서비스에서는 상담원 에스컬레이션 전환 품질이나 FAQ 해결도 고려할 수 있습니다.
도구 사용 및 작업 완료
품질이 대화가 어떻게 느껴졌는지를 측정한다면, 작업 완료는 성공적인 결과로 이어졌는지를 측정합니다. 이는 비즈니스 성과와 직접 연결되므로 기업은 음성 에이전트 평가 프레임워크의 이 부분을 세심하게 살펴야 합니다.
도구 사용의 한 지표는 슬롯 채우기 정확도입니다. 이는 AI 에이전트가 고객 정보를 양식에 입력하는 것과 같은 일상적인 작업을 얼마나 잘 완료하는지 판단합니다. 높은 슬롯 채우기 정확도는 에이전트가 도중에 정보를 잃지 않고 대화에서 행동으로 매끄럽게 전환할 수 있음을 보여줍니다.
작업 성공률(TSR)은 에이전트가 엔드투엔드 작업을 성공적으로 완료한 비율을 측정하는 지표입니다. 여기서 완료란 에이전트가 요청을 이해하고 적절히 연결된 도구(API, 데이터베이스, 검색 증강 생성(RAG), 내부 지식 베이스)를 사용해 지원을 제공하는 능력을 뜻합니다.
TSR 공식은 다음과 같습니다.
TSR = (완전히 완료된 작업 / 시도한 총 작업 수) x 100
프로덕션 준비가 된 음성 에이전트는 TSR 85% 초과를 목표로 하고, 도구 호출 정확도와 도구 호출 신뢰성을 모니터링해야 합니다. TSR 저하를 방지하려면 프롬프트나 연결된 모델을 변경할 때마다 반드시 회귀 테스트를 수행하세요. 작은 변화도 TSR에 큰 영향을 미칠 수 있습니다.
지능
지능은 음성 에이전트의 추론 및 고차원 역량을 포괄합니다. 이 축은 음성 기반 IVR(대화형 음성 응답)과 음성 AI 에이전트의 차이를 명확히 보여줍니다.
여기서 평가할 주요 차원은 다음과 같습니다.
- 환각 위험: 에이전트가 부정확하거나 회사 문서와 일치하지 않는 정보를 생성하는 환각은 확신에 찬 목소리로 전달될 수 있어 음성 AI에서 특히 해롭습니다. 최근 연구에 따르면 흔한 환각은 음성 에이전트에 대한 고객 만족도를 크게 떨어뜨립니다.
- 범위 밖 요청 처리: 지능형 에이전트는 질문이 자신의 맥락적 범위를 벗어났을 때를 이해하고 적절하게 대응합니다. 답을 환각하는 대신 거절하거나 대화를 맥락상 정의된 영역으로 다시 유도합니다.
- 맥락 유지: 여러 턴에 걸쳐 에이전트가 이전에 언급된 개체와 약속을 추적할 수 있나요? 이 능력이 없으면 고객은 같은 내용을 반복하거나 모순된 응답을 경험할 수 있습니다.
- 추론 및 다단계 논리: 에이전트가 여러 턴에 걸쳐 조건부 논리를 올바르게 처리하거나 추론을 연결할 수 있나요? 특히 금융 서비스와 같은 기술적인 사용 사례에서는 사전에 정의된 맥락 안에서 추론하는 능력이 성공에 필수적입니다.
이러한 차원과 구성 요소를 위한 여러 타사 벤치마크가 있습니다. 예를 들어 스탠퍼드의 언어 모델 종합 평가(HELM)는 다양한 범주에서 LLM 성능을 벤치마킹합니다. 환각의 경우 TruthfulQA는 응답에 거짓 답변이 얼마나 자주 포함되는지 강력하게 분석합니다.
ElevenAgents의 장점 중 하나는 단일 기반 모델에 묶어 두는 일부 음성 플랫폼과 달리 LLM 레이어 전체를 교체할 수 있다는 점입니다. 즉, 실제로는 특정 사용 사례의 추론 벤치마크를 선도하는 어떤 모델이든 연결할 수 있습니다.
규정 준수 및 안전
기업은 유해하거나 정책을 위반하는 출력을 막기 위해 능동형 가드레일을 구현해야 합니다. 대화로 우회하거나 무력화될 수 있는 시스템 수준 프롬프트 지침과 달리, 독립적인 가드레일 검사는 모델 자체 밖의 별도 레이어에서 실행됩니다. 사용자에게 도달하기 전에 출력을 평가하고, 위험한 영역으로 벗어나면 대화를 중단합니다.
감사 가능성도 관련 요건입니다. 프로덕션 에이전트는 사후 검토를 지원하는 형식으로 결정과 출력에 대한 상세 로그를 유지해야 합니다. 특히 규제가 엄격한 산업에서는 사후에 규정 준수를 입증하는 일이 처음부터 이를 달성하는 것만큼 중요합니다.
비즈니스가 준수해야 하는 정확한 규정은 산업별로 다릅니다. 가장 일반적으로 적용되는 프레임워크는 다음과 같습니다.
- HIPAA: 미국 의료 환경의 보호 대상 건강 데이터에 적용됩니다.
- PCI-DSS: 결제 카드 데이터를 처리하는 모든 에이전트에 적용됩니다.
- GDPR: EU 및 EU 고객을 보유한 기업의 데이터 개인정보 보호 의무입니다.
규정 준수 상태를 평가하는 기업을 위해 ElevenLabs는 AICPA SOC Type II 및 GDPR 준수를 갖추고 있으며, AIUC-1 인증도 획득했습니다. AIUC-1은 AI 에이전트를 위해 특별히 설계된 보안 표준입니다.
신뢰성
신뢰성은 음성 에이전트 평가 프레임워크의 마지막 축으로, 에이전트가 실시간으로 일관되게 서비스를 제공할 수 있는지를 다룹니다.
음성 에이전트를 평가할 때는 다음 특성을 살펴보세요.
- 가동 시간: 고객 대상 배포에는 장애를 피하기 위해 99.9% 가동 시간이 요구됩니다. 특히 인바운드 지원처럼 항상 켜져 있어야 하는 사용 사례에서는 안정적인 가동 시간이 중요한 요소입니다.
- 우아한 성능 저하: 음성 에이전트의 기반 복잡성 때문에 한 구성 요소가 실패하기 시작하면 에이전트는 그 성능 저하를 우아하게 처리해야 합니다. 실제로는 부하가 커진 상태로 계속 작동하거나 오류를 반환하는 대신 사람 상담원에게 연결하는 것을 의미합니다.
- 부하 상태 성능:라이브 전환 전에는 예상 최대 동시성의 최소 2배를 시뮬레이션하는 부하 테스트를 목표로 해야 합니다. 강한 부하 상태에서 테스트하면 규모가 커질 때만 나타나는 지연 시간 증가나 성능 저하를 정확히 파악할 수 있습니다.
다른 모든 조건을 충족하는 고품질 모델이라도 고객 수요에 맞춰 확장하지 못하면 사용할 수 없습니다. ElevenAgents는 1,000,000명의 선도적인 크리에이터와 기업이 신뢰하며, 성능 벤치마크를 타협하지 않고 엔터프라이즈 규모의 배포를 지원할 수 있는 플랫폼 역량을 보여줍니다.
음성 에이전트의 MOS 측정 방법(단계별)
기업에서 MOS를 수동으로 측정하려면 많은 수의 사람 청취자와 실제 대화에서 가져온 오디오 클립을 준비해야 합니다. 피드백을 수집하고, 평균을 내고, 데이터를 해석하는 체계적인 과정입니다.
음성 에이전트의 MOS를 실제로 측정하는 방법은 다음과 같습니다.
- 테스트 세트 준비: 다양한 대화를 아우르는 에이전트 오디오 출력의 대표 샘플을 최소 100개 클립으로 선정하세요.
- 평가 세션 진행: 사람 청취자에게 커뮤니케이션 경험의 품질을 기준으로 각 클립을 1~5점 척도로 평가해 달라고 요청하세요.
- 평가 취합 및 점수 계산: 각 클립의 평가 점수를 평균낸 다음, 모든 샘플 클립의 평균을 계산해 전체 MOS를 산출하세요. MOS 4.3 이상이면 음성 에이전트가 프로덕션 준비가 되었음을 의미합니다.
수동 작업이 많이 필요하지만, 이 과정으로 선택한 음성 에이전트의 신뢰할 수 있는 MOS를 얻을 수 있습니다. 대규모로 테스트하려면 MOS 점수를 프로그래밍 방식으로 예측하는 NISQA 같은 자동화 도구로 사람 청취자를 대체할 수 있습니다. 이러한 시스템을 활성 파이프라인에 통합해 시간에 따른 MOS를 지속적으로 모니터링할 수도 있습니다.
AI와 사람 테스트 벤치마크: FCR, AHT, CSAT
시간에 따라 MOS를 반복 계산하면 모델의 개선 또는 회귀를 확인할 수 있지만, 사람의 성능과 벤치마킹하면 추가 맥락을 얻을 수 있습니다. 유사한 역할에서 사람이 실제로 달성하는 수준을 보면 음성 에이전트가 이상적인 수준에 가까운 성능을 내는지 알 수 있습니다.
AI와 사람 테스트 벤치마크에서 고려할 몇 가지 지표를 소개합니다.
AI 에이전트는 사람 상담원의 FCR 및 CSAT 수준을 맞추면서 AHT는 크게 개선할 수 있어야 합니다. 이는 AI 에이전트가 일반적으로 사람 상담원보다 더 일반적인 대화를 처리하기 때문입니다. 많은 기업은 AI 에이전트를 첫 응답자로 두고, 자율적으로 처리하기에 너무 복잡한 경우에만 사람 상담원에게 통화를 넘기는 워크플로를 구현합니다.
AI 비교 애그리게이터 Poe의 2025년 데이터에 따르면 ElevenLabs는 요청을 처리하는 전반적인 능력에서 가장 뛰어난 성과를 유지했습니다. 전체 유입 요청의 74.4%를 완료했습니다. 이러한 성공은 빠른 사용량 증가로 이어져, Eleven v3와 v2.5-Turbo가 시간에 따라 AI 모델에 전송된 메시지의 60% 이상을 차지했습니다.
시간에 따른 AI 모델 전송 메시지, Poe 음성 에이전트 평가 프레임워크에서 ElevenLabs 선도

Poe 벤치마크 기준 시간에 따른 AI 모델 전송 메시지
일반적인 음성 에이전트 테스트 실수
음성 에이전트 평가 프레임워크를 따를 때 최상의 시나리오만 테스트하고 싶어질 수 있습니다. 하지만 고객이 음성 AI 시스템과 상호작용하며 겪는 일상적인 경험은 이상적인 조건에서 나오지 않습니다.
일반적인 음성 에이전트 테스트 실수 3가지와 해결 방법은 다음과 같습니다.
- 가장 쉬운 경로만 테스트: 특히 MOS용 오디오 클립을 선택할 때는 엣지 사용 사례를 반드시 포함하세요. 배경 소음이나 억양이 있는 음성은 실제 환경에서 매우 흔하므로, ‘깨끗한’ 오디오 파일만 테스트하면 MOS를 잘못 보정하게 됩니다.
- 해결보다 컨테인먼트 우선: 사용자를 에이전트 시스템 안에 머물게 하도록 모델을 최적화하면 결과를 개선하지 않고도 컨테인먼트 비율만 높아집니다. 컨테인먼트 비율이 높은데 FCR이 낮다면, 에이전트가 해결책 없이 사용자를 답답한 반복 과정에 빠뜨리고 있는 것입니다. 사용자가 원하면 사람 상담원과 통화할 수 있도록 절차를 마련하세요.
- 지연 시간 백분위수 무시: SLA는 종종 P95 수준으로 지연 시간을 지정합니다. 이 지표는 대다수 고객에게 일관된 경험을 제공하는 데 중요하지만, 마지막 5%도 실제 고객이라는 점을 잊지 마세요. 하루 10,000건의 통화를 처리하는 시스템에서는 5%가 느린 대화를 겪는 500명에 해당합니다. 중앙값이나 P95만이 아니라 P99를 주요 SLA 목표로 삼으세요.
이를 염두에 두면 이상화된 평균에 의존하는 대신 공정하고 대표성 있는 기준선을 수립할 수 있습니다.
사용 사례별 평가가 필요한 이유
이 프레임워크에서 제시한 6가지 축은 살펴봐야 할 영역을 안내하지만, 각 축의 비중은 산업에 따라 달라집니다. 예를 들어 금융 서비스 기업은 규정 준수와 도구 사용을 우선할 수 있는 반면, 소비자 브랜드는 TTS 음성 품질을 핵심 원칙으로 삼을 수 있습니다.
사용 사례별 평가가 실제로 어떻게 작동하고 각 축의 균형을 어떻게 바꿀 수 있는지 두 가지 예를 살펴보겠습니다.
고객 지원
콜센터와 같은 특정 산업에서는 첫 통화 해결률(FCR)처럼 다른 작업 완료 지표도 중요한 요소입니다. 사람의 개입 없이 수신 통화를 성공적으로 처리하면 사람 고객 서비스 상담원에게 가해지는 수요를 크게 줄일 수 있습니다. McKinsey는 추정합니다 음성 에이전트를 사용하는 콜센터는 상호작용량을 최대 50% 줄일 수 있습니다.
작업 성공률만큼 중요하지는 않지만, 여기서 고려할 또 다른 차원은 컨테인먼트 비율입니다. 컨테인먼트 비율은 통화의 총 지속 시간을 살펴보는 지표입니다. 컨테인먼트 비율이 매우 높은데 FCR이 낮다면, 에이전트가 고객에게 해결책을 제공하지 않은 채 통화를 붙잡고 있는 것입니다. 실제로 고객은 제자리걸음을 하는 듯한 답답한 경험을 할 수 있습니다.
추적할 다른 지표로는 AI 에이전트가 일상적인 문제를 빠르게 해결하도록 하는 AHT가 있습니다. 따라서 고객 지원 분야에서는 다른 영역보다, 특히 턴 테이킹과 폴백 비율에서 대화 품질을 우선시하게 됩니다.
헬스케어
헬스케어는 엄격한 규정 준수 요건으로 음성 에이전트 운영에 매우 세심한 주의가 필요한 고도로 규제된 분야입니다. 규정 준수가 핵심 관심사이므로, 프레임워크의 안전 축은 무엇보다 규정 준수와 지능에 크게 가중치를 두게 됩니다.
헬스케어 챗봇은 예약 일정 관리, 원격 의료 접근 경로, 증상 분류, 보험 관련 질문을 처리해야 합니다. 이 모두에는 높은 수준의 지능과 도구 사용이 필요하며, 산업 또는 역할별 요구가 어떤 축을 가장 중요하게 만드는지 다시 한번 보여줍니다.
어떤 분야에서 사업하든 음성 에이전트 평가의 핵심 축을 이해하고 균형 있게 적용하면 가장 적합한 에이전트를 찾는 데 도움이 됩니다.
고성능 및 저지연을 위한 ElevenAgents 구축
구축 기반으로 선택하는 플랫폼은 실제 워크플로에서 음성 에이전트의 성능에 직접적인 영향을 미칩니다. 특히 고객과 상호작용할 때는 에이전트가 모든 범주에서 뛰어난 성과를 낼 것이라는 확신이 필요합니다.
ElevenAgents는 프로덕션 음성 배포를 위해 구축되었으며, Eleven v3를 통한 업계 최고 수준의 TTS, Scribe v2를 통한 실시간 STT, 그리고 에이전트 오케스트레이션 레이어를 결합해 엔터프라이즈 규모에 맞게 설계되었습니다. 모든 구성 요소는 이 프레임워크에 제시된 벤치마크를 충족하도록 구축되어 고객에게 고품질 경험을 제공할 수 있습니다.
옵션을 비교 중이든 구축을 시작할 준비가 되었든, ElevenLabs는 적합한 경로를 제공합니다. ElevenAgents 플랫폼을 살펴보고 사용 사례에 어떻게 맞는지 확인하거나, 가입하고 지금 바로 구축을 시작하세요.


