콘텐츠로 건너뛰기

보이스 에이전트 평가 프레임워크: 6가지 핵심 요소 설명

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

음성 에이전트는 거의 동시에 작동하는 여러 도구를 조율해야 합니다. 실시간 음성 텍스트 변환(STT)으로 고객의 의견을 기록하고, 대규모 언어 모델(LLM)로 맥락을 파악해 응답을 생성한 뒤, 텍스트 음성 변환(TTS) 소프트웨어로 오디오 파일을 생성하는 섬세한 과정입니다.

이처럼 많은 요소가 맞물려 작동하는데, 음성 에이전트의 성능을 어떻게 정확하게 평가할 수 있을까요?

이 글에서는 에이전트의 성공을 평가할 때 무엇을 측정해야 하는지 명확히 설명하는 6가지 핵심 요소 기반의 음성 에이전트 평가 프레임워크를 제안합니다. 또한 산업별로 이 요소들의 비중이 달라지는 이유와 평가 시 주의해야 할 일반적인 실수도 살펴봅니다.

요약

  • 음성 에이전트 평가의 6가지 핵심 요소는 TTS 음성 품질, 대화 품질, 도구 사용 및 작업 완료, 지능, 규정 준수 및 안전, 신뢰성입니다.
  • 가장 중요한 프로덕션 목표는 MOS 4.3, TSR 85% 초과, 첫 오디오 생성 시간 500ms 미만입니다.
  • 산업마다 각 요소에 서로 다른 비중을 두며, 일부 배포 환경에서는 특정 요소가 다른 요소보다 더 중요할 수 있습니다.
  • 일반적인 테스트 실수로는 깨끗한 오디오만 평가하거나 P99 지연 시간 급증을 무시하는 것이 있습니다.
  • ElevenLabs는 가장 중요한 지표에서 앞서갑니다. Scribe v2는 2.2%로 업계 최저 WER을 기록했고(Artificial Analysis, 2026년 6월), Flash v2.5와 Turbo v2.5는 속도 면에서 최상위 모델이며(Artificial Analysis, 2026년 6월), ElevenAgents는 약 75ms의 모델 추론 지연 시간을 제공합니다.

음성 에이전트 평가 프레임워크란?

AI 음성 에이전트 평가 프레임워크는 여러 차원에서 성능을 테스트할 수 있는 구조화된 시스템입니다. 포괄적인 프레임워크에는 오디오 충실도부터 대화 흐름, 규제 준수까지 평가하는 지표가 포함됩니다.

텍스트 챗봇과 달리 음성 에이전트는 모든 상호작용을 최소 3개의 기술 계층으로 처리합니다. 자동 음성 인식(ASR)은 사용자의 말을 텍스트로 변환하고, LLM은 응답을 구성하며, TTS 시스템은 그 응답을 다시 오디오로 변환합니다. 이 시스템 중 하나라도 실패하면 전체 경험의 품질이 저하됩니다.

이러한 복잡성 때문에 기업은 제공업체를 선택하고 배포하기 전에 음성 에이전트를 평가해야 합니다. 추가 지연 시간이나 부정확한 응답은 고객 이탈, 심하면 규제 벌금과 평판 손상 같은 실제 문제로 이어질 수 있습니다.

음성 에이전트 평가 프레임워크는 벤치마킹과 측정 가능한 데이터를 사용해 에이전트가 특정 사용 사례에 적합한지 판단합니다. 비즈니스 관점에서는 여러 음성 모델을 평가할 수 있어 고객에게 가장 적합한 모델을 선택할 수 있습니다.

평가해야 할 음성 에이전트의 6가지 핵심 요소

AI 에이전트 생성 및 배포는 그 어느 때보다 쉬워졌지만, 내부에서 진행되는 활성 프로세스는 상당히 복잡합니다. 여러 구성 요소가 함께 작동해 사용자의 말을 듣고, 원하는 바를 이해하고, 해당 정보를 LLM에 전달한 뒤, 오디오 응답을 생성합니다. 이 과정에서 많은 작업이 거의 동시에 일어납니다.

최고의 음성 에이전트와 파트너십을 맺고자 하는 기업에는 비교 기준이 될 엄격한 프레임워크가 필요합니다.

테스트 결과를 보고 싶다면 Artificial Analysis에서 다양한 구성 요소를 기준으로 여러 에이전트를 비교해 볼 수 있습니다. 아래는 모델 간 속도 비교 결과로, ElevenLabs Turbo v2.5와 Flash v2.5가 초당 처리 문자 수에서 큰 차이로 앞서고 있습니다.

Bar chart comparing various AI models for characters per second; ElevenLabs Turbo v2.5 scores highest at 504.8.

직접 실험을 진행하려는 개발자나 기업을 위해, AI 에이전트 평가 프레임워크에 활용할 6가지 핵심 요소를 소개합니다.

  • TTS 음성 품질: 합성 음성이 최종 사용자에게 얼마나 자연스럽고, 명확하며, 표현력 있게 들리는지입니다. Eleven v3와 같은 업계 선도 모델은 70개 이상의 언어에서 사람과 같은 감정 표현을 제공합니다.
  • 대화 품질: 모델이 사람의 말을 이해하고 의미를 파악하며, 여러 턴에 걸쳐 맥락에 맞는 응답을 신속하게 제공하는지입니다.
  • 도구 사용: 사람의 개입 없이 가용 리소스를 활용해 AI 에이전트가 작업을 완료하는 정도입니다.
  • 지능: 모델이 얼마나 잘 추론하고 새로운 입력을 처리하며 부정확하거나 환각된 응답을 피하는지입니다.
  • 규정 준수 및 안전: 모든 역량과 함께 AI 음성 에이전트는 활성 가드레일을 포함한 모든 규제 및 규정 준수 요건을 따라야 합니다.
  • 신뢰성: 총 가동 시간과 부하 상태에서의 일관된 성능 같은 요소로 대화형 AI 에이전트가 수요에 맞춰 확장할 수 있는지 판단합니다.

각 요소는 독립적이지만, 서로 연결되어 사용자에게 고품질의 최종 경험을 제공합니다. 예를 들어 모델의 음성 품질이 향상되었더라도 지연 시간이 높다면, 고객은 모델이 음성을 전달하기 전 어색한 대기 시간을 겪게 됩니다.

이제 음성 AI 평가의 각 요소를 더 자세히 살펴보겠습니다.

TTS 음성 품질

음성 품질부터 시작하겠습니다. 사람이 AI 대화형 에이전트와 상호작용할 때 가장 먼저 알아차릴 가능성이 높기 때문입니다. 음성이 로봇 같거나 이질적으로 들리면 에이전트에 대한 주관적 경험은 크게 나빠집니다.

국제전기통신연합 전기통신표준화부문(ITU-T)이 정의한 초기 평가 지표 중 하나는 평균 의견 점수(MOS)입니다. MOS는 1~5점 척도로, 1은 사용할 수 없는 수준이고 5는 우수함을 의미합니다. 주관적 측정 방식으로, 사람이 통화 후 피드백을 제공합니다.


이 척도에서 MOS 3.5 미만은 특히 현대 기준으로는 다소 낮은 수준이며, 고객 만족도에 영향을 줄 가능성이 큽니다.

MOS는 사람 중심 지표이지만, 이 점수에는 여러 기술 요건이 반영됩니다.

  • 피치 일관성 및 지터: 피치와 지터는 사람이 들을 때 자연스럽게 인식하는 두 가지 언어적 요소입니다. '피치'는 질문할 때 자연스럽게 목소리를 높이는 것처럼, 말하는 동안 변하는 억양을 뜻합니다. 지터는 음성 모델의 피치 이해가 흔들려 문장 전체에서 일관된 운율을 유지하지 못하는 현상입니다. 업계 지터 기준선은 30ms입니다.
  • 감정 표현력: 명확하고 정확한 음성이라도 문장이 의도한 감정 톤과 맞지 않으면 어색하게 들립니다. 정확한 톤 신호가 없으면 사람 청취자는 AI 대화형 에이전트와 친밀감을 덜 느끼고 더 낮게 평가합니다. ElevenAgents는 사람에 가까운 표현력을 제공해 모든 응답에 분명한 감정적 의도를 담습니다.
  • 배경 소음: 음성 에이전트의 배경 소음은 평가할 만한 두 가지 뚜렷한 차원이 있습니다. 출력 측면에서는 에이전트를 더 자연스럽게 들리도록 응답에 주변 배경 소음을 미세하게 추가합니다. 입력 측면에서는 STT 계층의 배경 소음 필터링이 정확도를 높이는 선택형 토글 기능입니다. 에이전트 평가 시 두 가지를 모두 테스트하세요. 주변 소음이 자연스럽게 들리는지 확인하고, 소음 필터를 켠 경우와 끈 경우의 STT 정확도를 평가합니다.

MOS를 계산할 때는 모든 지각 범주에서 높은 점수를 의미하는 4.3~4.5를 목표로 해야 합니다. 사람 패널 없이 대규모로 MOS를 예측하려면 UTMOSNISQA 같은 도구를 사용할 수 있습니다.

대화 품질

대화 품질은 음성 품질과 작업 완료 사이에 위치하는 복합적인 요소입니다. 음성 에이전트가 사용자의 요구를 얼마나 효과적으로 이해하고, 맥락에 맞게 끼어들며, 여러 턴의 대화에서 이를 끝까지 이어가는지 측정합니다.

여기서 핵심 지표는 의도 분류 정확도입니다. 일반적인 범위는 85%~92%이며, 최상위 성능은 96% 이상에 이릅니다. 85%가 높아 보일 수 있지만, 여전히 전체 유입 트래픽의 15%가 잘못 분류되어 부적절한 리소스로 연결된다는 뜻입니다.

높은 의도 분류 정확도에 기여하는 기술 요소는 다음과 같습니다.

  • 턴테이킹: 턴테이킹은 음성 에이전트가 자연스러운 대화 흐름을 얼마나 잘 관리하는지 결정합니다. 언제 듣고, 응답하고, 추가 입력을 기다려야 하는지를 평가합니다. 또한 사용자가 말을 끼어들었을 때 진행 중인 응답을 지우고 새 입력을 기반으로 새 응답을 생성하는 바지인 처리까지 포함합니다. ElevenLabs는 멀티 컨텍스트 웹소켓을 사용해 이러한 자연스러운 중단을 매끄럽게 처리합니다.
  • 지연 시간: 지연 시간은 사용자가 문장을 마친 시점부터 에이전트가 오디오 응답을 시작하는 시점까지의 엔드투엔드 지연을 말합니다. 프로덕션급 음성 에이전트는 첫 오디오 생성 시간을 500ms 미만으로 목표로 해야 하며, 300ms 미만이면 더 우수합니다. ElevenLabs Flash 모델은 약 75ms의 업계 최고 수준 모델 추론 시간을 제공해 이 범주에서 성공할 수 있도록 지원합니다.
  • 폴백률: 폴백률은 AI 에이전트가 사용자를 이해하지 못해 설명이나 반복을 요청하는 빈도를 측정합니다. 음성 인식 계층이 고객의 말을 잘못 듣거나 잘못 표현하면 LLM이 손상된 입력을 받기 때문에, 이는 주로 STT 정확도의 후속 결과입니다. 폴백률은 다음 공식을 사용하는 단순 계산입니다. 폴백률(%) = (폴백 횟수 / 총 상호작용 횟수) * 100.

ElevenLabs Scribe V2는 Artificial Analysis 음성 텍스트 변환 모델 평가에서 2.2%로 최저 WER을 기록했습니다

ElevenLabs Scribe V2 has the lowest WER at 2.2% on the Artificial Analysis speech to text model evaluation

Artificial Analysis 음성 텍스트 변환 모델 평가

대화 품질을 측정하는 한 가지 방법은 구성 요소별 업계 벤치마킹 기준을 살펴보는 것입니다. 보시다시피 ElevenLabs의 Scribe v2는 2026년 6월 기준 2.2%로 최저 단어 오류율을 기록했습니다. 이는 잘못 들음과 폴백이 줄고 의도 분류가 더 정확해진다는 의미입니다.

기업은 음성 에이전트가 작동하는 workflow에 따라 대화 품질도 달라진다는 점을 알 수 있습니다. 예를 들어 고객 서비스에서는 에스컬레이션 핸드오프 품질이나 FAQ 해결도 고려 대상이 됩니다.

도구 사용 및 작업 완료

품질이 대화 경험을 측정한다면, 작업 완료는 성공적인 결과로 이어졌는지를 측정합니다. 이는 비즈니스 성과와 직접 연결되므로 기업은 음성 에이전트 평가 프레임워크의 이 부분을 면밀히 살펴봐야 합니다.

도구 사용의 한 가지 지표는 슬롯 채우기 정확도입니다. 이는 AI 에이전트가 고객 정보로 양식을 작성하는 것과 같은 비교적 일상적인 작업을 얼마나 잘 완료하는지 판단합니다. 높은 슬롯 채우기 정확도는 에이전트가 과정 중 정보를 잃지 않고 대화에서 행동으로 매끄럽게 전환할 수 있음을 보여 줍니다.

작업 성공률(TSR)은 에이전트가 엔드투엔드 작업을 성공적으로 완료한 비율을 측정합니다. 여기서 완료 여부는 에이전트가 요청을 이해하고, 연결된 적절한 도구(API, 데이터베이스, 검색 증강 생성(RAG), 내부 지식 베이스)를 활용해 지원을 받는 능력에 따라 결정됩니다.

TSR 공식은 다음과 같습니다.


TSR = (완전히 완료된 작업 / 시도한 전체 작업) x 100

프로덕션 준비가 된 음성 에이전트는 TSR 85% 초과를 목표로 하며, 도구 호출 정확도와 도구 호출 신뢰성을 모니터링해야 합니다. TSR 저하를 방지하려면 프롬프트 또는 연결된 모델을 변경할 때마다 반드시 회귀 테스트를 수행하세요. 작은 차이도 TSR에 큰 영향을 줄 수 있습니다.

지능

지능은 음성 에이전트의 추론 및 고차원 역량을 포괄합니다. 이 요소가 음성 중심 IVR(Interactive Voice Response)과 음성 AI 에이전트의 차이를 분명하게 보여 줍니다.

여기서 평가할 주요 차원은 다음과 같습니다.

  • 환각 위험: 에이전트가 부정확하거나 회사 문서와 일치하지 않는 정보를 만들어 내는 환각은, 확신에 찬 어조로 전달될 수 있어 음성 AI에서 특히 큰 피해를 줍니다. 최근 연구에 따르면 일반적인 환각은 음성 에이전트에 대한 고객 만족도를 크게 떨어뜨립니다.
  • 범위 외 요청 처리: 지능형 에이전트는 질문이 자신의 맥락적 범위를 벗어나는 시점을 이해하고 적절하게 대응할 수 있습니다. 답을 환각하는 대신 거절하거나, 대화를 맥락적으로 정의된 영역으로 다시 유도합니다.
  • 컨텍스트 유지:여러 턴에 걸쳐 에이전트가 앞서 언급된 개체와 약속을 추적할 수 있을까요? 이 능력이 없다면 고객은 같은 내용을 반복해야 하거나 모순된 응답을 경험할 수 있습니다.
  • 추론 및 다단계 논리: 에이전트가 여러 턴에 걸쳐 조건부 논리를 올바르게 처리하거나 추론을 연결할 수 있을까요? 특히 금융 서비스와 같은 기술적 사용 사례에서는 미리 정의된 맥락 안에서 추론하는 능력이 성공에 필수적입니다.

이러한 차원과 구성 요소를 위한 여러 타사 벤치마크가 있습니다. 예를 들어 스탠퍼드의 언어 모델 종합 평가(HELM)는 여러 범주에서 LLM 성능을 벤치마킹합니다. 환각의 경우 TruthfulQA는 응답에 거짓 답변이 얼마나 자주 포함되는지 견고하게 분석합니다.

ElevenAgents의 장점 중 하나는 단일 기반 모델에 고정하는 일부 음성 플랫폼과 달리 LLM 계층 전체를 교체할 수 있다는 점입니다. 즉, 실제로는 특정 사용 사례의 추론 벤치마크에서 선도적인 모델을 자유롭게 연결할 수 있습니다.

규정 준수 및 안전

기업은 유해하거나 정책을 위반하는 출력을 막기 위해 활성 가드레일을 구현해야 합니다. 우회하거나 재정의될 수 있는 시스템 수준 프롬프트 지침과 달리, 독립적인 가드레일 검사는 모델 자체 외부의 별도 계층에서 실행됩니다. 이 검사는 출력이 사용자에게 도달하기 전에 평가하며, 위험한 영역으로 벗어나면 대화를 중단합니다.

감사 가능성도 관련 요건입니다. 프로덕션 에이전트는 사후 검토를 지원하는 형식으로 결정과 출력에 대한 상세 로그를 유지해야 합니다. 특히 규제가 엄격한 산업에서는 사후에 규정 준수를 입증하는 일이 처음부터 규정을 준수하는 것만큼 중요합니다.

기업이 준수해야 하는 정확한 규정은 산업별로 다릅니다. 가장 일반적으로 적용되는 프레임워크는 다음과 같습니다.

  • HIPAA: 미국 의료 환경의 보호 대상 건강 데이터에 적용됩니다.
  • PCI-DSS: 결제 카드 데이터를 처리하는 모든 에이전트에 적용됩니다.
  • GDPR: EU 및 EU 내 고객을 둔 기업의 데이터 개인정보 보호 의무입니다.

규정 준수 수준을 평가하는 기업을 위해, ElevenLabs는 AICPA SOC Type II 및 GDPR을 준수하며 AIUC-1 인증도 획득했습니다. AIUC-1은 AI 에이전트를 위해 특별히 설계된 보안 표준입니다.

신뢰성

신뢰성은 음성 에이전트 평가 프레임워크의 마지막 요소로, 에이전트가 실시간으로 일관되게 서비스를 제공할 수 있는지를 다룹니다.

음성 에이전트를 평가할 때는 다음 특성을 살펴보세요.

  • 가동 시간: 고객 대상 배포 환경에서는 장애를 방지하기 위해 99.9% 가동 시간이 요구됩니다. 인바운드 지원처럼 항상 켜져 있어야 하는 사용 사례에서는 안정적인 가동 시간이 핵심 요소입니다.
  • 우아한 성능 저하: 음성 에이전트의 근본적인 복잡성 때문에 한 구성 요소가 실패하기 시작하면 에이전트는 그 성능 저하를 원활하게 처리해야 합니다. 실제로는 부하가 늘어난 상태로 계속 작동하거나 오류를 반환하는 대신 사람에게 연결하는 것을 의미합니다.
  • 부하 상태 성능: 라이브 전환 전 부하 테스트에서는 예상 최대 동시성의 최소 2배를 시뮬레이션해야 합니다. 높은 부하에서 테스트하면 대규모 환경에서만 나타나는 지연 시간 증가나 성능 저하를 찾아낼 수 있습니다.

다른 모든 조건을 충족하는 고품질 모델이라도 고객 수요에 맞춰 확장하지 못하면 사용할 수 없을 수 있습니다. ElevenAgents는 1,000,000명의 선도적인 크리에이터와 기업의 신뢰를 받고 있으며, 성능 벤치마크를 타협하지 않고 엔터프라이즈 규모로 배포할 수 있는 플랫폼의 역량을 보여 줍니다.

음성 에이전트 MOS 측정 방법(단계별 안내)

기업에서 MOS를 수동으로 측정하려면 많은 사람 청취자와 실제 대화에서 추출한 오디오 클립이 필요합니다. 피드백을 수집하고 평균을 낸 뒤 데이터를 해석하는 구조화된 과정입니다.

음성 에이전트의 MOS를 실제로 측정하는 방법은 다음과 같습니다.

  1. 테스트 세트 준비: 다양한 대화 범위에서 최소 100개 클립을 포함하도록 에이전트 오디오 출력의 대표 표본을 선택합니다.
  2. 평가 세션 진행: 사람 청취자에게 커뮤니케이션 경험의 품질을 기준으로 각각 1~5점 척도로 평가하도록 요청합니다.
  3. 평가 집계 및 점수 계산: 각 클립의 평가 점수를 평균낸 다음, 모든 표본 클립의 평균을 계산해 전체 MOS를 산출합니다. MOS 4.3 이상이면 음성 에이전트가 프로덕션 준비를 마쳤다는 의미입니다.

수작업이 많이 필요하지만, 이 과정은 선택한 음성 에이전트에 대한 신뢰할 수 있는 MOS를 제공합니다. 대규모로 테스트하려면 프로그래밍 방식으로 MOS 점수를 예측하는 NISQA 같은 자동화 도구로 사람 청취자를 대체할 수 있습니다. 이러한 시스템을 활성 파이프라인에 통합하면 시간에 따른 MOS를 지속적으로 모니터링할 수 있습니다.

AI와 사람 테스트 벤치마크: FCR, AHT, CSAT

시간에 따라 MOS를 반복 계산하면 모델 개선 또는 회귀를 확인할 수 있지만, 사람의 성과와 벤치마킹하면 추가 맥락을 얻을 수 있습니다. 유사한 역할에서 사람이 실제로 달성하는 수준을 확인하면 음성 에이전트가 이상적인 수준에 가깝게 수행하는지 알 수 있습니다.

AI와 사람 테스트 벤치마크에서 고려할 몇 가지 지표는 다음과 같습니다.

사람 상담원 벤치마크
첫 통화 해결률(FCR)
70%
평균 처리 시간(AHT)
약 6분
고객 만족도 점수(CSAT)
70~85%
AI 목표
첫 통화 해결률(FCR)
75%
평균 처리 시간(AHT)
2~4분
고객 만족도 점수(CSAT)
85%

AI 에이전트는 사람의 FCR 및 CSAT 수준을 맞추는 동시에 AHT를 크게 개선할 수 있어야 합니다. 후자가 개선되는 이유는 AI 에이전트가 일반적으로 사람 상담원보다 더 일반적인 대화를 처리하기 때문입니다. 많은 기업은 AI 에이전트를 1차 응답자로 배치하고, 자율적으로 처리하기 너무 복잡한 경우에만 사람 상담원에게 통화를 넘기는 workflow를 구현합니다.

AI 비교 애그리게이터 Poe의 2025년 데이터에 따르면, ElevenLabs는 요청을 수행하는 전반적인 역량에서 가장 높은 성과를 유지했으며 전체 유입 요청의 74.4%를 완료했습니다. 이러한 성공은 빠른 사용량 증가로 이어졌고, Eleven v3와 v2.5-Turbo는 시간에 따라 AI 모델에 전송된 메시지의 60% 이상을 차지했습니다.

시간에 따라 AI 모델에 전송된 메시지, Poe 음성 에이전트 평가 프레임워크에서 ElevenLabs 선도

Messages sent to AI models over time, ElevenLabs leading the poe voice agent evaluation framework

Poe 벤치마크 기준 시간에 따라 AI 모델에 전송된 메시지

일반적인 음성 에이전트 테스트 실수

음성 에이전트 평가 프레임워크를 따를 때 최상의 시나리오를 테스트하고 싶은 유혹이 있습니다. 하지만 고객이 음성 AI 시스템과 상호작용하며 겪는 일상적 경험은 이상적인 조건에서 비롯되지 않습니다.

일반적인 음성 에이전트 테스트 실수 3가지와 해결 방법은 다음과 같습니다.

  • 가장 쉬운 경로만 테스트: 특히 MOS용 오디오 클립을 선택할 때는 반드시 엣지 사용 사례를 포함하세요. 배경 소음이나 억양이 있는 음성이 담긴 클립은 현실에서 매우 흔하므로, '깨끗한' 오디오 파일만 테스트하면 MOS가 잘못 보정됩니다.
  • 해결보다 컨테인먼트 우선: 사용자를 에이전트 시스템 안에 머물게 하도록 모델을 최적화하면 결과를 개선하지 않고도 컨테인먼트율이 높아집니다. 컨테인먼트율은 높은데 FCR이 낮다면, 에이전트가 해결책 없이 사용자를 답답한 루프에 빠뜨리고 있는 것입니다. 사용자가 원할 경우 사람 상담원과 대화할 수 있도록 절차를 마련하세요.
  • 지연 시간 백분위수 무시: SLA는 지연 시간을 P95 수준으로 지정하는 경우가 많습니다. 이 지표는 대다수 고객에게 일관된 경험을 제공하는 데 중요하지만, 마지막 5%도 실제 고객이라는 점을 잊지 마세요. 하루 10,000건의 통화를 처리하는 시스템이라면 5%는 여전히 느린 대화를 경험하는 500명입니다. 중앙값이나 P95만이 아니라 P99를 핵심 SLA 목표로 삼으세요.

이 점들을 염두에 두면 이상화된 평균에 의존하는 대신 공정하고 대표성 있는 기준선을 수립할 수 있습니다.

사용 사례별 평가가 필요한 이유

이 프레임워크에서 제시한 6가지 핵심 요소는 살펴볼 영역에 대한 가이드를 제공하지만, 각 요소의 비중은 산업에 따라 달라집니다. 예를 들어 금융 서비스 산업의 기업은 규정 준수와 도구 사용을 우선시할 수 있는 반면, 소비자 브랜드는 TTS 음성 품질을 핵심 원칙으로 삼을 수 있습니다.

사용 사례별 평가가 실제로 어떻게 작동하고 각 요소의 균형을 어떻게 바꿀 수 있는지, 두 가지 예를 살펴보겠습니다.

고객 지원

콜센터와 같은 특정 산업에서는 첫 통화 해결률(FCR)처럼 다른 작업 완료 지표도 중요한 고려 사항입니다. 사람의 개입 없이 인바운드 통화를 성공적으로 처리하면 사람 고객 서비스 상담원에게 가해지는 수요를 크게 줄일 수 있습니다. McKinsey는 추정합니다 음성 에이전트를 사용하는 콜센터는 상호작용량을 최대 50%까지 줄일 수 있습니다.

작업 성공률만큼 중요하지는 않지만, 여기서 고려할 또 다른 차원은 컨테인먼트율입니다. 컨테인먼트율은 통화의 총 지속 시간을 살펴보는 지표입니다. 컨테인먼트율이 매우 높은데 FCR이 낮다면, 에이전트가 고객에게 해결책을 제공하지 않은 채 통화를 붙잡고 있는 것입니다. 실제로 고객은 제자리만 맴도는 답답한 경험을 하게 될 수 있습니다.

추적할 다른 지표로는 AI 에이전트가 일상적인 문제를 빠르게 해결하는 데 초점을 맞춘 AHT가 있습니다. 따라서 고객 지원 분야는 다른 영역보다 대화 품질, 특히 턴테이킹과 폴백률을 우선시합니다.

의료

의료는 규제가 매우 엄격한 분야로, 까다로운 규정 준수 요건 때문에 음성 에이전트 운영에 극도의 신중함이 필요합니다. 규정 준수는 핵심 관심사이므로 프레임워크의 안전 요소 비중이 이 항목과 지능에 크게 쏠립니다.

의료 챗봇은 예약 일정 관리, 원격 의료 접근 경로, 증상 분류, 보험 관련 질문을 처리해야 합니다. 이 모든 작업에는 높은 수준의 지능과 도구 사용이 필요하며, 산업 또는 역할별 요구사항이 어떤 요소를 가장 중요하게 만드는지 다시 한번 보여 줍니다.

기업이 어떤 분야에서 일하든, 음성 에이전트 평가의 핵심 요소를 이해하고 균형 있게 적용하면 가장 적합한 에이전트를 찾는 데 도움이 됩니다.

고성능과 낮은 지연 시간을 위한 ElevenAgents 구축

구축에 선택하는 플랫폼은 실제 workflow에서 음성 에이전트의 성능에 직접적인 영향을 미칩니다. 특히 고객과 상호작용할 때는 에이전트가 모든 범주에서 뛰어난 성과를 낼 것이라는 확신이 필요합니다.

ElevenAgents는 프로덕션 음성 배포를 위해 구축되었으며, Eleven v3를 통한 업계 최고 수준의 TTS, Scribe v2를 통한 실시간 STT, 그리고 에이전트 오케스트레이션 계층을 결합해 엔터프라이즈 규모에 맞게 설계되었습니다. 모든 구성 요소는 이 프레임워크에서 제시한 벤치마크를 충족하도록 구축되어 고객에게 고품질 경험을 제공할 수 있습니다.

선택지를 검토 중이든 구축을 시작할 준비가 되었든, ElevenLabs가 함께합니다. ElevenAgents 플랫폼에서 사용 사례에 어떻게 적용되는지 확인하거나 가입하고 지금 바로 구축을 시작하세요.

음성 에이전트 평가 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요