Eleven v4를 소개합니다역대 가장 감성적인 모델, Eleven v4를 만나보세요. 10월 12일까지 Creator+에 크레딧 3배 제공

콘텐츠로 건너뛰기

보이스 에이전트 평가 프레임워크: 6가지 핵심 요소 설명

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

음성 에이전트는 거의 동시에 작동하는 수많은 도구를 조율해야 합니다. 실시간 음성 텍스트 변환 (STT)으로 고객의 말을 기록하고, 대규모 언어 모델(LLM)로 맥락을 이해해 응답을 생성한 뒤, 텍스트 음성 변환 (TTS) 소프트웨어로 오디오 파일을 만드는 섬세한 과정입니다.

이처럼 많은 요소가 움직이는 상황에서 음성 에이전트 성능을 어떻게 정확히 평가할 수 있을까요?

이 글에서는 에이전트의 성공을 평가할 때 무엇을 측정해야 하는지 정확히 설명하는 6가지 핵심 축의 음성 에이전트 평가 프레임워크를 제안합니다. 산업별로 이 축의 중요도를 다르게 두어야 하는 이유와 평가 시 주의할 일반적인 실수도 살펴보겠습니다.

요약

  • 음성 에이전트 평가의 6가지 주요 축은 TTS 음성 품질, 대화 품질, 도구 사용 및 작업 완료, 지능, 규정 준수 및 안전, 안정성입니다.
  • 달성해야 할 가장 중요한 프로덕션 목표는 MOS 4.3, TSR 85% 이상, 첫 오디오 생성 시간 500ms 미만입니다.
  • 산업마다 각 축의 비중은 다르며, 특정 배포 환경에서는 한 축이 다른 축보다 더 중요할 수 있습니다.
  • 일반적인 테스트 실수로는 깨끗한 오디오만 평가하거나 P99 지연 시간 급증을 무시하는 것이 있습니다.
  • ElevenLabs는 가장 중요한 지표에서 앞서갑니다. Scribe v2는 2.2%로 업계 최저 WER을 기록했으며(Artificial Analysis, 2026년 6월), Flash v2.5와 Turbo v2.5는 속도 부문 최고 모델이고(Artificial Analysis, 2026년 6월), ElevenAgents는 약 75ms의 모델 추론 지연 시간을 제공합니다.

음성 에이전트 평가 프레임워크란 무엇인가요?

AI 음성 에이전트 평가 프레임워크는 여러 차원에서 성능을 테스트할 수 있는 구조화된 시스템입니다. 종합적인 프레임워크에는 오디오 충실도부터 대화 흐름, 규정 준수까지 평가하는 지표가 포함됩니다.

텍스트 챗봇과 달리 음성 에이전트는 모든 상호작용을 최소 3개의 기술 계층으로 처리합니다. 자동 음성 인식 (ASR)은 사용자의 말을 텍스트로 변환하고, LLM은 응답을 구성하며, TTS 시스템은 응답을 다시 오디오로 변환합니다. 이 시스템 중 하나라도 실패하면 전체 경험이 저하됩니다.

이러한 복잡성 때문에 기업은 제공업체를 선택하고 배포하기 전에 음성 에이전트를 평가해야 합니다. 추가 지연 시간이나 부정확한 응답은 고객 이탈, 심한 경우 규제 벌금과 평판 손상 같은 실제 문제를 초래할 수 있습니다.

음성 에이전트 평가 프레임워크는 벤치마킹과 측정 가능한 데이터를 활용해 에이전트가 특정 사용 사례에 적합한지 판단합니다. 비즈니스 관점에서 여러 음성 모델을 평가할 수 있으면 고객에게 가장 적합한 모델을 선택할 수 있습니다.

평가해야 할 6가지 음성 에이전트 평가 축

AI 에이전트 생성 및 배포는 그 어느 때보다 쉬워졌지만, 내부에서 진행되는 프로세스는 상당히 복잡합니다. 여러 구성 요소가 함께 작동해 사용자의 말을 듣고, 원하는 것을 이해하며, 해당 정보를 LLM에 전달한 다음 오디오 응답을 생성합니다.

최고의 음성 에이전트와 협업하려면 기업에는 비교 기준이 될 엄격한 프레임워크가 필요합니다.

테스트 결과를 더 보고 싶다면 Artificial Analysis에서 다양한 구성 요소를 기준으로 여러 에이전트를 비교할 수 있습니다. 아래는 모델 간 속도 비교 결과로, ElevenLabs Turbo v2.5와 Flash v2.5가 초당 처리 문자 수에서 큰 차이로 앞서고 있습니다.

Bar chart comparing various AI models for characters per second; ElevenLabs Turbo v2.5 scores highest at 504.8.

자체 실험을 진행하려는 개발자나 기업이라면 다음 AI 에이전트 평가 프레임워크의 6가지 축을 활용하세요.

  • TTS 음성 품질: 최종 사용자에게 합성 음성이 얼마나 자연스럽고, 명확하며, 표현력 있게 들리는지를 뜻합니다. Eleven v4 같은 업계 선도 모델은 70개 이상의 언어에서 사람 같은 감정 표현을 제공합니다.
  • 대화 품질: 모델이 사람의 말을 이해하고 의미를 파악하며, 여러 대화 턴에 걸쳐 맥락에 맞게 신속히 응답하나요?
  • 도구 사용: AI 에이전트가 사람의 개입 없이 가용 리소스를 사용해 작업을 완료하는 정도입니다.
  • 지능: 모델이 얼마나 잘 추론하고, 새로운 입력을 처리하며, 부정확하거나 환각적인 응답 생성을 피하는지를 뜻합니다.
  • 규정 준수 및 안전: 모든 기능과 함께 AI 음성 에이전트는 능동형 가드레일을 포함한 모든 규제 및 규정 준수 요건을 충족해야 합니다.
  • 안정성: 총 가동 시간과 부하 상황에서의 일관된 성능 같은 요소로 대화형 AI 에이전트가 수요에 맞춰 확장할 수 있는지 판단합니다.

각 축은 독립적이지만, 서로 연결되어 사용자에게 고품질 최종 경험을 제공합니다. 예를 들어 모델의 음성 품질이 개선되었더라도 지연 시간이 높다면 고객은 음성이 나오기 전 어색한 대기 시간을 겪게 됩니다.

이제 각 음성 AI 평가 축을 자세히 살펴보겠습니다.

TTS 음성 품질

음성 품질부터 시작하겠습니다. 사람이 AI 대화형 에이전트와 상호작용할 때 가장 먼저 알아차릴 가능성이 높은 요소이기 때문입니다. 로봇 같거나 어색하게 들리면 에이전트에 대한 주관적 경험은 크게 나빠집니다.

국제전기통신연합 전기통신표준화부문(ITU-T)이 정의한 초기 평가 지표 중 하나는 평균 의견 점수(Mean Opinion Score, MOS)입니다. MOS는 1~5점 척도로, 1은 사용할 수 없는 수준이고 5는 매우 우수함을 의미합니다. 주관적 측정 방식이므로 사람이 듣고 통화 후 피드백을 수집합니다.


이 척도에서 MOS 3.5 미만은 특히 현대적 기준으로는 인상적이지 않으며, 고객 만족도에 영향을 줄 가능성이 높습니다.

MOS는 사람 중심 지표이지만, 이 수치에는 여러 기술 요건이 반영됩니다.

  • 피치 일관성 및 지터: 피치와 지터는 사람이 들을 때 자연스럽게 인식하는 두 가지 언어적 요소입니다. 피치는 질문할 때 자연스럽게 목소리를 높이는 것처럼 발화 중 억양이 변하는 것을 말합니다. 지터는 음성 모델의 피치 이해가 흔들려 문장 전체에서 일관된 운율을 유지하지 못하는 현상입니다. 업계 지터 기준선은 30ms입니다.
  • 감정 표현력: 명확하고 정확한 음성도 문장의 의도된 감정 톤과 맞지 않으면 부자연스럽게 들립니다. 정확한 음색 단서가 없으면 사람 청취자는 AI 대화형 에이전트와 유대감을 덜 느끼고 더 낮게 평가합니다. ElevenAgents는 사람에 가까운 표현력을 제공해 모든 응답에 분명한 감정적 의도를 담습니다.
  • 배경 소음: 음성 에이전트의 배경 소음에는 평가할 만한 두 가지 차원이 있습니다. 출력 측면에서는 에이전트를 더 자연스럽게 들리게 하기 위해 주변 배경 소음을 응답에 미묘하게 추가합니다. 입력 측면에서는 STT 계층의 배경 소음 필터링이 정확도를 높이는 선택 기능입니다. 에이전트를 평가할 때는 둘 다 테스트하세요. 주변 소음이 자연스러운지 듣고, 소음 필터를 켠 상태와 끈 상태에서 STT 정확도를 평가합니다.

MOS를 계산할 때는 이러한 모든 지각 범주에서 높은 점수를 나타내는 4.3~4.5를 목표로 해야 합니다. 사람 평가단 없이 대규모로 MOS를 예측하려면 UTMOS 및 NISQA 같은 도구를 사용할 수 있습니다.

대화 품질

대화 품질은 음성 품질과 작업 완료 사이에 위치하는 복합적인 축입니다. 음성 에이전트가 사용자의 요구를 얼마나 효과적으로 이해하고, 맥락에 맞게 끼어들며, 여러 대화 턴을 거쳐 완료까지 이어가는지 측정합니다.

여기서 주요 지표는 의도 분류 정확도입니다. 일반적인 범위는 85%~92%이고, 최고 수준의 모델은 96% 이상에 도달합니다. 85%가 높아 보일 수 있지만, 여전히 전체 유입 트래픽의 15%가 잘못 분류되어 잘못된 리소스로 라우팅된다는 의미입니다.

높은 의도 분류 정확도에 기여하는 기술적 요소는 다음과 같습니다.

  • 턴 테이킹: 턴 테이킹은 음성 에이전트가 자연스러운 대화 흐름을 얼마나 잘 관리하는지 결정합니다. 언제 듣고, 응답하고, 추가 입력을 기다려야 하는지를 평가합니다. 또한 모델이 처리 중인 응답을 지우고 새 입력을 기반으로 새 응답을 생성하는 끼어들기 처리까지 포함합니다. ElevenLabs는 멀티 컨텍스트 웹소켓을 사용해 이러한 자연스러운 중단을 매끄럽게 처리합니다.
  • 지연 시간: 지연 시간은 사용자가 문장을 마친 시점부터 에이전트가 오디오 응답을 시작하는 시점까지의 종단 간 지연을 말합니다. 프로덕션급 음성 에이전트는 첫 오디오 생성 시간을 500ms 미만으로 목표로 해야 하며, 300ms 미만이 더 우수합니다. ElevenLabs Flash 모델은 업계 최고 수준인 약 75ms의 모델 추론 시간을 제공해 이 범주에서 성공할 기반을 마련합니다.
  • 폴백 비율: 폴백 비율은 AI 에이전트가 사용자를 이해하지 못해 설명이나 반복을 요청하는 빈도를 측정합니다. 음성 인식 계층이 고객의 말을 잘못 듣거나 잘못 표현하면 LLM이 손상된 입력을 받기 때문에, 이는 주로 STT 정확도의 후속 결과입니다. 폴백 비율은 다음 공식으로 계산합니다. 폴백 비율(%) = (폴백 횟수 / 총 상호작용 횟수) * 100.

ElevenLabs Scribe V2는 Artificial Analysis 음성 텍스트 변환 모델 평가에서 2.2%로 최저 WER을 기록했습니다

ElevenLabs Scribe V2 has the lowest WER at 2.2% on the Artificial Analysis speech to text model evaluation

Artificial Analysis 음성 텍스트 변환 모델 평가

대화 품질을 측정하는 한 가지 방법은 구성 요소별 업계 벤치마킹 표준을 살펴보는 것입니다. 보시다시피 ElevenLabs의 Scribe v2는 2026년 6월 기준 2.2%로 최저 단어 오류율을 기록했습니다. 즉, 잘못 듣는 경우와 폴백이 줄고 의도 분류가 더 정확해집니다.

기업은 대화 품질이 음성 에이전트가 작동하는 워크플로에도 좌우된다는 점을 알 수 있습니다. 예를 들어 고객 서비스에서는 에스컬레이션 이관 품질이나 FAQ 해결도 고려 대상입니다.

도구 사용 및 작업 완료

품질이 대화의 느낌을 측정한다면 작업 완료는 성공적인 결과로 이어졌는지를 측정합니다. 이는 비즈니스 성과와 직접 연결되므로 기업은 음성 에이전트 평가 프레임워크의 이 부분에 세심한 주의를 기울여야 합니다.

도구 사용의 한 지표는 슬롯 채우기 정확도입니다. 이는 AI 에이전트가 고객 정보로 양식을 채우는 것과 같은 비교적 일상적인 작업을 얼마나 잘 완료하는지 판단합니다. 높은 슬롯 채우기 정확도는 에이전트가 정보를 잃지 않고 대화에서 행동으로 매끄럽게 전환할 수 있음을 보여 줍니다.

작업 성공률(Task Success Rate, TSR)은 에이전트가 종단 간 작업을 성공적으로 완료한 비율을 측정합니다. 여기서 완료 여부는 에이전트가 요청을 이해하고 올바른 연결 도구(API, 데이터베이스, 검색 증강 생성(RAG)), 내부 지식 베이스)를 활용할 수 있는지에 따라 결정됩니다.

TSR 공식은 다음과 같습니다.


TSR = (완전히 완료된 작업 / 시도한 총 작업) x 100

프로덕션 준비가 된 음성 에이전트는 TSR 85% 이상을 목표로 하고, 도구 호출 정확도와 도구 호출 안정성을 모니터링해야 합니다. TSR 하락을 피하려면 프롬프트나 연결된 모델을 변경할 때마다 반드시 회귀 테스트를 수행하세요. 작은 차이도 TSR에 큰 영향을 줄 수 있습니다.

지능

지능은 음성 에이전트의 추론과 고차원적 역량을 포착합니다. 이 축은 음성 기반 IVR(Interactive Voice Response)과 음성 AI 에이전트의 차이를 명확히 보여 줍니다.

여기서 평가할 주요 차원은 다음과 같습니다.

  • 환각 위험: 에이전트가 부정확하거나 회사 문서와 일치하지 않는 정보를 생성하는 환각은, 자신감 있게 전달될 수 있어 음성 AI에서 특히 해롭습니다. 최근 연구에 따르면 일반적인 환각은 음성 에이전트에 대한 고객 만족도를 크게 떨어뜨립니다.
  • 범위 밖 요청 처리: 지능형 에이전트는 질문이 자신의 맥락적 범위를 벗어나는 때를 이해하고 적절히 대응합니다. 답을 환각하는 대신 거절하거나, 대화를 맥락적으로 정의된 영역으로 다시 유도합니다.
  • 맥락 유지: 여러 턴에 걸쳐 에이전트가 이전에 언급된 개체와 약속을 추적할 수 있나요? 이 능력이 없으면 고객은 같은 내용을 반복하거나 모순된 응답을 경험할 수 있습니다.
  • 추론 및 다단계 논리: 에이전트가 여러 턴에 걸쳐 조건부 논리를 올바르게 처리하거나 추론을 연결할 수 있나요? 금융 서비스 같은 보다 기술적인 사용 사례에서는 미리 정의된 맥락 안에서 추론하는 능력이 성공에 필수적입니다.

이러한 차원과 구성 요소를 위한 여러 타사 벤치마크가 있습니다. 예를 들어 Stanford의 언어 모델 종합 평가(HELM)는 다양한 범주에서 LLM 성능을 벤치마킹합니다. 환각의 경우 TruthfulQA는 잘못된 답변이 응답에 얼마나 자주 포함되는지 강력하게 분석합니다.

ElevenAgents의 장점은 단일 기반 모델에 묶어 두는 일부 음성 플랫폼과 달리 LLM 계층을 완전히 교체할 수 있다는 점입니다. 즉, 특정 사용 사례의 추론 벤치마크에서 선도하는 모델을 연결할 수 있습니다.

규정 준수 및 안전

기업은 유해하거나 정책을 위반하는 출력을 방지하기 위해 능동형 가드레일을 구현해야 합니다. 우회하거나 재정의될 수 있는 시스템 수준 프롬프트 지침과 달리, 독립적인 가드레일 검사는 모델 자체 외부의 별도 계층에서 실행됩니다. 이 검사는 출력이 사용자에게 도달하기 전에 평가하고 위험한 영역으로 벗어나면 대화를 중단합니다.

감사 가능성도 관련 요건입니다. 프로덕션 에이전트는 사후 검토를 지원하는 형식으로 의사 결정과 출력을 상세히 기록한 로그를 유지해야 합니다. 특히 규제가 엄격한 산업에서는 나중에 규정 준수를 입증하는 일이 처음부터 준수하는 것만큼 중요합니다.

비즈니스가 준수해야 하는 정확한 규정은 산업별로 다릅니다. 가장 흔히 적용되는 프레임워크는 다음과 같습니다.

  • HIPAA: 미국 의료 환경의 보호 대상 건강 데이터에 적용됩니다.
  • PCI-DSS: 결제 카드 데이터를 처리하는 모든 에이전트에 적용됩니다.
  • GDPR: EU 및 EU 고객을 보유한 기업의 데이터 개인정보 보호 의무입니다.

규정 준수 상태를 평가하는 기업을 위해 ElevenLabs는 AICPA SOC Type II 및 GDPR을 준수하며, AIUC-1 인증도 획득했습니다. AIUC-1은 AI 에이전트를 위해 특별히 설계된 보안 표준입니다.

안정성

안정성은 음성 에이전트 평가 프레임워크의 마지막 축으로, 에이전트가 실시간으로 일관된 서비스를 제공할 수 있는지를 다룹니다.

음성 에이전트를 평가할 때는 다음 특성을 확인하세요.

  • 가동 시간: 고객 대상 배포 환경은 장애 방지를 위해 99.9%의 가동 시간을 기대합니다. 특히 인바운드 지원처럼 항상 켜져 있어야 하는 사용 사례에서는 안정적인 가동 시간이 핵심 요소입니다.
  • 우아한 성능 저하: 음성 에이전트는 구조적으로 복잡하므로 한 구성 요소가 실패하기 시작하면 에이전트는 성능 저하를 자연스럽게 처리해야 합니다. 실제로는 부하가 커지거나 오류를 반환한 채 계속 작동하는 대신 사람에게 연결하는 것을 의미합니다.
  • 부하 상태 성능:라이브 전에는 예상 최대 동시성의 최소 2배를 시뮬레이션하는 것을 목표로 부하 테스트를 수행해야 합니다. 높은 부하에서 테스트하면 대규모 환경에서만 나타나는 지연 시간 증가나 성능 저하를 찾아낼 수 있습니다.

다른 모든 조건을 충족하는 고품질 모델도 고객 수요에 맞춰 확장하지 못하면 사용할 수 없을 수 있습니다. ElevenAgents는 1,000,000명의 선도적인 크리에이터와 기업의 신뢰를 받고 있으며, 성능 벤치마크를 저해하지 않고 엔터프라이즈 규모로 배포할 수 있는 플랫폼 역량을 보여 줍니다.

음성 에이전트의 MOS 측정 방법(단계별)

비즈니스에서 MOS를 수동으로 측정하려면 많은 사람 청취자와 실제 대화의 오디오 클립이 필요합니다. 피드백을 수집하고 평균을 내며 데이터를 해석하는 구조화된 과정입니다.

실제로 음성 에이전트의 MOS를 측정하는 방법은 다음과 같습니다.

  1. 테스트 세트 준비: 다양한 대화에서 최소 100개 클립을 포함하도록 에이전트 오디오 출력의 대표 표본을 선택합니다.
  2. 평가 세션 진행: 사람 청취자에게 커뮤니케이션 경험의 품질을 기준으로 각각을 1~5점 척도로 평가하도록 요청합니다.
  3. 평가 취합 및 점수 계산: 각 클립의 평가를 평균 낸 뒤 모든 표본 클립의 평균을 계산해 전체 MOS를 산출합니다. MOS가 4.3 이상이면 음성 에이전트가 프로덕션 준비를 마쳤다는 의미입니다.

수동 작업이 많이 필요하지만 이 과정으로 선택한 음성 에이전트의 신뢰할 만한 MOS를 얻을 수 있습니다. 대규모로 테스트하려면 프로그래밍 방식으로 MOS 점수를 예측하는 NISQA 같은 자동화 도구로 사람 청취자를 대체할 수 있습니다. 이러한 시스템을 활성 파이프라인에 통합해 시간에 따른 MOS를 지속적으로 모니터링할 수도 있습니다.

AI와 사람 테스트 벤치마크: FCR, AHT, CSAT

시간에 따라 MOS를 반복 계산하면 모델의 개선 또는 회귀를 확인할 수 있지만, 사람의 성과를 벤치마킹하면 추가 맥락을 얻을 수 있습니다. 유사한 역할에서 사람이 실제로 달성하는 수준을 보면 음성 에이전트가 이상적인 수준에 가까운 성과를 내는지 알 수 있습니다.

AI와 사람 테스트 벤치마크에서 고려할 몇 가지 지표를 소개합니다.

사람 에이전트 벤치마크
첫 통화 해결률(FCR)
70%
평균 처리 시간(AHT)
약 6분
고객 만족도 점수(CSAT)
70~85%
AI 목표
첫 통화 해결률(FCR)
75%
평균 처리 시간(AHT)
2~4분
고객 만족도 점수(CSAT)
85%

AI 에이전트는 사람 에이전트의 FCR과 CSAT에 맞추면서 AHT는 크게 개선할 수 있어야 합니다. 이는 AI 에이전트가 일반적으로 사람 에이전트보다 더 일반적인 대화를 처리하기 때문입니다. 많은 기업은 AI 에이전트를 1차 응답자로 두고, 자율적으로 처리하기 너무 복잡한 경우에만 사람 에이전트에게 통화를 넘기는 워크플로를 구현합니다.

AI 비교 애그리게이터 Poe의 2025년 데이터에 따르면 ElevenLabs는 요청을 이행하는 전반적인 역량에서 가장 뛰어난 성과를 유지했습니다. 전체 유입 요청의 74.4%를 완료했으며, 이러한 성공은 빠른 사용량 증가로 이어졌습니다. Eleven v3와 v2.5-Turbo는 시간이 지나며 AI 모델로 전송된 메시지의 60% 이상을 차지했습니다.

더 나은 경험을 위해 가장 감정 표현력이 뛰어난 TTS 모델인 Eleven v4를 사용하세요.

시간 경과에 따른 AI 모델 전송 메시지: Poe 음성 에이전트 평가 프레임워크에서 선도하는 ElevenLabs

Messages sent to AI models over time, ElevenLabs leading the poe voice agent evaluation framework

Poe 벤치마크 기준 시간 경과에 따른 AI 모델 전송 메시지

일반적인 음성 에이전트 테스트 실수

음성 에이전트 평가 프레임워크를 따를 때 최상의 시나리오를 테스트하고 싶은 유혹이 있습니다. 하지만 고객이 음성 AI 시스템과 상호작용하는 일상적 경험은 이상적인 조건에서 비롯되지 않습니다.

다음은 일반적인 음성 에이전트 테스트 실수 3가지와 해결 방법입니다.

  • 가장 쉬운 경로만 테스트: 특히 MOS용 오디오 클립을 선택할 때는 반드시 엣지 사용 사례를 포함하세요. 배경 소음이나 억양이 있는 음성이 담긴 클립은 현실에서 매우 흔하므로, '깨끗한' 오디오 파일만 테스트하면 MOS를 잘못 보정하게 됩니다.
  • 해결보다 컨테인먼트 우선: 사용자를 에이전트 시스템 안에 머물게 하도록 모델을 최적화하면 결과를 개선하지 않은 채 컨테인먼트 비율만 부풀립니다. 컨테인먼트 비율은 높지만 FCR이 낮다면, 에이전트가 해결책 없이 사용자를 답답한 순환에 빠뜨리고 있는 것입니다. 원하는 사용자가 사람 에이전트와 대화할 수 있도록 절차를 마련하세요.
  • 지연 시간 백분위수 무시: SLA는 지연 시간을 P95 수준으로 지정하는 경우가 많습니다. 이 지표는 대다수 고객에게 일관된 경험을 제공하는 데 중요하지만, 마지막 5%도 실제 고객이라는 점을 잊지 마세요. 하루 10,000건의 통화를 처리하는 시스템이라면 5%는 여전히 느린 대화를 겪는 500명입니다. 중앙값이나 P95만이 아니라 P99를 핵심 SLA 목표로 삼으세요.

이 점을 염두에 두면 이상적인 평균에 의존하지 않고 공정하고 대표성 있는 기준선을 설정할 수 있습니다.

사용 사례별 평가가 필요한 이유

이 프레임워크의 6가지 축은 탐색해야 할 영역을 안내하지만, 각 축의 비중은 산업에 따라 달라집니다. 예를 들어 금융 서비스 기업은 규정 준수와 도구 사용을 우선시할 수 있는 반면, 소비자 브랜드는 TTS 음성 품질을 핵심 원칙으로 삼을 수 있습니다.

사용 사례별 평가가 실제로 어떻게 작동하고 각 축의 균형을 어떻게 바꿀 수 있는지 두 가지 예를 살펴보겠습니다.

고객 지원

콜센터와 같은 특정 산업에서는 첫 통화 해결률(FCR) 같은 다른 작업 완료 지표도 중요합니다. 사람의 개입 없이 수신 전화를 성공적으로 처리하면 사람 고객 서비스 에이전트에게 가해지는 수요를 크게 줄일 수 있습니다. McKinsey는 추정합니다 음성 에이전트를 사용하는 콜센터는 상호작용량을 최대 50%까지 줄일 수 있습니다.

작업 성공률만큼 중요하지는 않지만, 여기서 고려할 또 다른 차원은 컨테인먼트 비율입니다. 컨테인먼트 비율은 통화의 총 지속 시간을 살펴보는 지표입니다. 컨테인먼트 비율은 매우 높지만 FCR이 낮다면 에이전트가 고객에게 해결책을 제공하지 못한 채 통화를 붙들고 있는 것입니다. 실제로 고객은 제자리걸음을 하는 답답한 경험을 할 수 있습니다.

추적할 다른 지표로는 AI 에이전트가 일상적인 문제를 빠르게 해결하도록 하는 AHT가 있습니다. 따라서 고객 지원 분야에서는 다른 영역보다 대화 품질, 특히 턴 테이킹과 폴백 비율을 우선시합니다.

헬스케어

헬스케어는 엄격한 규정 준수 요건으로 음성 에이전트 운영이 매우 민감한 고도로 규제된 분야입니다. 규정 준수는 핵심 관심사이므로, 프레임워크에서 안전 축의 비중이 이 요소와 지능에 크게 집중됩니다.

헬스케어 챗봇은 예약 일정 관리, 원격 의료 접근 경로, 증상 분류, 보험 문의를 처리해야 합니다. 이 모든 작업에는 높은 수준의 지능과 도구 사용이 필요하며, 산업 또는 역할별 요구가 어떤 축을 가장 중요하게 만드는지 다시 한번 보여 줍니다.

비즈니스가 어떤 분야에 있든 음성 에이전트 평가의 핵심 축을 이해하고 균형 있게 적용하면 가장 적합한 에이전트를 찾는 데 도움이 됩니다.

고성능·저지연을 위한 ElevenAgents 구축

어떤 플랫폼을 기반으로 구축하느냐는 실제 워크플로에서 음성 에이전트의 성능에 직접적인 영향을 줍니다. 특히 고객과 상호작용할 때는 에이전트가 모든 범주에서 뛰어난 성과를 낼 것이라는 확신이 필요합니다.

ElevenAgents는 프로덕션 음성 배포를 위해 구축되었으며, Eleven v4의 업계 선도 TTS, Scribe v2를 통한 실시간 STT, 그리고 에이전트 오케스트레이션 계층을 결합해 엔터프라이즈 규모에 맞게 설계되었습니다. 모든 구성 요소는 이 프레임워크에 제시된 벤치마크를 충족하도록 구축되어 고객에게 고품질 경험을 제공할 수 있습니다.

옵션을 비교 중이든 지금 바로 구축할 준비가 되었든 ElevenLabs는 적합한 경로를 제공합니다. ElevenAgents 플랫폼을 살펴보고 사용 사례와 어떻게 맞는지 확인하거나 가입하고 지금 바로 구축을 시작하세요.

사용 사례를 기준으로 ElevenAgents 평가하기

다른 도움이 필요하신가요? 자세한 내용은 고객센터

음성 에이전트 평가 FAQ

작성자

Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.

유사한 기사

최고 품질의 AI 오디오로 창작하세요