단어 오류율(WER): 핵심 개념, 공식, 활용법
- 게시일
- 최종 업데이트
이론적으로 단어 오류율(WER)은 자동 음성 인식(ASR) 도구의 정확도를 판단하는 지표입니다. WER이 낮을수록 최종 전사문이 더 정확하며, 오류율이 높을수록 잘못 전사된 정보가 많다는 뜻입니다.
실제로 WER은 의료 전사 소프트웨어가 환자에게 처방약 ‘15밀리그램’이 필요하다고 기록하는지, ‘50밀리그램’이 필요하다고 기록하는지를 가를 수 있습니다. 고객의 요구 사항을 정확하게 전사하는 지원 도구와 사용자를 답답하게 만드는 도구의 차이이기도 합니다.
이 글에서는 WER의 정의, 계산 방법, 그리고 자체 ASR 제공업체의 성능을 벤치마킹하는 활용법을 살펴보겠습니다.
요약
- 단어 오류율은 대체, 삭제, 삽입의 세 가지 오류 유형을 합산한 뒤 기준 전사문의 단어 수로 나눠 계산합니다.
- WER 공식은 WER = (S + D + I) / N입니다.
- WER 점수가 낮을수록 최종 출력의 정확도가 높습니다.
- WER 5% 미만은 좋은 벤치마크이지만, 법률 또는 의료 전사에는 이보다 더 낮은 단어 오류율이 필요할 수 있습니다.
- WER은 모든 오류를 동일하게 취급하므로, 문맥을 고려한 완벽한 지표는 아닙니다. 의미 단어 오류율(SWER) 같은 새로운 지표는 발화의 의미가 보존되었는지를 측정해 이 문제를 해결하려고 합니다.
단어 오류율이란 무엇인가요?
단어 오류율(WER)은 음성-텍스트 변환 모델에서 음성 인식 정확도를 측정하는 표준 지표입니다. STT 시스템이 전사 과정에서 틀린 내용을 0~1 사이의 값으로 나타내며(0.8은 오류율 80%를 의미), 대체·삭제·삽입 오류를 기준으로 산출합니다.
대체는 단어가 잘못된 다른 단어로 바뀌는 경우입니다. 삭제는 단어가 완전히 누락된 경우입니다. 마지막으로 삽입은 실제로 발화되지 않은 단어가 전사문에 추가된 경우입니다. WER은 이 세 가지 요소를 모두 사용한 뒤 올바른 전사문의 단어 수로 나누므로, 다른 제공업체와 비교할 수 있는 수치를 제공합니다.
WER 공식은 다음과 같습니다:
WER = (S + D + I) / N
각 항목의 의미:
- S: 대체(단어가 틀림)
- D: 삭제(단어가 누락됨)
- I: 삽입(추가 단어가 있음)
- N: 기준 전사문의 총 단어 수
WER은 소수 또는 백분율로 표현할 수 있습니다. 모델이 전사할 때 오류를 적게 낼수록 WER이 낮아지며, 점수도 더 좋습니다.
실제로 WER 10%는 회의 전사문의 단어 10개 중 약 1개를 다시 확인해야 한다는 의미입니다.
음성 인식 시스템에서 단어 오류율이 중요한 이유는 무엇인가요?
단어 오류율은 팀이 서로 다른 제공업체를 비교하는 데 사용할 수 있는 객관적인 지표입니다. 마케팅 주장을 넘어 음성 인식 모델의 정확도를 명확하게 보여 줍니다. 근거를 우선하면 옵션을 평가하는 모든 기업은 현재 이 분야를 선도하는 모델이 무엇인지 분명히 파악할 수 있습니다.

출처: Artificial Analysis , 2026년 7월 10일 접속.
2026년 7월 기준, Artificial Analysis의 독립 연구에 따르면 ElevenLabs의 Scribe v2는 비스트리밍 전사 모델의 AA-AgentTalk 데이터세트에서 WER 1.5%를 기록하며 업계 최저 WER을 달성했습니다.
WER은 제공업체 평가를 넘어 제품 수준에서도 실제 영향을 미칩니다. WER 12%의 의료 전사 소프트웨어는 환자 기록에 치명적인 오류를 만들 수 있습니다. 고객 지원 통화의 오전사는 부정확한 감정 분석이나 잘못된 분류 같은 후속 장애로 이어질 수 있습니다.
이러한 사용 사례별 문제를 넘어 ASR 시스템이 실패할 때 가장 큰 영향을 받는 사람들은 전사문이 음성 콘텐츠에 접근할 수 있는 유일한 수단인 경우가 많습니다. World Wide Web Consortium은 접근성 이니셔티브에서 요구하는 최소 기준에 관한 폭넓은 문서를 제공하므로, 자세한 맥락을 확인할 수 있습니다.
단어 오류율 계산 방법: 공식과 예시
단어 오류율 계산은 단계를 알면 간단합니다. 앞서 살펴본 것처럼 사용할 공식은 WER = (S + D + I) / N입니다. 각 항목은 위에서 설명했지만, 빠르게 정리하면 대체, 삭제, 삽입, 그리고 전사문의 총 단어 수를 뜻하는 N입니다.
WER 계산 방법은 다음과 같습니다:
- 기준 전사문 만들기: 사람의 전사와 검수를 통해 오디오 클립의 정확한 전사문을 만듭니다.
- STT 도구 사용하기: ASR 플랫폼으로 오디오 클립을 전사해, 테스트에 사용할 AI 전사문을 생성합니다.
- 두 버전 정렬하기: 동적 프로그래밍, 특히 레벤슈타인 알고리즘을 사용해 최소 편집 횟수를 찾습니다. 이 알고리즘은 뒤에서 자세히 설명하겠습니다.
- 공식 적용하기: AI 생성 버전과 사람이 검증한 사본을 비교해 총 오류 수를 세고, WER = (S + D + I) / N을 사용해 정확한 WER을 계산합니다.
문서상으로는 다소 기술적으로 보이지만, 실제로는 훨씬 쉽습니다. 의미를 보여 주는 연습 예시를 살펴보겠습니다.
기준 전사문: 댈러웨이 부인은 꽃을 직접 사겠다고 말했다.
ASR 출력: 댈러웨이 양은 꽃을 사겠다고 말했다.
총 오류를 계산하면, 총 9개 단어 중 S 1개와 D 1개가 있습니다.
공식을 적용하면 WER = 2 / 9 = 0.222 = 22.2%입니다.
Python으로 단어 오류율 계산하기
수동 방식도 효과적이지만, Python으로 WER을 계산하면 시간을 절약할 수 있습니다. jiwer 라이브러리가 이 모든 작업을 완전히 자동으로 처리합니다.
jiwer 문서를 참고하면 ASR 시스템을 평가하고 WER 같은 핵심 지표를 생성하도록 설계된 패키지를 설치할 수 있습니다. 다운로드한 후에는 다음 코드를 사용해 Python에서 WER을 빠르게 계산할 수 있습니다:
이 예시에서 ASR 출력은 원본 기준 전사문과 두 곳에서 다릅니다. ‘jumps’라는 단어는 ‘leaps’로 잘못 전사되었고(대체), ‘lazy’ 앞에 ‘last’가 삽입되었습니다(삽입). 기준 전사문의 9개 단어에서 2개의 오류가 발생했으므로, 단어 오류율(WER)은 0.222 또는 22.2%입니다.
단어 오류율과 기타 인식 지표 비교
WER은 ASR 정확도를 계산하는 표준 지표이지만, 사용할 수 있는 다른 도구도 있습니다. 예를 들면 다음과 같습니다:
- 문자 오류율(CER): WER과 마찬가지로 전사 정확도를 측정하지만, 단어 수준이 아니라 문자 수준에서 측정합니다. 명확한 단어 경계가 없는 언어(scriptio continua)나 철자에 민감한 작업에 적합합니다.
- 일치 오류율(MER): 대체, 삽입, 삭제를 WER과 약간 다르게 처리하여 전사 오류의 비율을 측정합니다. 문장에서 잘못된 오류의 비율에 초점을 맞춥니다.
- 단어 정보 손실(WIL): 전사 중 원본 정보가 얼마나 손실되었는지 추정하며, WER의 직접적인 오류 수 대신 이해 가능성을 측정합니다.
- 임베딩 오류율(EmbER): 전사문 간의 의미론적 분석을 제공합니다. WER을 넘어 올바른 단어와 잘못 전사된 단어 사이의 의미적 거리에 대한 인사이트를 제공합니다.
각 지표는 서로 다른 시나리오에 가장 적합합니다. 다음 표를 참고하세요:
레벤슈타인 거리 예시: WER의 수학적 원리
단어 오류율은 본질적으로 원본과 가설 출력 간의 거리를 측정합니다. 이 차이를 수학적으로 이해하기 위해 레벤슈타인 거리를 사용합니다.
레벤슈타인 거리는 한 시퀀스를 다른 시퀀스로 변환하는 데 필요한 최소 단위 편집 횟수를 계산합니다. WER에서 이는 구체적으로 대체, 삽입, 삭제 편집을 의미합니다. 예를 들어 Cat을 Mat으로 바꾸려면 문자 ‘C’를 ‘M’으로 한 번 바꿔야 하므로 레벤슈타인 거리는 1입니다.
이 개념은 CER 계산에서 더 자주 볼 수 있지만, WER은 레벤슈타인 거리를 단어 수준으로 확장합니다. 각 단위는 문자가 아닌 완전한 단어이며, 실제 거리는 ASR 출력을 정확한 원본으로 변환하는 데 필요한 단어 편집 횟수를 측정합니다.
각 셀이 원본 전사문과 ASR 전사문 간의 총거리를 나타내는 행렬을 만듭니다. এরপর 레벤슈타인 거리가 행렬을 왼쪽 위에서 오른쪽 아래까지 채우며, 마지막 셀은 단어 수준 편집의 총횟수를 보여 줍니다. 이 수를 N으로 나눈 값이 WER입니다.
이 행렬은 일반적으로 개별 문자로 계산되지만, 이해를 돕기 위해 앞의 예시를 확장한 버전을 소개합니다.

단어 오류율에 관한 일반적인 함정과 오해
특히 STT API의 접근성이 높아지고 ASR 소프트웨어가 더 넓은 에이전트 스택의 일반적인 구성 요소가 되면서, 다양한 도구 간 비교도 많이 이루어질 것입니다.
자체 단어 오류율을 계산하기 전에 알아 두어야 할 몇 가지 일반적인 문제와 오해가 있습니다.
- 모든 오류는 동일하다: WER은 모든 오류를 똑같이 중요하게 취급합니다. 많은 맥락에서는 괜찮을 수 있지만, 일부 사용 사례에서는 허용되지 않습니다. 예를 들어 병원에서는 좋은 WER로 간주되는 5% 오류도 이해하기 어려울 수 있으며, 단 한두 개의 오류만으로도 환자가 위험에 처할 수 있습니다. 이러한 한계로 인해 모든 단어가 정확히 일치하는지가 아니라 문장의 의미가 보존되었는지를 측정하려는 의미 단어 오류율(SWER) 같은 새로운 지표가 개발되었습니다.
- WER은 100%를 넘을 수 있다: 앞서 WER은 0과 1 사이의 값이라고 설명했지만, 100%를 넘는 WER도 나올 수 있습니다. 삽입 오류로 인해 원본 전사문의 총 단어 수보다 더 많은 단어가 생길 수 있기 때문입니다. 대표적인 예는 ‘I’m’을 ‘I am’으로 전사하는 경우로, 하나가 둘이 됩니다.
- 낮은 WER이 기술적으로 항상 더 좋은 것은 아니다: 문서상으로 WER 5%는 WER 10%보다 낫습니다. 하지만 5%를 만든 오류가 문장의 문맥을 크게 바꿨고 10%의 오류는 그렇지 않았다면, 전체 이야기가 반영되지 않습니다. 문맥은 여전히 매우 중요하며, SWER 같은 지표는 이러한 의미론적 영향을 포착하기 위해 개발되고 있습니다.
2024년 Apple은 위의 마지막 사항을 탐구한 흥미로운 연구를 발표했습니다. 사람이 ASR 전사문의 가독성을 기준으로 9.4%의 WER 계산 결과를 평가했을 때, 같은 문단에 2.2%에 불과한 WER을 부여했습니다. 테스트한 예시에서 사람들은 많은 경우 ‘오류’를 중요하지 않은 것으로 보았으며, 그 결과 사람 기준 WER은 기계보다 4배 이상 더 관대했습니다.
WER의 산업 벤치마크
이상적인 WER은 ASR 기술을 사용하는 산업이나 사용 사례에 크게 좌우됩니다. WER 5% 미만은 업계 벤치마크이지만, 의료 또는 법률 전사처럼 특정 산업에서는 훨씬 더 낮은 비율이 필요합니다.
Artificial Analysis의 2026년 7월 연구에서 ElevenLabs의 Scribe v2는 WER 1.5%를 기록했습니다. 다만 이러한 통계는 일반적으로 영어를 주 언어로 수행한 연구라는 점을 기억해야 합니다. 다른 언어에서 STT 기술은 효과가 떨어질 수 있습니다.
ElevenLabs Docs에서는 일반적인 WER 구간을 Scribe v1과 Scribe v2가 지원하는 모든 언어별로 설명합니다.
인식 정확도를 높이는 ElevenAPI 시작하기
전사 품질이 중요한 애플리케이션이나 제품을 구축할 때, 잘 선택한 ASR API와 평범한 API의 차이는 먼저 WER에서, 그다음에는 사용자 경험에서 드러납니다.
ElevenLabs Scribe는 음성-텍스트 변환 레이어로, ElevenAPI를 통해 이용할 수 있습니다. 90개 이상의 언어와 업계 최고 수준의 WER에 더해, 화자 분리, 단어 수준 타임스탬프, 핵심 용어 프롬프팅, 개체 감지 등의 기능을 제공합니다.
ElevenLabs Docs에서 ElevenAPI에 대해 자세히 알아보거나 가입하고 지금 시작하세요.




