콘텐츠로 건너뛰기

단어 오류율(WER): 핵심 개념, 공식, 활용법

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

이론적으로 단어 오류율(WER)은 자동 음성 인식(ASR) 도구의 정확도를 판단하는 지표입니다. WER가 낮을수록 최종 전사본의 정확도가 높고, 오류율이 높을수록 잘못 전사된 정보가 많다는 뜻입니다. 

실제로 WER은 의료 전사 소프트웨어가 환자에게 처방전의 ‘15밀리그램’이 필요하다고 기록하는지, ‘50밀리그램’이 필요하다고 기록하는지를 가를 수 있습니다. 고객의 요구를 정확히 전사하는 지원 도구와 사용자를 답답하게 만드는 도구의 차이이기도 합니다.

이 글에서는 WER의 정의, 계산 방법, 그리고 자체 ASR 제공업체를 벤치마킹하는 데 활용하는 방법을 알아보겠습니다.

요약

  • 단어 오류율은 대체, 삭제, 삽입의 세 가지 오류 유형을 합산한 뒤 기준 전사본의 단어 수로 나눈 값입니다.
  • WER 공식은 WER = (S + D + I) / N입니다. 
  • WER 점수가 낮을수록 최종 출력의 정확도가 높습니다.
  • WER 5% 미만은 좋은 벤치마크이지만, 법률 또는 의료 전사에는 이보다 더 낮은 단어 오류율이 필요할 수 있습니다.
  • WER은 모든 오류를 동등하게 처리하므로 문맥적 이해를 위한 완벽한 지표는 아닙니다. 의미 단어 오류율(SWER) 같은 새로운 지표는 발화의 의미가 유지되었는지를 측정해 이 문제를 해결하고자 합니다.

단어 오류율이란 무엇인가요?

단어 오류율(WER)은 텍스트 음성 변환 모델에서 음성 인식 정확도를 측정하는 표준 지표입니다. STT 시스템이 전사 과정에서 잘못 인식한 내용을 대체, 삭제, 삽입 오류를 기준으로 나타내는 0~1 사이의 값입니다(0.8은 오류율 80%를 의미합니다).

대체는 단어가 잘못된 다른 단어로 바뀐 경우입니다. 삭제는 단어가 완전히 누락된 경우입니다. 마지막으로 삽입은 실제로 발화되지 않은 단어가 전사본에 추가된 경우입니다. WER은 이 세 요소를 모두 사용한 뒤 올바른 전사본의 단어 수로 나누어, 다른 제공업체와 비교할 수 있는 수치를 제공합니다.

WER 공식을 쓰면 다음과 같습니다:

WER = (S + D + I) / N

각 항목의 의미:

  • S: 대체(단어가 잘못됨)
  • D: 삭제(단어가 누락됨)
  • I: 삽입(추가 단어가 있음)
  • N: 기준 전사본의 총 단어 수

WER은 소수 또는 백분율로 표현할 수 있습니다. 모델이 전사 중 더 적은 오류를 낼수록 WER이 낮아지며, 점수도 더 좋습니다. 

실제로 WER 10%는 회의 전사본의 단어 10개 중 약 1개를 다시 확인해야 한다는 의미입니다. 

음성 인식 시스템에서 단어 오류율이 중요한 이유는 무엇인가요?

단어 오류율은 팀이 서로 다른 제공업체를 비교할 때 사용할 수 있는 객관적인 지표를 제공합니다. 마케팅 주장을 넘어 음성 인식 모델의 정확도를 명확히 보여줍니다. 근거를 우선하면 옵션을 검토하는 모든 기업은 현재 이 분야를 선도하는 모델을 명확하게 파악할 수 있습니다.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

출처: Artificial Analysis(2026년 7월 10일 접속).

2026년 7월 기준, Artificial Analysis의 독립 연구는 비스트리밍 전사 모델의 AA-AgentTalk 데이터세트에서 ElevenLabs Scribe v2가 업계 최저 WER을 기록했다고 평가했으며, WER은 1.5%였습니다.

제공업체 평가를 넘어 WER은 제품 수준에서 실제 영향을 미칩니다. WER 12%의 의료 전사 소프트웨어는 환자 차트에 치명적인 오류를 도입할 수 있습니다. 고객 지원 통화에서의 오전사는 부정확한 감정 분석이나 잘못된 분류 같은 후속 문제로 이어질 수 있습니다.

이러한 사용 사례별 문제를 넘어 ASR 시스템이 실패했을 때 가장 큰 영향을 받는 사람들은 전사본이 음성 콘텐츠에 접근할 수 있는 유일한 수단인 경우가 많습니다. 자세한 내용은 World Wide Web Consortium에서 접근성 이니셔티브가 요구하는 최소 기준에 관한 광범위한 문서를 제공합니다.

단어 오류율 계산 방법: 공식과 예시

단어 오류율 계산은 절차만 알면 간단합니다. 앞서 살펴본 것처럼 사용할 공식은 WER = (S + D + I) / N입니다. 각 항목은 위에서 설명했으며, 빠르게 정리하면 대체, 삭제, 삽입, 그리고 전사본의 총 단어 수를 뜻하는 N입니다.

WER 계산 방법은 다음과 같습니다:

  1. 기준 전사본 만들기: 사람의 전사와 검수를 통해 오디오 클립의 정확한 전사본을 만듭니다. 
  2. STT 도구 사용하기: ASR 플랫폼으로 오디오 클립을 전사하여 테스트에 사용할 AI 전사본을 생성합니다.
  3. 두 버전 정렬하기: 동적 프로그래밍, 특히 레벤슈타인 알고리즘을 사용해 최소 편집 횟수를 찾습니다. 이 알고리즘은 뒤에서 더 자세히 설명하겠습니다.
  4. 공식 적용하기: AI 생성 버전과 사람이 검증한 사본을 비교해 총 오류 수를 세고, WER = (S + D + I) / N으로 정확한 WER을 계산합니다.

문서상으로는 다소 기술적으로 보이지만, 실제로는 훨씬 쉽습니다. 의미를 보여 드리기 위해 연습 예시를 살펴보겠습니다.

기준 전사본: 댈러웨이 부인은 꽃을 직접 사겠다고 말했다.

ASR 출력: 댈러웨이 양은 꽃을 직접 사겠다고 말했다.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
—
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

총 오류를 계산하면 총 9개 단어 중 S 1개와 D 1개가 있습니다. 

공식에 적용하면 WER = 2 / 9 = 0.222 = 22.2%입니다. 

Python으로 단어 오류율 계산하기

수동 방식도 훌륭하지만 Python으로 WER을 계산하면 시간을 절약할 수 있습니다. jiwer 라이브러리가 이 모든 작업을 완전히 자동으로 처리합니다.

jiwer 문서를 활용하면 ASR 시스템 평가와 WER 같은 핵심 지표 산출을 위해 특별히 만들어진 패키지를 설치할 수 있습니다. 다운로드한 후에는 다음 코드로 Python에서 WER을 빠르게 계산할 수 있습니다:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

이 예시에서는 ASR 출력이 원본 기준 텍스트와 두 곳에서 다릅니다. ‘jumps’는 ‘leaps’로 잘못 전사되었고(대체), ‘lazy’ 앞에는 ‘last’가 삽입되었습니다(삽입). 기준 전사본의 9개 단어에서 2개의 오류가 발생했으므로 단어 오류율(WER)은 0.222, 즉 22.2%입니다.

단어 오류율과 기타 인식 지표 비교

WER은 ASR의 정확도를 계산하는 표준 지표이지만, 사용할 수 있는 다른 도구도 있습니다. 예를 들면 다음과 같습니다:

  • 문자 오류율(CER): WER과 마찬가지로 전사 정확도를 단어가 아닌 문자 수준에서 측정합니다. 명확한 단어 경계가 없는 언어(scriptio continua) 또는 철자에 민감한 작업에 적합합니다.
  • 일치 오류율(MER): 대체, 삽입, 삭제를 WER과 약간 다르게 처리하면서 전사 오류의 비율을 측정합니다. 문장에서 잘못된 오류의 비율에 초점을 맞춥니다.
  • 단어 정보 손실(WIL): 전사 과정에서 원본 정보가 얼마나 손실되었는지 추정하며, WER의 직접적인 오류 수 대신 이해 가능성을 측정합니다.
  • 임베딩 오류율(EmbER): 전사본 간의 의미론적 분석을 제공합니다. WER을 넘어 올바른 단어와 잘못 전사된 단어 사이의 의미적 거리를 파악할 수 있습니다.

각 지표는 서로 다른 상황에 가장 적합합니다. 다음 표를 참고하세요:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

레벤슈타인 거리 예시: WER의 수학적 원리

단어 오류율은 본질적으로 원본과 가설 출력 간의 거리를 측정하는 값입니다. 이 차이를 수학적으로 이해하기 위해 레벤슈타인 거리를 사용합니다.

레벤슈타인 거리는 한 시퀀스를 다른 시퀀스로 변환하는 데 필요한 최소 단위 편집 횟수를 계산합니다. WER에서 이는 구체적으로 대체, 삽입, 삭제 편집을 의미합니다. 예를 들어 Cat을 Mat으로 바꾸려면 문자 ‘C’를 ‘M’으로 바꿔야 하므로 레벤슈타인 거리는 1입니다.

CER 계산에서는 이 개념을 훨씬 자주 볼 수 있지만, WER은 레벤슈타인 거리를 단어 수준으로 확장합니다. 각 단위는 문자가 아닌 전체 단어이며, 실제 거리는 ASR 출력을 정확한 원본으로 바꾸는 데 필요한 단어 편집 횟수를 측정합니다. 

각 셀이 원본 전사본과 ASR 전사본 간의 총거리를 나타내는 행렬을 만듭니다. سپس 레벤슈타인 거리가 행렬을 왼쪽 위에서 오른쪽 아래로 채우며, 마지막 셀이 단어 수준 편집의 총횟수를 제공합니다. 이 수를 N으로 나눈 값이 WER입니다. 

이 행렬은 일반적으로 개별 문자로 계산하지만, 이해를 돕기 위해 앞선 예시를 확장한 버전을 소개합니다. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

단어 오류율에 관한 일반적인 함정과 오해

특히 STT API에 대한 접근성이 높아지고 ASR 소프트웨어가 더 ფართ은 에이전트 스택의 일반적인 구성 요소가 되면서, 서로 다른 도구 간 비교도 많이 보게 될 것입니다. 

자체 단어 오류율을 계산하기 전에 알아두어야 할 몇 가지 일반적인 문제와 오해가 있습니다.

  • 모든 오류는 동일하다: WER은 모든 오류를 똑같이 중요하게 취급합니다. 많은 상황에서는 문제가 없을 수 있지만, 일부 사용 사례에서는 허용될 수 없습니다. 예를 들어 병원에서는 좋은 WER로 여겨지는 5% 오류율도 이해하기 어려울 수 있으며, 한두 개의 오류만으로도 환자가 위험에 처할 수 있습니다. 이러한 한계로 인해 모든 단어가 정확히 일치했는지가 아니라 문장의 의미가 유지되었는지를 측정하려는 의미 단어 오류율(SWER) 같은 새로운 지표가 개발되었습니다. 
  • WER은 100%를 넘을 수 있다: 앞서 WER이 0과 1 사이의 값이라고 설명했지만, 100%가 넘는 WER도 발생할 수 있습니다. 삽입 오류로 인해 원본 전사본의 총 단어 수보다 더 많은 단어가 생길 수 있기 때문입니다. 대표적인 예로 ‘I’m’을 ‘I am’으로 전사하는 경우가 있으며, 단어 하나가 두 개가 됩니다. 
  • 낮은 WER이 기술적으로 항상 더 좋은 것은 아니다:문서상으로 WER 5%는 WER 10%보다 좋습니다. 하지만 5%를 구성하는 오류가 문장의 문맥을 크게 바꾸고 10%의 오류는 그렇지 않다면, 전체 상황을 제대로 보여주지 못합니다. 문맥은 여전히 매우 중요하며, 이러한 의미적 영향을 포착하기 위해 SWER 같은 지표가 개발되고 있습니다.

2024년 Apple은 위의 마지막 항목을 탐구한 흥미로운 연구를 발표했습니다. 사람이 ASR을 읽을 수 있는지 여부를 기준으로 WER 9.4%를 평가했을 때, 같은 구절에 WER 2.2%만을 부여했습니다. 테스트한 예시에서 사람들은 많은 경우 ‘오류’를 중요하지 않게 보았으며, 기계보다 4배 이상 관대한 Human WER이 나왔습니다.

WER의 업계 벤치마크

이상적인 WER은 ASR 기술을 사용하는 산업이나 사용 사례에 크게 좌우됩니다. WER 5% 미만은 업계 벤치마크이지만, 의료 또는 법률 전사와 같은 특정 산업에는 훨씬 낮은 비율이 필요합니다. 

Artificial Analysis의 2026년 7월 연구에서 ElevenLabs Scribe v2는 WER 1.5%를 기록했습니다. 하지만 이러한 통계는 일반적으로 영어를 주 언어로 하여 수행된다는 점을 기억해야 합니다. 다른 언어의 STT 기술은 효과가 떨어질 수 있습니다. 

ElevenLabs Docs에서는 일반적인 WER 구간을 Scribe v1과 Scribe v2가 지원하는 모든 언어별로 설명합니다.

ElevenAPI로 인식 정확도 향상 시작하기

전사 품질이 중요한 애플리케이션이나 제품을 구축할 때, 신중하게 선택한 ASR API와 평범한 API의 차이는 먼저 WER에서, 이어서 사용자 경험에서 드러납니다. 

ElevenLabs Scribe는 텍스트 음성 변환 레이어로, ElevenAPI를 통해 사용할 수 있습니다. 90개 이상의 언어와 업계 최고 수준의 WER을 제공하며, 화자 분리, 단어 수준 타임스탬프, 핵심 용어 프롬프팅, 엔터티 감지 등의 기능을 갖추고 있습니다.

ElevenLabs Docs에서 ElevenAPI에 대해 자세히 알아보거나, 지금 가입하여 시작하세요. 

단어 오류율 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요