자동 음성 인식(ASR)이란?
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
1952년, 세계에서 가장 발전한 음성 인식 시스템도 정확히 9개의 단어만 이해할 수 있었습니다.
약 75년이 지난 오늘날 자동 음성 인식(ASR)은 수십 개 언어를 실시간으로 전사하며, 휴대폰의 음성 비서부터 라이브 영상에 표시되는 자막까지 다양한 기능을 지원합니다.
이 가이드에서는 1952년의 기술과 현대 기술 사이의 격차를 메운 기술을 살펴봅니다. ASR의 개념, 음성을 텍스트로 변환하는 방식, 그리고 오늘날에도 계속 발전하는 ASR의 모습을 다룹니다.
요약:
- ASR은 자동 음성 인식(automatic speech recognition)의 약자로, 음성 오디오를 텍스트로 변환하는 기술입니다.
- ASR의 초기 형태는 1952년에 등장했으며, 딥러닝 시스템은 2010년대 후반에 인간 기준 성능에 도달했습니다.
- 현대 ASR은 수백만 시간의 오디오로 학습한 엔드투엔드 신경망을 사용합니다.
- 단어 오류율(WER)은 표준 정확도 지표이지만, 프로덕션 ASR에서는 지연 시간, 화자 분리 품질, 문맥 이해도도 중요합니다.
- ElevenAPI는 개발자에게 프로덕션급 ASR을 제공하며, Artificial Analysis의 독립 벤치마크에서 2.2%의 단어 오류율을 기록했습니다. 이는 해당 지수에서 가장 낮은 수치입니다(2026년 7월).
자동 음성 인식(ASR)이란?
자동 음성 인식은 흔히 약어인 ASR로 불리며, 사람의 음성을 듣고 정확한 기계 판독 가능 텍스트로 변환하는 소프트웨어를 말합니다. 일반적으로 음성 텍스트 변환이나 음성 인식, 또는 컴퓨터 음성 인식이라고도 합니다.
ASR은 너무 보편화되어 매일 사용하면서도 인식하지 못할 수 있습니다. 메시지를 받아쓰거나, 음성 비서에게 질문하거나, 라이브 영상의 자막을 읽거나, 대화형 음성 응답 전화 시스템을 이용할 때마다 ASR을 사용하고 있습니다.
음성 텍스트 변환과 ASR은 흔히 동의어로 쓰이며 밀접하게 관련되어 있지만, 정확히 같은 개념은 아닙니다. ASR은 말한 내용을 식별하는 기술이고, STT는 이 기술을 도구로 적용한 것입니다. 음성 인식 소프트웨어는 ASR 위에서 작동하며 특정 단어를 누가 말했는지 식별합니다. 이는 화자 분리 기능의 기반이 됩니다.
작은 차이지만, 앱이나 웹사이트에 ASR/STT/음성 인식 시스템을 통합하려면 이해할 가치가 있습니다.
자동 음성 인식 기술의 간략한 역사
자동 음성 인식 기술은 많은 사람이 생각하는 것보다 훨씬 오래되었으며, 초기 버전은 1950년대로 거슬러 올라갑니다. 등장 이후 70여 년 동안 ASR은 역사적 발전의 토대가 된 여러 중요한 단계를 거쳤습니다.
ASR 기술이 거쳐 온 주요 시대는 다음과 같습니다:
- 1952년과 최초의 ASR: 1952년 벨 연구소는 1부터 9까지의 숫자를 이해하기 위해 AUDREY로 알려진 Automatic Digit Recognizer를 개발했습니다. 이 도구의 정확도는 약 90%에 불과했고 발명가가 사용할 때만 작동해 한계가 컸습니다. 오늘날의 기능과는 큰 차이가 있지만, 1~9를 인식하는 것만으로도 인상적인 성과였습니다.
- 1960~70년대와 확장된 ASR 어휘: 이후 수십 년 동안 IBM, 유니버시티 칼리지 런던, 일본 NEC를 비롯한 전 세계 연구소는 다양한 맥락에서 AUDREY와 유사한 모델을 개발했습니다. 스탠퍼드대학교의 인도 출신 대학원생 라지 레디는 박사 과정 프로젝트로 모음 인식기를 만들며, 단어 사이에 멈추지 않아도 되는 연속 음성 인식의 토대를 마련했습니다. DARPA(미국 국방고등연구계획국)는 이 시기 Beam Search로 이어진 연구를 지원했으며, 이 문장 구성 및 디코딩 방식은 1976년까지 1,000개 이상의 단어를 인식하는 데 핵심적이었습니다.
- 1980년대~2010년대 초반의 통계적 발전: 1987년 라지 레디의 제자였던 한 대학 교수는 은닉 마르코프 모델과 Beam Search를 결합해, 특정 화자 한 명에 대한 학습이 필요 없는 ASR을 구현했습니다. 이 혁신은 음성 인식 시스템의 학습 시간을 크게 줄였습니다. Dragon Systems는 1997년 NaturallySpeaking Preferred라는 최초의 상용 ASR을 출시했습니다. 분당 100단어를 인식할 수 있었고 성공적으로 판매되었습니다.
- 현대 시대와 딥러닝: 2010년대에 연구자들은 오디오와 전사본으로 엔드투엔드 학습한 단일 신경망이 순수 통계 기반 파이프라인보다 뛰어남을 입증했습니다. 심층 신경망의 등장으로 ASR은 오류율 5~10% 수준의 인간에 가까운 성능에 도달했습니다. 이 시기에 Alexa와 Siri 같은 음성 기반 비서가 시장에 등장했습니다.
이후 ASR은 더욱 정확해지고 널리 사용되고 있습니다. 2026년 7월 기준 Artificial Analysis의 독립 연구는 ElevenLabs Scribe v2가 업계 최고 수준인 2.2%의 단어 오류율(WER)을 기록했다고 밝혔습니다.

ASR은 어떻게 작동하나요? 음성 텍스트 변환 기술의 기초
ASR은 오디오 샘플을 수집해 수치 표현으로 변환한 뒤, 학습된 모델로 해당 수치가 나타내는 가장 가능성 높은 단어 시퀀스를 예측합니다. 현대 ASR은 이 과정을 실시간으로 압축해 전체 엔드투엔드 과정을 1초 이내에 완료합니다.

ASR 파이프라인은 5가지 주요 단계로 구성됩니다:
- 오디오 캡처 및 전처리: 시스템은 오디오 신호를 녹음하고 배경 소음을 제거하며 에코를 줄이고 볼륨을 정규화해 일관성을 높입니다. 모델에 따라 전사가 시작되기 전에 음성 활동 감지(VAD)를 사용해 음성과 무음 또는 배경음을 구분할 수 있습니다.
- 특징 추출: 오디오는 일반적으로 스펙트로그램 또는 멜 주파수 특징인 수치 표현으로 변환됩니다. 이는 사람 음성에 포함된 주파수와 패턴을 정밀하게 나타냅니다. 이 단계는 원시 파형을 머신러닝 모델이 효과적으로 처리할 수 있는 데이터로 바꿉니다.
- 음향 모델링: 신경망은 이전 단계의 특징을 분석해 음소 또는 다른 음성 단위를 예측하고, 음향 패턴과 구어 사이의 관계를 학습합니다. 현대 엔드투엔드 모델은 이 단계를 완전히 분리된 단계로 처리하기보다 언어 이해와 함께 수행하는 경우가 많습니다.
- 언어 모델링 및 디코딩: 시스템은 문법, 문맥, 수학적 확률 같은 규칙을 바탕으로 가장 가능성 높은 단어 시퀀스에 가중치를 둡니다. 두 문장의 IPA(국제음성기호) 전사는 비슷할 수 있지만 문맥은 완전히 다를 수 있으므로, 특히 문맥과 확률이 중요합니다. 예를 들어 “Recognize Speech”와 “Wreck a nice peach”는 같은 소리로 들릴 수 있지만 의미는 완전히 다릅니다. 정확도만으로 확신할 수 없을 때 문맥이 올바른 표현을 결정하는 데 도움이 됩니다.
- 출력 형식화: 음성 내용을 판단한 뒤 구두점과 대소문자를 적용해 최종 텍스트를 전사합니다. 단어 수준 타임스탬프 및 화자 레이블 같은 추가 메타데이터는 더 상세한 전사본을 만듭니다.
이 주요 단계들을 거쳐 모델은 입력 오디오 데이터를 텍스트 전사본으로 변환합니다.
전통적 하이브리드 시스템과 엔드투엔드 딥러닝 ASR
위 파이프라인은 ASR의 작동 방식을 설명하지만, 그 중간 과정에는 실제로 두 가지 기술적 접근 방식이 있습니다.
기존 시스템은 단어 발음을 인코딩하는 어휘 모델, 오디오를 음소에 매핑하는 음향 모델, 가능성 높은 단어 시퀀스를 예측하는 언어 모델 등 여러 구성 요소를 연결합니다. 발음 사전을 직접 만드는 언어학자부터 모든 단어를 오디오의 정확한 위치에 정렬하는 주석 작업자까지, 각 구성 요소를 구축하려면 사람의 전문성이 필요합니다.
엔드투엔드 딥러닝은 이 모든 구성 요소를 하나의 신경망으로 통합합니다. 이 네트워크는 수백만 시간 분량의 오디오와 전사본 쌍에서 발음, 음향, 언어 확률 통계를 암묵적으로 이해하며 오디오를 텍스트에 직접 매핑합니다.
ASR 기술의 전통적 접근 방식과 현대적 접근 방식의 차이를 살펴보겠습니다.
ASR 정확도 측정 방법: 단어 오류율(WER) 벤치마크
모든 음성 텍스트 변환 및 ASR workflow에서 단어 오류율(WER)은 기업이 사용하는 주요 정확도 지표입니다. ASR로 생성한 기계 전사본을 사람이 검증한 버전과 비교합니다. 여기에는 대체, 삭제, 삽입이라는 세 가지 주요 오류가 포함됩니다.
WER 공식은 전체 오류 수를 기준 전사본의 단어 수로 나눕니다. WER이 5%라면 텍스트의 95%를 정확히 전사했다는 의미이며, 현재 주요 모델은 완벽에 가까워지기 위해 5%보다 훨씬 낮은 수준을 목표로 합니다.
WER은 유용한 벤치마크이지만, ASR 도구의 효과를 판단할 때는 다른 요소도 고려해야 합니다:
- 형식 정확도: 시스템이 비표준 문자열을 올바르게 형식화할 수 있나요? 예를 들어 $1,225라는 금액을 그대로 표시하나요, 아니면 “천이백이십오 달러”처럼 풀어서 쓰나요?
- 지연 시간: 정확도는 중요하지만 간단한 전사본을 만드는 데 몇 분이 걸린다면 도구를 사용할 수 없습니다. 아무리 정확해도 유용성을 높이려면 낮은 지연 시간과 균형을 맞춰야 합니다.
- 견고성: 심한 억양이나 시끄러운 배경 같은 사용 사례에서도 모델 정확도가 크게 떨어지지 않아야 합니다.
- 화자 분리 품질: 다화자 사용 사례에서는 모든 단어를 올바른 화자에게 정확히 귀속하는 것이 중요합니다. 서로 다른 화자를 식별하고 올바르게 태그하는 기능은 특히 법정처럼 다화자 비중이 높은 산업에서 ASR에 기여합니다.
자세한 내용은 단어 오류율에 관한 종합 가이드를 확인하세요.

현대 기업을 위한 ASR의 주요 이점
전 세계 음성 및 음성 인식 시장은 2030년까지 231억 1,000만 달러를 넘어설 것으로 예상됩니다. 시장의 연평균 성장률 19.1%는 이 기술이 상용 기기에 얼마나 널리 확산되었는지 보여 줍니다. 모든 현대 스마트폰에는 받아쓰기 키보드와 음성 비서가 탑재되어 있고, 대부분의 신차는 음성 명령에 반응하며, 스마트 스피커와 비서는 전 세계 가정에 자리 잡고 있습니다.
음성으로 기술과 상호작용하는 것은 이제 고객이 폭넓게 이용할 수 있는 기본 방식입니다. 기업에서 ASR은 고객 통화 전사부터 음성 에이전트 지원까지 제공하며, 프로세스에 통합되어 생산성을 높입니다.
현대 기업을 위한 ASR의 주요 이점은 다음과 같습니다:
- 더 빠른 입력 및 문서화: 10여 년 전에도 스탠퍼드는 논문을 발표해 음성 인식 기술이 더 낮은 오류율을 유지하면서 키보드 입력보다 거의 3배 빠르다는 점을 입증했습니다. 대부분의 사람에게 ASR은 전사 workflow와 음성 우선 메모 작성에서 더 빠른 문서화를 가능하게 합니다.
- 운영 비용 절감: 과거 수 시간의 수동 메모 작성에 의존하던 많은 사용 사례에서 ASR 기술은 고품질 전사 비용을 획기적으로 낮춥니다. 법원 사건, 컨택 센터, 의료 클리닉, 비즈니스 회의는 이제 상세한 메모와 대화의 완전한 화자 분리 전사본을 만드는 정확한 ASR 시스템을 사용할 수 있습니다.
- 향상된 접근성: 세계보건기구는 25억 명이 2050년까지 어떤 형태로든 청력 손실을 겪을 것으로 예측합니다. 고급 ASR 도구가 제공하는 실시간 자막은 디지털 회의와 미디어를 사용자가 이용할 수 있도록 만듭니다.
- 검색 가능한 음성 데이터: ASR로 음성을 자동 전사하면 모든 고객-기업 상호작용이 완전히 기록됩니다. 모든 영업 통화, 지원 티켓, 잠재 고객 통화, 회의는 검색과 감사가 가능한 텍스트가 됩니다. 특히 AI 시대에는 기계 판독 가능한 형식에서 문맥을 도출할 수 있으면 방대한 지식 기반을 구축하는 데 도움이 됩니다. 기능이나 규정 준수 측면에서 정보의 가시성을 유지할 수 있습니다.
- 상시 운영 고객 경험: ASR은 음성 에이전트를 위한 핵심 기술 중 하나로, 고객 통화를 해결하는 자동화 지원 사용 사례를 24시간 365일 지원합니다.
자동 음성 인식은 통합했을 때의 이점이 많고 지원하는 사용 사례가 광범위하기 때문에 기술 분야에서 매우 널리 쓰입니다. 의료 분야에 있든 감정 분석을 위해 고객 통화를 전사하려 하든, ASR은 도입하고 활용하게 될 기반 기술입니다.
산업 전반의 인기 ASR 활용 사례
자동 음성 인식은 수많은 workflow와 제품의 핵심 기술입니다. 사용자가 자신이 쓰는 기술에 이 기능이 어떻게 내장되어 있는지 생각하지 않을 만큼 보편화되었습니다.
전 세계에서 널리 쓰이는 ASR 활용 사례를 간단히 살펴보겠습니다.
고객 서비스 및 컨택 센터
컨택 센터는 품질 보증과 규정 준수를 위해 통화를 전사하는 데 ASR을 활용한 초기 도입자였습니다. 오늘날 ASR은 실시간으로 실행되어 대화 중 상담원에게 제안을 제공하고, 수천 건의 고객 상호작용을 팀이 분석할 수 있는 데이터로 전환합니다.
미디어 및 엔터테인먼트
방송사와 스트리밍 플랫폼은 사람이 전사하는 방식으로는 따라잡을 수 없는 규모로 대화의 자막과 캡션을 생성하는 데 ASR을 사용할 수 있습니다. 실시간 전사를 지원하는 동시에 비디오 및 오디오 라이브러리를 완전히 검색 가능하게 합니다.
의료
임상 직원은 하루 중 예상보다 많은 시간을 문서화와 차트 작성에 씁니다. ASR은 이 시간을 되찾아 의사가 의료 STT 플랫폼에 실시간으로 메모를 받아쓰도록 지원합니다.
가상 회의
회의 플랫폼은 대화가 진행되는 동안 이를 전사하는 디지털 메모 기능을 제공하는 경우가 많으므로, 누구도 참여와 메모 작성 중 하나를 선택할 필요가 없습니다. Google Meet 같은 서비스는 회의가 끝난 뒤 실행 항목을 강조 표시한 전사본을 보내 검색 가능한 정보 색인을 만드는 데 도움을 줍니다.
법률 및 규정 준수
법률 환경에서 누가 무엇을 말했는지 정확히 기록하는 일은 법정의 핵심 요건입니다. 법률 사무소는 나중에 참고할 수 있도록 정밀한 타임스탬프와 함께 회의, 심리, 고객 통화, 법정 절차를 전사하는 ASR 플랫폼을 사용합니다.
교육
대학 교수는 학생이 수강한 강의 기록을 쌓을 수 있도록 강의 전사본을 제공할 수 있습니다. 정보를 이해하고 암기할 때 학생은 시작점으로 활용할 수 있는 종합 자료를 갖게 됩니다.
음성 에이전트 파이프라인에서 ASR의 위치
ASR은 다양한 기술 배포에서 표준적으로 사용됩니다. 음성 에이전트 기술에서는 연속 루프로 실행되는 세 가지 큰 단계 중 첫 번째입니다.
- 듣기(ASR): 에이전트는 들어오는 오디오 스트림을 캡처하고 음성을 실시간 텍스트로 변환합니다. 현대 ASR은 오디오가 들어오는 대로 지속적으로 처리하며, 배경 소음을 필터링하고, 중단을 처리하며, 부분 전사본을 생성하고, 각 사람이 말하는 시점을 식별합니다.
- 생각하기(언어 모델): 대규모 언어 모델은 전사본을 해석하여 사용자 의도를 파악하고, 연결된 도구와 지식 기반에서 정보를 검색하며, 대화 문맥을 유지하고, 가장 적절한 응답 또는 작업을 결정합니다.
- 말하기(텍스트 음성 변환): 텍스트 음성 변환 모델은 생성된 LLM 응답을 자연스럽고 표현력 있는 오디오로 변환합니다. 현대 TTS 시스템은 전체 응답을 기다리지 않고 생성되는 대로 호출자에게 오디오를 스트리밍하면서 속도, 억양, 감정, 강조를 조절할 수 있습니다.
대화 지연 시간은 이 모든 단계에서 누적됩니다. 스트리밍 ASR은 지연 시간을 줄이기 위해 발화가 끝날 때까지 기다리지 않고 말하는 즉시 단어를 출력하기 시작합니다. ElevenAgents는 이를 실시간 음성 에이전트의 표준으로 사용하여 고효율 에이전트 경험을 제공합니다.
ASR의 과제와 기술의 진화
ASR 기술은 1952년의 시작 이후 크게 발전했지만, 정확도를 낮출 수 있는 여러 과제가 여전히 남아 있습니다.
다음은 오늘날에도 ASR 도구가 마주하는 몇 가지 문제입니다:
- 억양 및 방언: 사용 가능한 학습 데이터는 일반적으로 일부 언어와 억양에 집중되어 있어, 덜 흔한 억양이나 화자 수가 적은 언어는 ASR 도구에 더 어려운 과제가 됩니다. 풍부하고 다양한 학습 데이터 세트가 해결책입니다.
- 배경 소음 및 겹치는 화자: 볼륨이 일정하지 않거나 큰 배경 소음이 있는 환경에서는 녹음된 개별 단어를 정확히 식별하기 어렵습니다. 화자가 겹쳐 말하는 경우에도 비슷한 영향을 주어 ASR 전사의 정확도가 낮아질 수 있습니다.
- 도메인별 어휘: 특정 전문 용어나 약어가 있는 분야에서는 정확도를 높이기 위해 도메인 수준의 사전과 참고 자료가 필요합니다. 의학과 법률은 ASR 도구에 추가 지원이나 전문 학습이 필요한 두 분야입니다.
- 개인정보 보호 및 보안: 많은 관할 지역에서 음성 데이터는 개인정보로 간주됩니다. 기업은 음성 데이터 처리를 보호하고 더 광범위한 규정을 준수할 수 있도록 명확한 보존 정책과 안전장치를 마련해야 합니다.
ASR 기술을 다룰 때 더 넓게 고려할 점은 지연 시간과 정확도 사이의 균형입니다. 일부 사용 사례는 둘 사이의 균형을 맞춰야 하지만, 의료 같은 분야는 정확도를 무엇보다 우선시할 가능성이 높습니다.
프로덕션급 ASR 통합을 위한 ElevenAPI 시작하기
ElevenAPI는 ElevenLabs의 텍스트 음성 변환 모델인 Scribe v2를 통해 제품에 프로덕션급 자동 음성 인식을 제공합니다. Scribe v2는 단어 수준 타임스탬프, 화자 분리, 오디오 이벤트 태깅과 실시간 애플리케이션에 필요한 정확성 및 안정성을 제공합니다.
자세한 내용은 ElevenLabs 텍스트 음성 변환 페이지를 확인하거나 무료 계정 만들기를 통해 몇 분 만에 API를 실행해 보세요.
ASR FAQ
Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.





