자동 음성 인식(ASR)이란?
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
1952년, 세계에서 가장 발전된 음성 인식 시스템이 이해할 수 있는 단어는 정확히 9개였습니다.
약 75년이 흐른 오늘날, 자동 음성 인식(ASR)은 수십 개 언어를 실시간으로 전사하며 휴대폰의 음성 비서부터 라이브 영상에 표시되는 자막까지 다양한 기능을 지원합니다.
이 가이드에서는 1952년의 기술과 현대 기술 사이의 격차를 메운 기술을 살펴봅니다. ASR이 무엇인지, 음성을 텍스트로 어떻게 변환하는지, 그리고 오늘날에도 ASR이 어떻게 발전하고 있는지를 다룹니다.
요약:
- ASR은 자동 음성 인식(automatic speech recognition)의 약자로, 음성 오디오를 글로 변환하는 기술입니다.
- ASR의 초기 형태는 1952년에 등장했으며, 딥러닝 시스템은 2010년대 후반에 인간 수준의 벤치마크에 도달했습니다.
- 현대 ASR은 수백만 시간의 오디오로 학습한 엔드 투 엔드 신경망을 사용합니다.
- 단어 오류율(WER)은 표준 정확도 지표이지만, 실제 운영 환경의 ASR에서는 지연 시간, 화자 분리 품질, 문맥 이해도도 중요합니다.
- ElevenAPI는 개발자에게 프로덕션급 ASR을 제공하며, Artificial Analysis의 독립 벤치마크에서 2.2%의 단어 오류율을 기록해 해당 지수 최저치를 달성했습니다(2026년 7월).
자동 음성 인식(ASR)이란 무엇인가요?
흔히 ASR이라는 약자로 불리는 자동 음성 인식은 사람의 음성을 듣고 정확한 기계 판독 가능 텍스트로 변환하는 소프트웨어를 말합니다. 일반적으로 음성 텍스트 변환 또는 음성 인식, 때로는 컴퓨터 음성 인식이라고도 합니다.
ASR은 매우 보편화되어서, 매일 사용하면서도 알아차리지 못할 수 있습니다. 메시지를 받아쓰기하거나, 음성 비서에게 질문하거나, 라이브 영상의 자막을 읽거나, 대화형 음성 응답 전화 시스템을 이용할 때마다 ASR을 사용하고 있는 것입니다.
음성 텍스트 변환과 ASR은 흔히 동의어로 쓰이며 밀접하게 관련되어 있지만, 완전히 같은 개념은 아닙니다. ASR은 말한 내용을 식별하는 기술이고, STT는 그 기술을 도구로 활용하는 방식입니다. 음성 인식 소프트웨어는 ASR 위에 구축되어 특정 단어를 누가 말했는지 식별하며, 이는 화자 분리 기능의 기반이 됩니다.
작은 차이지만, 앱이나 웹사이트에 ASR/STT/음성 인식 시스템을 통합하려 한다면 알아둘 만합니다.
자동 음성 인식 기술의 간략한 역사
자동 음성 인식 기술은 많은 사람이 생각하는 것보다 훨씬 오래되었으며, 초기 시도는 1950년대로 거슬러 올라갑니다. 탄생 이후 70여 년 동안 ASR은 역사적 발전의 토대가 된 여러 중요한 단계를 거쳤습니다.
ASR 기술이 거쳐 온 주요 시대는 다음과 같습니다:
- 1952년과 최초의 ASR: 1952년, AUDREY로 알려진 자동 숫자 인식기(Automatic Digit Recognizer)가 벨 연구소에서 1부터 9까지의 숫자를 인식하도록 개발되었습니다. 이 도구의 정확도는 약 90%에 불과했고 발명자만 사용할 수 있어 한계가 매우 컸습니다. 오늘날의 역량과는 거리가 멀었지만, 1~9를 인식할 수 있다는 사실만으로도 인상적인 성과였습니다.
- 1960~70년대와 늘어나는 ASR 어휘: 이후 수십 년간 IBM, 런던대학교, 일본 NEC를 비롯한 전 세계 연구소들은 여러 맥락에서 AUDREY와 유사한 모델을 개발했습니다. 스탠퍼드대 인도 출신 대학원생 라지 레디는 박사 과정 프로젝트로 모음 인식기를 만들었고, 이를 통해 단어 사이에 멈출 필요 없는 연속 음성 인식의 기반을 마련했습니다. 이 시기 DARPA(미국 국방고등연구계획국)가 지원한 연구는 문장 구성 및 디코딩 방식인 빔 서치(Beam Search)로 이어졌으며, 이는 1976년까지 1,000개 이상의 단어를 인식하는 데 핵심적인 역할을 했습니다.
- 1980년대~2010년대 초반의 통계적 발전: 1987년, 라지 레디의 제자였던 한 연구자(당시 교수)가 은닉 마르코프 모델(Hidden Markov Models)과 빔 서치를 결합해 특정 화자 한 명의 음성으로 학습할 필요가 없는 ASR을 구현했습니다. 이 혁신은 음성 인식 시스템의 학습 시간을 크게 줄였습니다. Dragon Systems는 1997년 NaturallySpeaking Preferred라는 최초의 상용 ASR을 출시했습니다. 이 제품은 분당 100단어를 인식할 수 있었고 성공적으로 판매되었습니다.
- 현대 시대와 딥러닝: 2010년대에 연구자들은 오디오와 전사문으로 엔드 투 엔드 학습한 단일 신경망이 순수 통계 기반 파이프라인보다 성능이 뛰어나다는 것을 입증했습니다. 심층 신경망의 등장으로 ASR은 오류율 5~10% 수준의 인간에 가까운 성능에 도달할 수 있었습니다. 이 시기에 Alexa와 Siri 같은 음성 기반 비서가 시장에 출시되었습니다.
그 이후 ASR은 더욱 정확해지고 널리 사용되고 있습니다. 2026년 7월 기준, Artificial Analysis의 독립 연구는 ElevenLabs Scribe v2가 업계 최고 수준인 단 2.2%의 단어 오류율(WER)을 기록했다고 밝혔습니다.

ASR은 어떻게 작동하나요? 음성 텍스트 변환 기술의 기초
ASR은 오디오 샘플을 캡처하고 수치 표현으로 변환한 뒤, 학습된 모델로 해당 수치가 나타내는 가장 가능성 높은 단어 시퀀스를 예측하는 방식으로 작동합니다. 현대 ASR은 이 시스템을 실시간으로 구현하며, 전체 엔드 투 엔드 과정을 1초 이내에 완료합니다.

ASR 파이프라인은 크게 5단계로 구성됩니다:
- 오디오 캡처 및 전처리: 시스템은 오디오 신호를 녹음하고, 배경 소음을 제거하며, 에코를 줄이고, 일관성을 높이기 위해 볼륨을 정규화합니다. 모델에 따라 전사가 시작되기 전에 음성 활동 감지(VAD)를 사용해 음성을 무음이나 배경음과 구분할 수 있습니다.
- 특징 추출: 오디오는 일반적으로 스펙트로그램이나 멜 주파수 특징과 같은 수치 표현으로 변환됩니다. 이를 통해 사람의 음성에 포함된 주파수와 패턴을 정확히 드러냅니다. 이 단계는 원시 파형을 머신러닝 모델이 효과적으로 처리할 수 있는 데이터로 바꾸는 과정입니다.
- 음향 모델링: 신경망은 앞 단계의 특징을 분석해 음소 또는 기타 음성 단위를 예측하고, 음향 패턴과 구어 사이의 관계를 학습합니다. 현대의 엔드 투 엔드 모델은 이 단계를 완전히 분리된 과정으로 처리하기보다 언어 이해와 함께 수행하는 경우가 많습니다.
- 언어 모델링 및 디코딩: 시스템은 문법, 문맥, 수학적 확률 등의 규칙을 바탕으로 어떤 단어 시퀀스가 가장 가능성 높은지 가중치를 부여합니다. 두 문장의 IPA(국제음성기호) 표기는 유사할 수 있지만 문맥은 완전히 다를 수 있으므로, 특히 문맥과 확률이 중요합니다. 예를 들어 “Recognize Speech”와 “Wreck a nice peach”는 같은 소리로 들릴 수 있지만 의미는 완전히 다릅니다. 정확도만으로 확신할 수 없을 때 문맥은 시스템이 올바른 표현을 판단하도록 돕습니다.
- 출력 형식 지정: 음성 내용이 결정되면 문장 부호와 대소문자를 적용해 최종 텍스트를 전사합니다. 단어 수준 타임스탬프와 화자 레이블 같은 추가 메타데이터는 더 상세한 전사문을 만듭니다.
이러한 주요 단계를 거쳐 모델은 들어오는 오디오 데이터를 서면 전사문으로 변환합니다.
기존 하이브리드 시스템과 엔드 투 엔드 딥러닝 ASR 비교
위 파이프라인은 ASR의 작동 방식을 설명하지만, 그 중간 단계에는 실제로 두 가지 기술적 접근법이 있습니다.
기존 시스템은 여러 구성 요소를 연결합니다. 단어의 발음을 인코딩하는 어휘 모델, 오디오를 음소에 매핑하는 음향 모델, 가능성 높은 단어 시퀀스를 예측하는 언어 모델이 그것입니다. 이러한 각 구성 요소를 만들려면 발음 사전을 직접 구축하는 언어학자부터 오디오 속 모든 단어의 정확한 위치를 정렬하는 주석 작업자까지, 사람의 전문성이 필요합니다.
엔드 투 엔드 딥러닝은 이 모든 구성 요소를 하나의 신경망으로 통합합니다. 이 네트워크는 수백만 시간 분량의 오디오와 전사문 쌍을 통해 발음, 음향, 언어 확률 통계를 암묵적으로 이해하며 오디오를 텍스트에 직접 매핑합니다.
ASR 기술에 대한 기존 접근법과 현대적 접근법의 차이를 살펴보겠습니다.
ASR 정확도 측정 방법: 단어 오류율(WER) 벤치마크
모든 음성 텍스트 변환 및 ASR workflow에서 단어 오류율(WER)은 기업이 사용하는 주요 정확도 지표입니다. ASR로 생성한 기계 전사문을 사람이 검증한 버전과 비교합니다. 여기에는 대체, 삭제, 삽입의 세 가지 주요 오류가 포함됩니다.
WER 공식은 총 오류 수를 기준 전사문의 단어 수로 나눕니다. WER이 5%라면 시스템이 텍스트의 95%를 정확히 전사했다는 뜻이며, 현재 주요 모델은 완성도에 가까워지기 위해 5%보다 훨씬 낮은 수치를 목표로 하고 있습니다.
WER은 유용한 벤치마크지만, ASR 도구의 효과를 판단할 때는 다른 요소도 고려해야 합니다:
- 형식 지정 정확도: 시스템이 비표준 문자열을 올바르게 형식화할 수 있나요? 예를 들어 $1,225와 같은 금액을 그대로 표시하나요, 아니면 “one thousand two hundred twenty-five dollars”처럼 풀어서 쓰나요?
- 지연 시간: 정확도도 중요하지만, 간단한 전사문을 생성하는 데 몇 분이 걸린다면 도구는 사용할 수 없습니다. 아무리 정확해도 실용성을 높이려면 낮은 지연 시간과 균형을 이뤄야 합니다.
- 견고성: 강한 억양이나 시끄러운 배경 같은 사용 사례에서도 모델 정확도가 크게 떨어져서는 안 됩니다.
- 화자 분리 품질: 다화자 사용 사례는 모든 단어를 올바른 화자에게 정확히 할당하는 데 달려 있습니다. 서로 다른 화자를 식별하고 정확히 태그하는 역량은 ASR에 기여하며, 특히 법정처럼 다화자 상황이 많은 업계에서 중요합니다.
자세한 내용은 단어 오류율에 관한 종합 가이드를 읽어보세요.

현대 기업을 위한 ASR의 주요 이점
전 세계 음성 및 음성 인식 시장은 2030년까지 231억 1,000만 달러 이상으로 성장할 것으로 예상됩니다. 시장의 연평균 성장률 19.1%는 이 기술이 상용 기기에 얼마나 널리 보급되었는지 보여줍니다. 모든 현대 스마트폰에는 받아쓰기 키보드와 음성 비서가 탑재되고, 대부분의 신차는 음성 명령에 반응하며, 스마트 스피커와 비서는 전 세계 가정에 자리 잡았습니다.
이제 음성으로 기술과 상호작용하는 것은 고객이 폭넓게 이용할 수 있는 기본 방식입니다. 기업은 ASR을 통해 고객 통화 전사부터 음성 에이전트 지원까지 다양한 기능을 프로세스에 통합해 생산성을 높일 수 있습니다.
현대 기업을 위한 ASR의 주요 이점은 다음과 같습니다:
- 더 빠른 입력 및 문서화: 10여 년 전에도 스탠퍼드대는 논문을 발표해 음성 인식 기술이 더 낮은 오류율을 유지하면서 키보드 입력보다 거의 3배 빠르다는 사실을 입증했습니다. 대부분의 사람에게 ASR은 전사 workflow와 음성 우선 메모 작성에서 더 빠른 문서화를 가능하게 합니다.
- 운영 비용 절감: 과거에는 수 시간의 수기 메모에 의존했던 많은 사용 사례에서 ASR 기술은 고품질 전사 비용을 획기적으로 줄입니다. 이제 법원 사건, 컨택 센터, 의료 클리닉, 비즈니스 회의에서 정확한 ASR 시스템으로 상세한 메모와 완전한 화자 분리 대화 전사문을 만들 수 있습니다.
- 향상된 접근성: 세계보건기구는 25억 명이 2050년까지 어떤 형태로든 청력 손실을 겪게 될 것으로 예측합니다. 고도화된 ASR 도구가 제공하는 실시간 자막은 디지털 회의와 미디어를 사용자가 이용할 수 있게 합니다.
- 검색 가능한 음성 데이터: ASR로 음성을 자동 전사하면 모든 고객-기업 상호작용이 완전히 기록됩니다. 모든 영업 통화, 지원 티켓, 잠재 고객 통화, 회의는 검색 및 감사할 수 있는 텍스트가 됩니다. 특히 AI 시대에는 기계 판독 가능한 형식의 문맥을 활용할 수 있으면 광범위한 지식 기반을 구축하는 데 도움이 됩니다. 기능과 컴플라이언스 측면 모두에서 정보를 계속 확인할 수 있게 해줍니다.
- 상시 고객 경험: ASR은 음성 에이전트의 핵심 기반 기술 중 하나로, 고객 통화를 해결하는 24시간 연중무휴 자동화 지원 사용 사례를 지원합니다.
자동 음성 인식이 기술 분야에서 널리 사용되는 이유는 통합했을 때의 이점이 많고 지원하는 사용 사례가 광범위하기 때문입니다. 의료 분야에 있든 감정 분석을 위해 고객 통화를 전사하려 하든, ASR은 통합해 활용하게 될 핵심 기술입니다.
산업 전반의 ASR 주요 활용 사례
자동 음성 인식은 수많은 workflow와 제품의 핵심 기술입니다. 워낙 보편화되어 사용자는 자신이 쓰는 기술에 이 기능이 어떻게 적용되는지 생각조차 하지 않는 경우가 많습니다.
전 세계에서 활용되는 ASR의 대표적인 사용 사례를 간략히 살펴보겠습니다.
고객 서비스 및 컨택 센터
컨택 센터는 품질 보증과 컴플라이언스를 위해 통화를 전사하는 데 ASR을 활용한 초기 도입 분야입니다. 오늘날 ASR은 실시간으로 작동해 대화 중인 상담원에게 제안을 제공하고, 수천 건의 고객 상호작용을 팀이 분석할 수 있는 데이터로 전환합니다.
미디어 및 엔터테인먼트
방송사와 스트리밍 플랫폼은 사람이 전사하는 것으로는 따라갈 수 없는 규모로 대화의 자막과 캡션을 생성하는 데 ASR을 사용할 수 있습니다. 실시간 전사를 지원하는 동시에 비디오 및 오디오 라이브러리를 완전히 검색 가능하게 만듭니다.
헬스케어
임상 직원은 하루 중 예상보다 많은 시간을 문서화와 차트 작성에 사용합니다. ASR은 이 시간을 되돌려주며, 의사가 실시간으로 메모를 받아쓰기할 수 있는 의료 STT 플랫폼을 제공합니다.
가상 회의
회의 플랫폼은 대개 대화가 진행되는 동안 전사하는 디지털 메모 기능을 제공하므로, 참여와 메모 작성 중 하나를 선택할 필요가 없습니다. Google Meet 같은 서비스는 회의가 끝난 뒤 실행 항목을 강조 표시한 전사문까지 보내며, 검색 가능한 정보 색인을 만드는 데 도움을 줍니다.
법률 및 컴플라이언스
법률 환경에서 누가 무엇을 말했는지 정확히 기록하는 일은 법정의 핵심 요건입니다. 법률 사무소는 향후 참조를 위해 정확한 타임스탬프와 함께 회의, 심리, 고객 통화, 법정 절차를 전사하는 데 ASR 플랫폼을 활용합니다.
교육
대학 교수는 학생들이 수강한 수업 기록을 쌓을 수 있도록 강의 녹화 전사문을 제공할 수 있습니다. 정보를 이해하고 기억할 때 학생들은 출발점으로 활용할 수 있는 종합적인 자료를 갖게 됩니다.
음성 에이전트 파이프라인에서 ASR의 역할
ASR은 다양한 기술 배포 환경의 표준 구성 요소입니다. 음성 에이전트 기술에서는 연속 루프로 실행되는 세 가지 큰 단계 중 첫 번째에 해당합니다.
- 듣기(ASR): 에이전트는 들어오는 오디오 스트림을 캡처하고 실시간으로 음성을 텍스트로 변환합니다. 현대 ASR은 오디오가 들어오는 대로 지속적으로 처리하며 배경 소음을 걸러내고, 중단을 처리하며, 부분 전사문을 생성하고, 각 사람이 말하는 시점을 식별합니다.
- 생각하기(언어 모델): 대규모 언어 모델은 전사문을 해석해 사용자의 의도를 이해하고, 연결된 도구와 지식 기반에서 정보를 가져오며, 대화 문맥을 유지하고, 가장 적절한 응답이나 작업을 결정합니다.
- 말하기(텍스트 음성 변환): 텍스트 음성 변환 모델은 생성된 LLM 응답을 자연스럽고 표현력 있는 오디오로 변환합니다. 현대 TTS 시스템은 전체 응답이 완성될 때까지 기다리지 않고 생성되는 즉시 발신자에게 오디오를 스트리밍하면서 속도, 억양, 감정, 강조를 조정할 수 있습니다.
대화 지연 시간은 이 모든 단계에 걸쳐 누적됩니다. 스트리밍 ASR은 지연 시간을 줄이기 위해 발화가 끝날 때까지 기다리지 않고 말하는 즉시 단어를 출력하기 시작합니다. ElevenAgents는 이를 실시간 음성 에이전트의 표준으로 활용해 고효율 에이전트 경험을 제공합니다.
ASR의 과제와 기술의 발전
ASR 기술은 1952년의 시작 이후 크게 발전했지만, 정확도를 낮출 수 있는 여러 과제는 여전히 남아 있습니다.
오늘날에도 ASR 도구가 마주하는 문제는 다음과 같습니다:
- 억양과 방언: 학습 데이터는 일반적으로 일부 언어와 억양에 집중되어 있어, 덜 일반적인 억양이나 사용 인구가 적은 언어는 ASR 도구에 더 큰 과제가 됩니다. 풍부하고 다양한 학습 데이터 세트가 해결책입니다.
- 배경 소음 및 화자 겹침:음량 변화가 크거나 큰 배경 소음이 있는 환경에서는 녹음에서 개별 단어를 정확히 찾아내기 어렵습니다. 화자가 겹쳐 말하는 경우에도 비슷한 문제가 발생해 ASR 전사의 정확도가 떨어질 수 있습니다.
- 도메인별 어휘: 특정 전문 용어나 약어가 있는 분야에서는 정확도를 높이기 위해 도메인 수준의 사전과 참고 자료가 필요합니다. 의학과 법률은 ASR 도구에 추가 지원이나 전문 학습이 필요한 두 분야입니다.
- 개인정보 보호 및 보안: 많은 관할권에서 음성 데이터는 개인 데이터로 간주됩니다. 기업은 음성 데이터 처리를 보호하고 광범위한 규정을 준수하기 위해 명확한 보존 정책과 안전장치를 마련해야 합니다.
ASR 기술을 활용할 때 더 폭넓게 고려해야 할 사항은 지연 시간과 정확도 간의 균형입니다. 일부 사용 사례는 둘 사이의 균형이 필요하지만, 의료 같은 분야는 정확도를 무엇보다 우선시할 가능성이 높습니다.
프로덕션급 ASR 통합을 위한 ElevenAPI 시작하기
ElevenAPI는 ElevenLabs 음성 텍스트 변환 모델인 Scribe v2를 통해 제품에 프로덕션급 자동 음성 인식을 제공합니다. Scribe v2는 단어 수준 타임스탬프, 화자 분리, 오디오 이벤트 태깅과 실시간 애플리케이션에 필요한 정확도 및 안정성을 제공합니다.
자세한 내용은 ElevenLabs 음성 텍스트 변환 페이지에서 확인하거나 무료 계정 만들기를 통해 몇 분 만에 API를 실행해 보세요.




