본문 바로가기

ASR이란 무엇이며 자동 음성 인식은 어떻게 작동하나요?

작성자
Jack Limebear
게시일

듣기이 글 오디오로 듣기

1952년, 세계에서 가장 발전된 음성 인식 시스템이 이해할 수 있었던 단어는 단 9개뿐이었습니다.

약 75년이 지난 지금, 자동 음성 인식(ASR)은 수십 개 언어를 실시간으로 받아 적으며, 휴대폰의 음성 비서부터 라이브 영상 자막까지 다양한 곳에서 사용되고 있습니다.

이 가이드에서는 1952년과 현재의 기술 격차를 메운 기술, ASR이 무엇인지, 음성을 어떻게 텍스트로 변환하는지, 그리고 ASR이 오늘날에도 어떻게 계속 발전하고 있는지 살펴봅니다.

요약:

  • ASR은 자동 음성 인식(Automatic Speech Recognition)의 약자로, 음성 오디오를 문자 텍스트로 변환하는 기술입니다.
  • ASR의 가장 초기 형태는 1952년에 등장했으며, 딥러닝 시스템은 2010년대 후반에 인간 수준의 성능에 도달했습니다.
  • 최신 ASR은 수백만 시간의 오디오로 학습된 엔드 투 엔드 신경망을 사용합니다.
  • 단어 오류율(WER)이 표준 정확도 지표이지만, 실제 ASR에서는 지연 시간, 화자 분리 품질, 맥락 이해도도 중요한 역할을 합니다.
  • ElevenAPI는 개발자에게 프로덕션급 ASR을 제공합니다. Artificial Analysis의 독립 벤치마크에서 2.2%의 단어 오류율로, 해당 지수에서 가장 낮은 수치를 기록했습니다(2026년 7월 기준).

ASR은 무엇의 약자이며, 자동 음성 인식이란 무엇인가요?

자동 음성 인식(ASR)은 사람의 말을 듣고 이를 정확하고 기계가 읽을 수 있는 텍스트로 변환하는 소프트웨어를 의미합니다. 음성 텍스트 변환 또는 음성 인식, 때로는 컴퓨터 음성 인식이라고도 불립니다.

ASR은 너무나 일상화되어 있어서, 매일 사용하면서도 인식하지 못할 수 있습니다. 메시지를 음성으로 입력하거나, 음성 비서에게 질문을 하거나, 라이브 영상에서 자막을 읽거나, 인터랙티브 음성 응답 전화 시스템을 사용할 때마다 ASR과 상호작용하고 있는 것입니다.

음성 텍스트 변환과 ASR은 종종 같은 의미로 쓰이지만, 완전히 동일하지는 않습니다. ASR은 '무엇을 말했는지'를 인식하는 기술이고, STT는 그 기술을 활용한 도구입니다. 음성 인식 소프트웨어는 ASR 위에 적용되어 '누가 말했는지'를 구분하며, 이는 화자 분리 기능의 기반이 됩니다.

이런 차이는 작지만, 앱이나 웹사이트에 ASR/STT/음성 인식 시스템을 통합하려는 경우 알아두면 좋습니다.

자동 음성 인식 기술의 간략한 역사

자동 음성 인식 기술은 많은 사람들이 생각하는 것보다 훨씬 오래되었습니다. 초기 형태는 1950년대까지 거슬러 올라가며, 70여 년 동안 여러 중요한 단계를 거치며 발전해왔습니다.

ASR 기술이 거쳐온 주요 시대는 다음과 같습니다:

  • 1952년, 최초의 ASR: 1952년, 자동 숫자 인식기인 AUDREY가 벨 연구소에서 1부터 9까지의 숫자를 인식하도록 개발되었습니다. 이 도구는 약 90%의 정확도를 보였지만, 발명가 본인만 사용할 수 있을 정도로 한계가 컸습니다. 지금의 기술과는 거리가 멀지만, 1~9까지 숫자를 인식할 수 있다는 것만으로도 당시에는 대단한 성과였습니다.
  • 1960~70년대, ASR 어휘 확장: 이후 수십 년 동안 IBM, 유니버시티 칼리지 런던, 일본 NEC 등 세계 각지의 연구소에서 AUDREY와 유사한 모델이 개발되었습니다. 인도 출신의 대학원생 Raj Reddy는 박사 프로젝트로 모음 인식기를 만들었고, 이는 단어 사이에 멈추지 않고 연속적으로 음성을 인식하는 기반이 되었습니다. 이 시기 DARPA의 연구 지원으로 Beam Search(빔 서치)라는 문장 구성 및 해독 방법이 개발되어, 1976년에는 1,000개 이상의 단어를 인식할 수 있게 되었습니다.
  • 1980년대~2010년대 초, 통계적 발전: 1987년, Raj Reddy의 제자가 히든 마르코프 모델(HMM)과 빔 서치를 결합해, 특정 화자에 맞춰 학습하지 않아도 되는 ASR을 만들었습니다. 이로 인해 음성 인식 시스템의 학습 시간이 크게 단축되었습니다. 1997년 Dragon Systems는 최초의 상용 ASR인 NaturallySpeaking Preferred를 출시했고, 분당 100단어를 인식하며 좋은 반응을 얻었습니다.
  • 현대와 딥러닝 시대: 2010년대에는 오디오와 전사본으로 엔드 투 엔드 학습된 단일 신경망이 기존 통계적 방식보다 더 뛰어난 성능을 보였습니다. 딥 뉴럴 네트워크의 등장으로 ASR은 5~10%의 오류율로 인간 수준에 근접하게 되었고, 이 시기에 Alexa, Siri와 같은 음성 기반 비서가 등장했습니다.

이후 ASR은 더욱 정확해지고 널리 사용되고 있습니다. 2026년 7월 기준, Artificial Analysis의 독립 연구에서 ElevenLabs Scribe v2가 업계 최고 수준인 2.2%의 단어 오류율(WER)을 기록했습니다.

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

ASR은 어떻게 작동하나요? 음성 텍스트 변환 기술의 기본

ASR은 오디오 샘플을 받아 수치로 변환한 뒤, 학습된 모델을 통해 해당 수치가 어떤 단어 시퀀스를 의미하는지 예측합니다. 최신 ASR은 이 과정을 실시간으로 처리해 1초 이내에 끝낼 수 있습니다.

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

ASR 파이프라인의 주요 단계는 다섯 가지입니다:

  1. 오디오 캡처 및 전처리: 시스템이 오디오 신호를 녹음하고, 배경 소음을 제거하며, 에코를 줄이고, 볼륨을 정규화해 일관성을 높입니다. 모델에 따라 음성 활동 감지(VAD)를 사용해 음성과 침묵, 배경음을 구분한 뒤 전사를 시작할 수 있습니다.
  2. 특징 추출: 오디오는 일반적으로 스펙트로그램이나 멜 주파수 특징 등 수치 데이터로 변환되어, 인간 음성의 주파수와 패턴을 정확히 드러냅니다. 이 단계는 원시 파형을 머신러닝 모델이 효과적으로 처리할 수 있는 데이터로 바꿔줍니다.
  3. 음향 모델링: 신경망이 앞 단계에서 추출한 특징을 분석해 음소 등 음성 단위를 예측하며, 음향 패턴과 언어의 관계를 학습합니다. 최신 엔드 투 엔드 모델은 이 과정을 언어 이해와 함께 동시에 수행하기도 합니다.
  4. 언어 모델링 및 디코딩: 시스템은 문법, 맥락, 수학적 확률 등 규칙을 바탕으로 가장 가능성 높은 단어 시퀀스를 결정합니다. 예를 들어, “Recognize Speech”와 “Wreck a nice peach”는 발음이 비슷하지만 맥락이 다릅니다. 맥락 정보가 정확한 선택에 도움을 줍니다.
  5. 출력 포맷팅: 음성 내용을 결정한 후, 최종 텍스트를 구두점과 대소문자를 포함해 전사합니다. 단어별 타임스탬프, 화자 라벨 등 추가 메타데이터로 더 상세한 전사본을 만들 수 있습니다.

이 주요 단계를 거치며, 모델은 오디오 데이터를 텍스트 전사로 변환합니다.

전통적 하이브리드 시스템 vs. 엔드 투 엔드 딥러닝 ASR

위 파이프라인은 ASR의 작동 방식을 설명하지만, 실제로는 중간 단계에서 두 가지 기술적 접근법이 존재합니다.

기존 시스템은 여러 컴포넌트를 연결합니다. 단어 발음을 담은 렉시콘 모델, 오디오를 음소로 변환하는 음향 모델, 가능한 단어 시퀀스를 예측하는 언어 모델이 각각 필요합니다. 이 과정에는 언어학자가 발음 사전을 만들고, 어노테이터가 오디오와 단어를 일일이 맞추는 등 많은 인력이 필요합니다.

엔드 투 엔드 딥러닝은 이 모든 컴포넌트를 하나의 신경망으로 통합합니다. 이 네트워크는 수백만 시간의 오디오와 전사본을 통해 발음, 음향, 언어 확률을 자동으로 학습합니다.

전통적 방식과 최신 ASR 기술의 차이점을 좀 더 자세히 살펴보겠습니다.

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

ASR 정확도 측정 방법: 단어 오류율(WER) 기준

모든 음성 텍스트 변환 및 ASR 워크플로우에서 단어 오류율(WER)이 주요 정확도 지표로 사용됩니다. ASR로 생성된 기계 전사본과 사람이 검증한 전사본을 비교해, 대체, 삭제, 삽입 등 세 가지 주요 오류를 집계합니다.

WER 공식은 전체 오류 수를 기준 전사본의 단어 수로 나눕니다. WER이 5%라면, 시스템이 95%의 텍스트를 정확히 전사했다는 의미입니다. 최신 모델은 대부분 5% 이하로 정확도를 높이고 있습니다.

WER도 유용한 기준이지만, ASR 도구의 효과를 평가할 때는 다음과 같은 요소도 고려해야 합니다:

  • 포맷팅 정확도: 시스템이 비표준 문자열도 제대로 포맷팅할 수 있나요? 예를 들어, $1,225와 같은 금액을 그대로 표시하는지, 아니면 '천이백이십오 달러'처럼 풀어쓰는지 확인해야 합니다.
  • 지연 시간: 정확도가 아무리 높아도, 간단한 전사에 몇 분이 걸린다면 쓸모가 없습니다. 정확성과 함께 낮은 지연 시간도 중요합니다.
  • 강인성: 심한 억양이나 시끄러운 환경 과 같은 상황에서도 모델의 정확도가 크게 떨어지지 않아야 합니다.
  • 화자 분리 품질: 여러 명이 말하는 상황에서는 각 단어를 올바른 화자에게 정확히 할당하는 것이 중요합니다. 다양한 화자를 구분하고 태그하는 기능은 법정 등 다화자 환경에서 특히 중요합니다.

더 자세한 내용은 단어 오류율.

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

ASR이 현대 비즈니스에 주는 주요 이점

글로벌 음성 및 음성 인식 시장은 2030년까지 $231억 1,000만 달러 이상으로 성장할 것으로 예상됩니다. 연평균 성장률 19.1%는 이 기술이 상업용 기기에 얼마나 널리 쓰이고 있는지 보여줍니다. 모든 최신 스마트폰에는 음성 입력 키보드와 음성 비서가 탑재되어 있고, 대부분의 신차는 음성 명령을 인식하며, 스마트 스피커와 비서가 전 세계 가정에 자리 잡고 있습니다.

이제 고객은 음성을 통해 기술과 상호작용하는 것이 기본 경로가 되었습니다. 기업 입장에서는 ASR로 고객 통화 전사, 음성 에이전트 지원 등 다양한 업무에 활용해 생산성을 높일 수 있습니다.

현대 비즈니스에서 ASR이 제공하는 주요 이점은 다음과 같습니다:

  • 더 빠른 입력 및 문서화: 10년 전만 해도 스탠포드 대학 논문에서 음성 인식 기술이 키보드 타이핑보다 거의 3배 빠르면서도 오류율이 더 낮다는 결과가 발표되었습니다. 대부분의 사람들에게 ASR은 전사 워크플로우와 음성 기반 메모 작성에 더 빠른 문서화를 가능하게 합니다.
  • 운영 비용 절감: 과거에는 수시간의 수작업이 필요했던 업무도 ASR 기술로 고품질 전사 비용이 크게 줄었습니다. 법정, 콜센터, 의료기관, 비즈니스 미팅 등에서 정확한 ASR 시스템으로 대화 내용을 상세하게 기록하고, 화자별 전사본도 만들 수 있습니다.
  • 접근성 향상: 세계보건기구(WHO)는 25억 명이 2050년까지 청각 장애를 겪을 것으로 예측합니다. 고급 ASR 도구가 제공하는 실시간 자막은 디지털 회의와 미디어를 사용자에게 더 쉽게 접근 가능하게.
  • 검색 가능한 음성 데이터: ASR로 음성을 자동 전사하면, 모든 고객-기업 상호작용이 완전히 기록됩니다. 영업 통화, 지원 티켓, 잠재 고객 상담, 미팅 등 모든 대화가 검색 및 감사 가능한 텍스트로 남습니다. 특히 AI 시대에는 기계가 읽을 수 있는 맥락을 확보해 방대한 지식 베이스를 구축할 수 있습니다. 기능적이든 규정 준수 목적이든, 정보의 가시성을 높이는 데 도움이 됩니다.
  • 항상 가능한 고객 경험: ASR은 음성 에이전트의 핵심 기술 중 하나로, 자동화된 지원 사례에서 고객 전화를 해결하는 24/7/365 서비스를 가능하게 합니다.

자동 음성 인식은 다양한 이점과 폭넓은 활용 사례 덕분에 기술 분야에서 매우 중요한 역할을 하고 있습니다. 의료 분야든, 고객 통화를 감정 분석용으로 전사하려는 경우든, ASR은 반드시 도입하게 되는 핵심 기술입니다.

산업별 ASR의 대표적 활용 사례

자동 음성 인식은 수많은 워크플로우와 제품의 핵심 기술입니다. 너무나 보편화되어 사용자는 자신이 쓰는 기술에 ASR이 얼마나 깊이 들어가 있는지 인식하지 못할 때도 많습니다.

전 세계적으로 ASR이 활용되는 대표적 사례를 간단히 소개합니다.

고객 서비스 및 콜센터

콜센터는 ASR을 가장 먼저 도입한 분야 중 하나로, 통화 내용을 전사해 품질 관리와 규정 준수에 활용했습니다. 현재는 실시간으로 상담원에게 제안을 제공하고, 수천 건의 고객 대화를 데이터로 전환해 분석할 수 있습니다.

미디어 및 엔터테인먼트

방송사와 스트리밍 플랫폼은 ASR로 대규모 대화 자막과 캡션을 생성할 수 있습니다. 이는 실시간 전사는 물론, 비디오와 오디오 라이브러리를 완전히 검색 가능하게 만듭니다.

헬스케어

의료진은 하루 중 상당 시간을 문서화와 차트 작성에 사용합니다. ASR은 이 시간을 절약해주며, 의사에게 의료용 STT 플랫폼을 제공해 실시간으로 메모를 받아 적을 수 있게 합니다.

화상 회의

회의 플랫폼은 대화 내용을 실시간으로 전사해주는 디지털 메모 기능을 제공합니다. 덕분에 누구도 참여와 필기 중 하나를 선택할 필요가 없습니다. Google Meet 등은 회의 후 주요 액션 아이템이 강조된 전사본을 보내주기도 하여, 정보 검색이 쉬워집니다.

법률 및 규정 준수

법률 분야에서는 누가, 언제, 무엇을 말했는지 정확히 기록하는 것이 매우 중요합니다. 로펌은 ASR 플랫폼으로 미팅, 청문회, 고객 통화, 법정 기록을 정확한 타임스탬프와 함께 전사해 보관합니다.

교육

대학교 교수는 강의 녹음 전사본을 제공해 학생들이 수업 기록을 쌓을 수 있도록 도와줍니다. 학생들은 정보를 이해하고 암기하는 데 활용할 수 있는 종합 자료를 갖게 됩니다.

음성 에이전트 파이프라인에서 ASR의 역할

ASR은 다양한 기술 도입에서 표준적으로 사용됩니다. 음성 에이전트 기술에서는 세 단계 중 첫 번째로, 이 과정이 반복적으로 이어집니다.

  • 듣기(ASR): 에이전트가 들어오는 오디오 스트림을 받아 실시간으로 음성을 텍스트로 변환합니다. 최신 ASR은 오디오가 도착하는 즉시 처리하며, 배경 소음을 걸러내고, 중간에 끊기는 상황도 처리하며, 부분 전사본을 생성하고, 각 화자가 언제 말하는지도 식별합니다.
  • 생각하기(언어 모델): 대형 언어 모델이 전사본을 해석해 사용자의 의도를 파악하고, 연결된 도구와 지식 베이스에서 정보를 가져오며, 대화 맥락을 유지하고, 가장 적절한 응답이나 행동을 결정합니다.
  • 말하기(텍스트 음성 변환): 텍스트 음성 변환 모델이 LLM의 응답을 자연스럽고 표현력 있는 오디오로 변환합니다. 최신 TTS 시스템은 오디오를 스트리밍하면서 속도, 억양, 감정, 강조 등을 조절할 수 있어, 전체 응답을 기다리지 않고 바로 들려줄 수 있습니다.

대화 지연 시간은 각 단계마다 누적됩니다. 스트리밍 ASR은 발화가 끝나기를 기다리지 않고, 말하는 즉시 단어를 출력해 지연을 줄입니다.ElevenAgents는 실시간 음성 에이전트의 표준으로 이 방식을 적용해, 효율적인 에이전트 경험을 제공합니다.

ASR의 과제와 기술 발전 방향

ASR 기술은 1952년 이후 크게 발전했지만, 여전히 정확도를 떨어뜨릴 수 있는 다양한 과제가 남아 있습니다.

오늘날에도 ASR 도구가 겪는 주요 문제는 다음과 같습니다:

  • 억양과 방언: 학습 데이터는 보통 몇몇 언어와 억양에 집중되어 있어, 사용자가 적은 억양이나 언어는 ASR 도구에 더 어렵게 작용합니다. 다양한 학습 데이터가 해결책입니다.
  • 배경 소음 및 동시 발화: 소음이 크거나 변동이 심한 환경에서는 개별 단어를 정확히 인식하기 어렵습니다. 여러 사람이 동시에 말하면 ASR 정확도가 떨어질 수 있습니다.
  • 도메인 특화 어휘: 특정 분야의 전문 용어나 약어가 많을 경우, 도메인별 사전과 레퍼런스가 필요합니다. 의료, 법률 분야에서는 추가 지원이나 특화 학습이 필요합니다.
  • 개인정보 보호 및 보안: 많은 국가에서 음성 데이터는 개인정보로 간주됩니다. 기업은 명확한 데이터 보관 정책과 보호 장치를 마련해, 음성 데이터 처리와 규정 준수를 보장해야 합니다.

ASR 기술을 사용할 때 더 넓게 고려해야 할 점은 지연 시간과 정확도의 균형입니다. 일부 분야는 두 요소의 균형이 필요하지만, 의료 등은 무엇보다 정확도를 우선시할 수 있습니다.

프로덕션급 ASR 통합을 위한 ElevenAPI 시작하기

ElevenAPI는 Scribe v2, ElevenLabs의 텍스트 음성 변환 모델을 통해 프로덕션급 자동 음성 인식을 제품에 제공합니다. Scribe v2는 단어별 타임스탬프, 화자 분리, 오디오 이벤트 태깅, 실시간 애플리케이션에 필요한 정확도와 신뢰성을 제공합니다.

ElevenLabs 텍스트 음성 변환 페이지에서 더 자세한 정보를 확인하거나 무료 계정 만들기로 몇 분 만에 API를 바로 시작해보세요.

ASR 관련 자주 묻는 질문

유사한 기사

최고 품질의 AI 오디오로 창작하세요