다국어 전사란 무엇이며, 어떻게 작동하나요?
- 게시일
- 최종 업데이트
국제 컨퍼런스를 개최하든, 어떤 언어로든 고객 지원 대화의 정확한 기록이 필요하든, 다국어 전사는 그 어느 때보다 중요해졌습니다.
다국어 전사 도구는 오디오 데이터를 정확하고 검색 가능한 텍스트로 변환해 대화를 활용 가능한 기록으로 만듭니다. 여러 언어에 걸친 전사를 가능하게 하는 기술은 음성 텍스트 변환(STT) 모델 연구의 발전과 함께 성숙해 왔습니다. 이제 개발자는 복잡한 다국어 전사 파이프라인을 위해 강력한 STT API를 workflow에 통합할 수 있습니다.
이 글에서는 다국어 전사의 정의와 데스크톱 앱 및 API를 통한 작동 방식을 살펴보고, 전 세계 기업에 왜 필수적인지 알아보겠습니다.
요약
- 다국어 전사는 오디오 파일을 여러 언어의 서면 텍스트로 변환합니다.
- 최고의 다국어 전사 도구는 화자 분리, 키텀 프롬프팅, 엔터티 감지와 같은 추가 기능을 제공합니다.
- 다국어 전사 도구를 온라인에서 사용하거나 개발 workflow를 위해 텍스트 음성 변환 API 통합을 할 수 있습니다.
- 자동 전사는 속도와 규모를 처리하며, 여러 화자가 겹쳐 말하는 복잡한 경우에는 사람 전사가 유용할 수 있습니다.
- 다국어 전사의 정확도는 언어마다 달라지는 단어 오류율(WER)로 측정합니다.
다국어 전사란 무엇이며, 왜 중요할까요?
다국어 전사는 둘 이상의 언어로 말한 오디오를 서면 텍스트로 변환합니다. AI 시스템은 사용 중인 언어를 자동으로 감지하고 오디오를 전사합니다. 다국어 STT의 결과물은 원문 그대로의 전사본일 수도 있고, 입력 언어를 하나의 공통 출력으로 통합하는 번역 레이어를 포함할 수도 있습니다.
예를 들어 글로벌 컨퍼런스에서는 발표자가 모국어로 질문을 받을 수 있습니다. 다국어 음성 텍스트 변환 도구는 각 발표자의 말을 해당 언어로 직접 전사하거나, 청중이 읽을 수 있도록 대상 언어로 하나의 결과물을 만들 수 있습니다. 조직은 이러한 STT 도구를 사용해 행사 접근성을 높일 수 있습니다.
ElevenLabs는 다국어 STT 기능을 텍스트 음성 변환 Scribe v2 모델에 직접 탑재했습니다. Scribe v2는 자동 언어 감지를 지원하므로 하나의 파일에 여러 언어가 포함될 수 있습니다. 오디오 클립에 포함된 언어를 지정하거나 설정을 “감지”로 두면 시스템이 업로드된 파일에 포함된 언어를 식별합니다.
ElevenAPI를 사용할 때 language_code 파라미터는 기본적으로 자동 예측으로 설정됩니다. 포함된 언어를 이미 알고 있다면 미리 지정하면 성능이 향상됩니다.
다국어 전사가 중요한 이유
최근 연구에 따르면 전 세계 전사 서비스 시장은 2035년까지 60억 달러에 이를 것으로 예상됩니다. 다국어 STT를 활용하는 광범위한 사용 사례는 이러한 성장을 가속하는 요인 중 하나입니다.
다국어 전사가 중요한 실질적인 이유는 다음과 같습니다.
- 접근성: 자막과 캡션은 번역이나 더빙을 시작하기 전에 정확한 다국어 전사를 필요로 합니다. 다국어 STT는 사용자 접근성을 크게 높일 수 있습니다.
- 검색 가능성: 전사된 오디오는 색인 가능한 텍스트가 되어 지원 통화나 회의를 다른 사람에게 유용한 리소스로 만들 수 있습니다. AI 시스템이 내부 문서의 더 많은 데이터를 제공하기 시작하면서 검색 가능성은 특히 중요해지고 있으며, 명확한 전사는 포괄적인 입력 참조를 구축하는 데 도움이 됩니다.
- 규정 준수: 많은 규제 산업에서는 음성 상호작용에 대한 감사 가능한 서면 기록이 필요합니다. 다국어 STT를 사용하면 고객이 사용하는 모든 언어에서 이를 지원할 수 있습니다. 예를 들어 금융감독청은 금융기관이 전화 통화의 녹음 및 전사본을 보관해야 한다고 명시합니다.
- 글로벌 콘텐츠 파이프라인: 더빙이든 자막 제작이든, workflow는 항상 작업의 기반이 되는 매우 정확한 초기 전사본으로 시작합니다. 고품질 다국어 전사 도구는 이러한 광범위한 글로벌 콘텐츠 배포 workflow의 첫 단계를 가능하게 합니다.
다국어 전사는 다양한 산업에서 필수적입니다. 통신사는 지원 통화를 전사하고, 금융 서비스 기업은 규정 준수 요건을 충족하며, 의료팀은 환자 상호작용을 기록하고, 영화 스튜디오는 콘텐츠를 현지화합니다. SaaS, 여행, 공공 서비스 분야 어디에 있든 강력한 시스템을 갖추면 결과 전사본의 높은 품질과 정확성을 보장할 수 있습니다.
다국어 전사 솔루션에서 살펴볼 핵심 기능
다국어 전사 도구는 처리하는 오디오 입력에 맞춰 적응하고, 언어를 동적으로 식별하며 높은 정확도로 전사할 수 있어야 합니다.
고품질 다국어 전사 솔루션에서 확인할 주요 기능은 다음과 같습니다.
- 자동 언어 감지: 시스템은 사용자가 원본 언어를 제공할 때까지 전사를 막는 대신, 사용 언어를 스스로 식별해야 합니다. 입력 언어를 알 수 없거나 여러 언어가 포함된 클립 같은 상황에서는 자동 언어 감지를 통해 수동 설정 없이 여러 언어를 처리할 수 있습니다.
- 화자 분리: 화자 분리는 파일 내 전사된 텍스트를 올바른 화자에게 할당하는 기능으로, 여러 화자가 포함된 모든 오디오 전사에서 중요합니다. 예를 들어 구분해야 할 패널 토론 참가자가 여러 명일 수 있고, 고객과 지원 상담사가 말하는 시점을 명확히 구분해야 할 수도 있습니다. Scribe v2는 하나의 파일에서 최대 32명의 화자에 대한 화자 분리를 지원합니다.
- 키텀 프롬프팅: 키텀을 사용하면 정확한 전사를 위해 제품명이나 고유명사 같은 특정 어휘를 수동으로 입력할 수 있습니다. 배치 시스템에서 Scribe v2는 최대 1,000개의 키텀을 지원하며, 실시간 전사용 Scribe v2 Realtime은 최대 50개를 지원합니다.
- 엔터티 감지: 엔터티 감지는 전사본 내 특정 단어를 식별하며, 민감한 데이터를 보호하기 위한 규정 준수 및 보안 작업에 필수적입니다. 지원되는 56개 엔터티 유형의 전체 내용은 ElevenLabs 엔터티 감지 문서에서 확인하세요.
- 광범위한 언어 지원: 당연히 최고의 다국어 STT 솔루션은 매우 다양한 언어의 전사를 지원합니다. 참고로 Scribe v2는 90개 이상의 언어에서 정확한 전사를 제공합니다.
이러한 기능을 함께 활용하면 폭넓은 사용 사례를 지원하고, 여러 언어를 정확하게 처리하는 신뢰할 수 있는 STT 시스템을 활용할 수 있습니다.

다양한 언어의 오디오를 효율적으로 전사하는 방법
다양한 언어의 오디오를 전사하는 가장 효과적인 방법은 작업량에 따라 다릅니다. 일회성 배치 파일의 경우 ElevenLabs 텍스트 음성 변환 페이지에서 파일을 업로드하고 전사본을 빠르게 받을 수 있습니다.
ElevenCreative에서 오디오 전사는 다음처럼 간단합니다.
- 오디오 업로드: 텍스트 음성 변환으로 이동한 후 “파일 전사”를 클릭합니다.
- 옵션 선택: 기본 언어를 선택하거나 “감지”로 두고, 웃음이나 기타 비음성 이벤트에 태그를 추가하려면 오디오 이벤트를 켜고, 필요하면 키텀을 추가합니다.
- 결과 확인: 파일을 업로드한 후 오디오 파일 이름을 클릭하면 전사본을 볼 수 있습니다. 여기서 Transcript Editor에서 전사본을 직접 검토하고 다듬은 다음, 각 후속 workflow에 필요한 형식으로 내보낼 수 있습니다.
프로그래밍 방식 또는 대용량 전사에는 텍스트 음성 변환 API를 사용하세요. 프로덕션 파이프라인을 구성할 때 활용할 수 있는 몇 가지 세부 사항은 다음과 같습니다.
- 모델 선택: model_id 파라미터는 scribe_v2와 scribe_v1 중에서 선택하므로, 시간이 지나며 바뀔 수 있는 기본값에 의존하지 않고 파이프라인에서 특정 모델을 지정할 수 있습니다.
- 언어 처리: language_code 파라미터는 ISO-639-1 또는 ISO-639-3 코드를 허용하며, 설정하지 않으면 자동 감지가 기본으로 적용됩니다. 언어를 직접 제공하면 성능이 향상될 수 있습니다.
- 화자 분리 제어: diarize를 true로 설정하면 누가 말하고 있는지 주석을 추가합니다. num_speakers 파라미터는 인원을 1명에서 32명 사이로 제한합니다. 더 세밀하게 제어하려면 diarization_threshold 파라미터를 사용하여 서로 다른 화자 간의 균형을 조정할 수 있습니다.
- 타임스탬프 정밀도: timestamps_granularity 파라미터는 출력 세부 수준을 제어하며, 단어 수준 또는 문자 수준 타임스탬프(또는 없음)를 선택할 수 있습니다.
- 대규모 비동기 처리: webhook을 true로 설정하면 즉시 응답을 반환하고, 처리가 완료되면 구성한 webhook으로 완성된 전사본을 전달합니다. webhook_metadata 필드는 내부 작업 ID와 같은 사용자 지정 추적 데이터를 각 webhook 응답에 추가합니다.
- 멀티채널 오디오: use_multi_channel을 true로 설정하면 최대 5개 채널을 각각 독립적으로 전사하고, 모든 단어에 channel_index 필드를 태그로 추가합니다.
- 특수 콘텐츠 처리: keyterms 파라미터는 최대 1,000개의 특정 단어나 구문에 맞춰 전사 결과를 조정하고, entity_detection은 PII 및 기타 민감한 데이터를 표시하며, no_verbatim은 출력에서 군더더기 말과 잘못 시작한 표현을 제거합니다.
이 파라미터를 함께 사용하면 파이프라인의 모든 단계를 세밀하게 제어할 수 있습니다. 언어 감지와 화자 레이블 지정부터 출력 형식 지정 및 전달까지, 텍스트 음성 변환 API는 프로덕션 요구 사항에 맞춰 적용됩니다.

전사 서비스 지원 언어 설명
언어 지원 범위는 최고의 다국어 전사 도구를 차별화하는 주요 요소입니다. ElevenLabs Scribe v2와 Scribe v2 Realtime은 모두 90개 이상의 언어를 지원하며, 텍스트 음성 변환 문서에서 지원 언어 전체 목록을 확인할 수 있습니다.
영어, 스페인어, 이탈리아어, 폴란드어, 프랑스어, 독일어 같은 언어는 학습 데이터의 양이 더 많아 STT 정확도가 더 높은 경우가 많습니다. 암하라어, 간다어, 요루바어, 줄루어 같은 일부 언어는 앞서 언급한 언어보다 정확도가 낮습니다.
ElevenLabs Scribe 모델은 36개 언어에서 5% 미만의 단어 오류율을 제공하며, 다른 21개 언어에서는 10% 미만의 WER을 제공합니다. 지원 언어와 각 언어의 WER에 관한 자세한 내용은 ElevenLabs 언어 지원 세부 정보를 참조하세요.
다국어 전사 비용은 얼마인가요?
일반적으로 자동 전사의 가격은 단어 수나 사용 언어 수가 아니라 오디오 파일의 길이를 기준으로 책정됩니다. ElevenLabs는 오디오 길이를 기준으로 텍스트 음성 변환 비용을 청구하며, 오디오 시간당 과금합니다. 구체적인 요금은 요금제와 모델에 따라 다릅니다.
다국어 전사 가격에 영향을 미치는 주요 요인은 다음과 같습니다.
- 추가 전사 기능: 일부 제공업체는 엔터티 감지와 같은 특정 기능을 활성화하는 데 추가 요금을 부과합니다.
- 멀티채널 오디오의 채널별 과금: use_multi_channel을 활성화하면 각 채널이 독립적으로 과금되므로, 2채널 녹음은 1채널 녹음보다 비용이 약 두 배입니다.
- 언어는 기본 요금에 영향을 주지 않음: 길이 기반 가격 책정은 다국어 STT가 동일한 시간당 요금을 유지하면서 모든 언어를 지원할 수 있음을 의미하므로, 여러 언어를 다루는 팀의 예산 수립을 간소화합니다.
ElevenLabs 텍스트 음성 변환 비용에 대한 자세한 내용은 가격 페이지를 참조하세요.
정확한 다국어 전사를 위한 ElevenAPI 시작하기
ElevenAPI는 단 몇 단계만으로 모든 프로덕션 workflow에 다국어 전사를 도입합니다. 글로벌 미디어 아카이브, 고객 지원 상호작용, 회의 또는 연구 인터뷰를 위한 콘텐츠를 전사하든, 수십 개 언어에서 정확한 음성 인식을 원하든, 강력한 다국어 STT 엔진이 도움을 드릴 수 있습니다.
ElevenAPI 텍스트 음성 변환 API의 모든 기능을 살펴보거나 ElevenLabs 계정 만들기로 지금 다국어 오디오 전사를 시작하세요.
다국어 전사 FAQ
Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.




