콘텐츠로 건너뛰기

다국어 전사란 무엇이며, 어떻게 작동하나요?

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

국제 콘퍼런스를 개최하든, 어떤 언어로든 고객 지원 대화의 정확한 기록이 필요하든, 다국어 전사는 그 어느 때보다 중요해졌습니다. 

다국어 전사 도구는 오디오 데이터를 정확하고 검색 가능한 텍스트로 변환해 대화를 활용 가능한 기록으로 만듭니다. 여러 언어에 걸친 전사를 가능하게 하는 기술은 음성 텍스트 변환(STT) 모델 연구가 발전하면서 함께 성숙해 왔습니다. 이제 개발자는 복잡한 다국어 전사 파이프라인을 위해 강력한 STT API를 workflow에 통합할 수도 있습니다.

이 글에서는 다국어 전사가 무엇인지, 데스크톱 앱과 API를 통해 어떻게 작동하는지, 그리고 전 세계 기업에 왜 필수적인지 살펴보겠습니다.

요약

  • 다국어 전사는 오디오 파일을 여러 언어의 텍스트로 변환합니다.
  • 최고의 다국어 전사 도구는 화자 분리, 키텀 프롬프팅, 엔터티 감지와 같은 추가 기능을 제공합니다.
  • 다국어 전사 도구를 온라인으로 사용하거나 개발 workflow를 위해 음성 텍스트 변환 API 통합을 할 수 있습니다. 
  • 자동 전사는 속도와 규모를 처리하며, 여러 화자가 겹쳐 말하는 복잡한 경우에는 사람 전사가 유용할 수 있습니다.
  • 다국어 전사의 정확도는 언어별로 달라지는 단어 오류율(WER)로 측정합니다. 

다국어 전사란 무엇이며, 왜 중요할까요?

다국어 전사는 두 가지 이상의 언어로 된 음성 오디오를 텍스트로 변환합니다. AI 시스템은 사용 중인 언어를 자동으로 감지하고 오디오를 전사합니다. 다국어 STT의 결과물은 발화를 그대로 옮긴 전사문일 수도 있고, 입력 언어를 공통 출력 언어로 통합하는 번역 레이어를 포함할 수도 있습니다. 

예를 들어 글로벌 콘퍼런스에서는 발표자가 모국어로 질문을 받을 수 있습니다. 다국어 음성 텍스트 변환 도구는 각 발표자의 말을 해당 언어로 직접 전사하거나, 청중이 읽을 수 있도록 대상 언어로 하나의 결과물을 만들 수 있습니다. 조직은 이러한 STT 도구를 활용해 행사 접근성을 높일 수 있습니다.

ElevenLabs는 다국어 STT 기능을 텍스트 음성 변환 Scribe v2 모델에 직접 탑재했습니다. Scribe v2는 자동 언어 감지를 지원하므로 하나의 파일에 여러 언어가 포함될 수 있습니다. 오디오 클립에 포함된 언어를 지정하거나 설정을 “감지”로 두면 시스템이 업로드한 파일에 포함된 언어를 식별합니다.

ElevenAPI 사용 시 language_code 파라미터는 기본적으로 자동 예측으로 설정됩니다. 포함된 언어를 이미 알고 있다면 미리 제공하면 성능이 향상됩니다. 

다국어 전사가 중요한 이유

최근 연구에 따르면 전 세계 전사 서비스 시장은 2035년까지 60억 달러에 이를 것으로 예상됩니다. 다국어 STT를 활용하는 폭넓은 사용 사례가 이러한 성장의 한 요인입니다.

다국어 전사가 중요한 실질적인 이유는 다음과 같습니다.

  • 접근성: 캡션과 자막은 번역이나 더빙을 시작하기 전에 정확한 다국어 전사가 필요합니다. 다국어 STT는 사용자 접근성을 크게 높일 수 있습니다.
  • 검색 가능성: 전사된 오디오는 색인 가능한 텍스트가 되어 지원 통화나 회의를 다른 사람에게 유용한 리소스로 만들 수 있습니다. AI 시스템이 내부 문서에서 더 많은 데이터를 찾아 제시하기 시작하면서 검색 가능성은 특히 중요해지고 있으며, 명확한 전사는 포괄적인 입력 참조 자료를 구축하는 데 도움이 됩니다. 
  • 규정 준수: 많은 규제 산업에서는 음성 상호작용에 대한 감사 가능한 서면 기록이 필요합니다. 다국어 STT를 사용하면 고객이 사용하는 모든 언어로 이를 지원할 수 있습니다. 예를 들어 금융행위감독청은 금융기관이 전화 통화의 녹음과 전사본을 보관해야 한다고 명시합니다.
  • 글로벌 콘텐츠 파이프라인: 더빙이든 자막 제작이든, workflow는 항상 작업의 기반이 될 매우 정확한 초기 전사문으로 시작합니다. 고품질 다국어 전사 도구는 더 폭넓은 글로벌 콘텐츠 배포 workflow의 첫 단계를 가능하게 합니다.

다국어 전사는 다양한 산업에서 필수적입니다. 통신사는 지원 통화를 전사하고, 금융 서비스 기업은 규정 준수 요건을 충족하며, 의료팀은 환자 상호작용을 기록하고, 영화 스튜디오는 콘텐츠를 현지화합니다. SaaS, 여행, 공공 서비스 등 어떤 분야에서든 강력한 시스템을 갖추면 결과 전사문의 품질과 정확성을 항상 높게 유지할 수 있습니다.

다국어 전사 솔루션에서 살펴볼 주요 기능

다국어 전사 도구는 처리하는 오디오 입력에 맞춰 적응하고, 언어를 동적으로 식별해 높은 정확도로 전사할 수 있어야 합니다. 

고품질 다국어 전사 솔루션에서 살펴봐야 할 주요 기능은 다음과 같습니다.

  • 자동 언어 감지: 시스템은 사용자가 원본 언어를 입력할 때까지 전사를 막는 대신, 발화 언어를 스스로 식별해야 합니다. 입력 언어를 알 수 없거나 여러 언어가 포함된 클립에서는 자동 언어 감지를 통해 수동 설정 없이 여러 언어를 처리할 수 있습니다.
  • 화자 분리: 화자 분리는 파일의 전사 텍스트를 올바른 화자에게 할당하는 기능으로, 여러 화자가 포함된 모든 오디오 전사에서 중요합니다. 예를 들어 패널에 참여한 여러 인물을 구분해야 하거나, 고객과 상담원이 말하는 구간을 명확히 구분해야 할 수 있습니다. Scribe v2는 하나의 파일에서 최대 32명의 화자를 분리할 수 있습니다. 
  • 키텀 프롬프팅: 키텀을 사용하면 제품명이나 고유명사처럼 정확한 전사를 위해 필요한 특정 어휘를 수동으로 입력할 수 있습니다. 배치 시스템에서 Scribe v2는 최대 키텀 1,000개를 지원하며, 실시간 전사용 Scribe v2 Realtime은 최대 50개를 지원합니다.
  • 엔터티 감지: 엔터티 감지는 전사문에서 특정 단어를 식별하는 기능으로, 민감한 데이터를 보호하기 위한 규정 준수 및 보안 작업에 필수적입니다. 지원되는 56가지 엔터티 유형의 전체 내용은 ElevenLabs 엔터티 감지 문서에서 확인하세요.
  • 폭넓은 언어 지원: 당연히 최고의 다국어 STT 솔루션은 매우 다양한 언어의 전사를 지원합니다. 예를 들어 Scribe v2는 90개 이상의 언어를 정확하게 전사합니다. 

이러한 기능을 함께 활용하면 폭넓은 사용 사례를 지원하며, 여러 언어를 정확하게 처리하는 신뢰할 수 있는 STT 시스템을 사용할 수 있습니다.

Key features of a multilingual transcription tool: language detection, speaker diarization, and more.

여러 언어의 오디오를 효율적으로 전사하는 방법

여러 언어의 오디오를 전사하는 가장 효과적인 방법은 작업량에 따라 달라집니다. 일회성 배치 파일의 경우 ElevenLabs 텍스트 음성 변환 페이지에서 파일을 업로드하고 빠르게 전사문을 받을 수 있습니다.

ElevenCreative에서 오디오 전사는 다음처럼 간단합니다.

  1. 오디오 업로드: 텍스트 음성 변환으로 이동해 “파일 전사”를 클릭하세요.
  2. 옵션 선택: 기본 언어를 선택하거나 “감지”로 두고, 웃음이나 기타 비음성 이벤트에 태그를 지정하려면 오디오 이벤트를 켜세요. 필요에 따라 키텀도 추가할 수 있습니다.
  3. 결과 확인: 파일을 업로드한 후 오디오 파일 이름을 클릭하면 전사문을 확인할 수 있습니다. 여기서 Transcript Editor에서 전사문을 직접 검토하고 다듬은 뒤, 이후 각 workflow에 필요한 형식으로 내보낼 수 있습니다.

프로그래밍 방식 또는 대용량 전사에는 텍스트 음성 변환 API를 사용하세요. 프로덕션 파이프라인을 구성할 때 활용할 수 있는 몇 가지 세부 사항은 다음과 같습니다.

  • 모델 선택: model_id 파라미터는 scribe_v2와 scribe_v1 중 하나를 선택하므로, 시간이 지나 변경될 수 있는 기본값에 의존하지 않고 파이프라인에서 특정 모델을 지정할 수 있습니다.
  • 언어 처리: language_code 파라미터는 ISO-639-1 또는 ISO-639-3 코드를 허용하며, 설정하지 않으면 기본적으로 자동 감지가 적용됩니다. 언어를 직접 지정하면 성능이 향상될 수 있습니다.
  • 화자 분리 제어: diarize를 true로 설정하면 말하고 있는 화자가 표시됩니다. num_speakers 파라미터는 화자 수를 1명에서 32명 사이로 제한합니다. 더 세밀하게 제어하려면 diarization_threshold 파라미터를 사용해 서로 다른 화자를 구분하는 기준의 균형을 조정할 수 있습니다. 
  • 타임스탬프 정밀도: timestamps_granularity 파라미터는 출력 세부 수준을 제어하며, 단어 단위 또는 문자 단위 타임스탬프(또는 없음)를 선택할 수 있습니다.
  • 대규모 비동기 처리: webhook을 true로 설정하면 즉시 응답을 반환하고, 처리가 완료되면 구성한 webhook으로 완성된 전사문을 전달합니다. webhook_metadata 필드는 내부 작업 ID와 같은 맞춤 추적 데이터를 각 webhook 응답에 첨부합니다.
  • 멀티채널 오디오: use_multi_channel을 true로 설정하면 최대 5개 채널을 각각 독립적으로 전사하며, 모든 단어에 channel_index 필드를 태그로 추가합니다. 
  • 전문 콘텐츠 처리: keyterms 파라미터는 최대 1,000개의 특정 단어 또는 문구에 맞춰 전사 결과를 유도하고, entity_detection은 PII 및 기타 민감한 데이터를 표시하며, no_verbatim은 출력에서 추임새와 잘못 시작한 발화를 제거합니다.

이러한 파라미터를 함께 사용하면 파이프라인의 모든 단계를 세밀하게 제어할 수 있습니다. 언어 감지와 화자 라벨링부터 출력 형식과 전송까지, 텍스트 음성 변환 API는 프로덕션 요구 사항에 맞게 조정됩니다.

Speech to Text API features include language detection, speaker diarization, timestamps, and entity detection.

전사 서비스의 지원 언어 알아보기

언어 지원 범위는 최고의 다국어 전사 도구를 구분하는 핵심 요소입니다. ElevenLabs Scribe v2와 Scribe v2 Realtime은 모두 90개 이상의 언어를 지원하며, 텍스트 음성 변환 문서에서 지원 언어 전체 목록을 확인할 수 있습니다.

영어, 스페인어, 이탈리아어, 폴란드어, 프랑스어, 독일어와 같은 언어는 학습 데이터가 더 많아 일반적으로 정확도가 더 높은 STT를 제공합니다. 암하라어, 간다어, 요루바어, 줄루어와 같은 일부 언어는 앞서 언급한 언어보다 정확도가 낮습니다.

ElevenLabs Scribe 모델은 36개 언어에서 5% 미만의 단어 오류율을, 다른 21개 언어에서 10% 미만의 WER을 기록합니다. 지원 언어와 해당 WER에 관한 자세한 내용은 ElevenLabs 언어 지원 세부 정보를 참조하세요.

다국어 전사 비용은 얼마인가요?

일반적으로 자동 전사 요금은 단어 수나 사용 언어 수가 아닌 오디오 파일 길이를 기준으로 책정됩니다. ElevenLabs는 오디오 길이에 따라 텍스트 음성 변환 요금을 청구하며, 오디오 시간당 과금됩니다. 구체적인 요금은 플랜과 모델에 따라 다릅니다.

다국어 전사 요금에 영향을 미치는 주요 요소는 다음과 같습니다.

  • 추가 전사 기능: 일부 제공업체는 엔터티 감지와 같은 특정 기능을 활성화할 때 추가 요금을 청구합니다.
  • 멀티채널 오디오는 채널별 과금: use_multi_channel을 활성화하면 각 채널이 독립적으로 과금되므로, 2채널 녹음은 단일 채널 녹음보다 비용이 약 2배입니다.
  • 언어는 기본 요금에 영향을 주지 않음: 길이 기반 요금제에서는 다국어 STT가 어떤 언어든 동일한 시간당 요금으로 지원하므로, 여러 언어를 다루는 팀의 예산 관리가 간편해집니다.

ElevenLabs 텍스트 음성 변환 비용에 관한 자세한 내용은 요금 페이지를 참조하세요.

정확한 다국어 전사를 위한 ElevenAPI 시작하기

ElevenAPI를 사용하면 몇 단계만으로 모든 프로덕션 workflow에 다국어 전사를 도입할 수 있습니다. 글로벌 미디어 아카이브용 콘텐츠, 고객 지원 상호작용, 회의, 연구 인터뷰를 전사하든, 수십 개 언어에서 정확한 음성 인식이 필요하든, 강력한 다국어 STT 엔진이 도움을 드릴 수 있습니다.

ElevenAPI 텍스트 음성 변환 API에서 전체 기능을 확인하거나, ElevenLabs 계정 만들기를 통해 지금 다국어 오디오 전사를 시작하세요. 

다국어 전사 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요