콘텐츠로 건너뛰기

Scribe v2 소개

게시일

듣기이 글 오디오로 듣기

Scribe v2는 대규모 일괄 전사, 자막 및 캡션 작업을 위해 설계되었습니다. 긴 형식의 오디오, 휴지, 톤 변화, 긴 무음 구간을 더 효과적으로 처리해 Scribe v1보다 안정성과 정확도를 높였습니다.

Introducing Scribe v2

Scribe v2 Realtime은 초저지연과 에이전트 활용 사례에 최적화된 반면, Scribe v2는 길고 복잡한 녹음에 최적화되어 다양한 화자, 억양, 말하기 스타일에서도 정확도를 유지합니다. 그 결과, 폭넓은 실제 오디오 환경에서 일관되게 신뢰할 수 있는 전사 결과를 제공합니다.


Scribe v2는 업계 표준 벤치마크에서 기록된 가장 낮은 단어 오류율을 달성했습니다.

Scribe v2 FLEURS benchmark

문맥을 이해하는 전사를 위한 키텀 프롬프팅

키텀 프롬프팅은 전사문의 문맥을 활용해 일반적인 맞춤 어휘 기능을 뛰어넘습니다. 최대 100개의 단어 또는 구문을 선택하면 Scribe v2가 해당 용어를 언제 전사할지 정확하게 판단합니다. 따라서 전문 분야, 브랜드명, 산업별 용어에 특히 적합합니다.

Scribe v2 keyterm prompting

정확한 타임스탬프를 제공하는 내장 엔터티 감지

Scribe v2에는 구조화된 오디오 분석을 위한 네이티브 엔터티 감지 기능이 포함되어 있습니다.

개인 식별 정보, 건강 데이터, 결제 정보에 걸쳐 최대 56개의 카테고리를 선택할 수 있습니다. Scribe v2는 전사문에서 이러한 항목과 정확한 타임스탬프를 자동으로 감지하여, 민감한 정보를 대규모로 검토, 삭제 또는 처리하기 쉽게 만듭니다.

API 문서에서 자세히 알아보기: https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection

자동 다국어 전사

Scribe v2는 별도 설정 없이 스마트 다국어 workflow를 지원합니다.

여러 언어가 포함된 오디오를 단일 파일로 전송할 수 있습니다. 모델이 각 언어를 자동으로 감지하고, 수동 분할이나 설정 없이 정확하게 전사합니다.

프로덕션 workflow를 위한 추가 기능

Scribe v2는 엔터프라이즈 및 개발자 활용 사례를 위해 설계된 다양한 기능을 제공합니다:

  • 명확하고 직관적인 화자 라벨링을 위한 스마트 화자 분리
  • 정확한 자막 정렬과 인터랙티브 경험을 위한 정밀한 단어 단위 타임스탬프
  • 웃음이나 발소리 같은 비음성 이벤트를 감지하는 동적 오디오 태깅
  • SOC 2, ISO 27001, PCI DSS L1, HIPAA, GDPR 준수, EU 및 인도 데이터 레지던시, 제로 리텐션 모드 지원을 갖춘 엔터프라이즈 수준의 준비성

이제 ElevenLabs Studio에서 만나는 Scribe v2

Scribe v2는 이제 ElevenLabs Studio에서 더 정확한 자막, 캡션, 전사를 제공하며, 마케팅, 미디어, 연구, 교육, 규정 준수 분야에서 대규모 오디오 및 비디오 라이브러리를 관리하는 팀을 지원합니다.

Scribe v2 in Studio

지금 사용해 보기: https://elevenlabs.io/app/studio

API로 구축하기

Scribe v2를 사용하면 개발자와 엔터프라이즈는 복잡한 오디오 파이프라인을 자동화하고, 글로벌 콘텐츠 workflow의 정확도를 높이며, 완전한 규정 준수 및 데이터 레지던시 제어를 통해 안전하게 확장할 수 있습니다.

Scribe v2 Keyterm prompting code snippet

Scribe v2는 지금 API와 Creative 플랫폼에서 사용할 수 있습니다.

지금 사용해 보기: https://elevenlabs.io/app/speech-to-text

문서 읽기: https://elevenlabs.io/docs/capabilities/speech-to-text

여기에서 가입하기: https://elevenlabs.io/speech-to-text

유사한 기사

최고 품질의 AI 오디오로 창작하세요