강제 정렬

ElevenLabs로 음성 오디오와 텍스트를 시간에 맞춰 정렬된 트랜스크립트로 변환하는 방법을 알아보세요.

개요

ElevenLabs 강제 정렬 API는 음성 오디오와 텍스트를 시간에 맞춰 정렬된 트랜스크립트로 변환합니다. 오디오 녹음과 트랜스크립트는 있지만 트랜스크립트의 각 단어 또는 구문에 대한 정확한 타임스탬프가 필요한 경우에 유용합니다. 다음과 같은 용도로 사용할 수 있습니다.

  • 자막을 비디오 녹화물에 맞추기
  • 전자책 오디오북 녹음의 타이밍 생성

사용 방법

ElevenLabs API와 직접 연동하여 강제 정렬 API를 사용할 수 있습니다.

지원 언어

다국어 v2 모델은 29개 언어를 지원합니다.

영어(미국, 영국, 호주, 캐나다), 일본어, 중국어, 독일어, 힌디어, 프랑스어(프랑스, 캐나다), 한국어, 포르투갈어(브라질, 포르투갈), 이탈리아어, 스페인어(스페인, 멕시코), 인도네시아어, 네덜란드어, 터키어, 필리핀어, 폴란드어, 스웨덴어, 불가리아어, 루마니아어, 아랍어(사우디아라비아, UAE), 체코어, 그리스어, 핀란드어, 크로아티아어, 말레이어, 슬로바키아어, 덴마크어, 타밀어, 우크라이나어 및 러시아어.

주요 정보

  • 입력 텍스트 형식: 일반 문자열만 지원 — 입력 텍스트를 JSON 또는 다른 구조로 감싸지 마세요.
  • 화자 분리: 지원하지 않음. 화자 분리된 텍스트를 제공하면 예상치 못한 결과가 발생합니다.
  • 가격: 음성 텍스트 변환 API와 동일한 요금
  • 최대 파일 크기: 3GB
  • 최대 오디오 길이: 10시간
  • 최대 텍스트 길이: 675,000자