음성-텍스트란 무엇인가요?
음성-텍스트란 무엇인가요?
음성-텍스트는 음성 오디오를 글로 변환합니다. ElevenLabs의 음성-텍스트 모델은 Scribe입니다. 90개 이상의 언어로 음성을 정확하게 전사하여 오디오를 읽고 검색할 수 있는 텍스트로 쉽게 변환할 수 있습니다.
Scribe 주요 기능
- 영어, 프랑스어, 이탈리아어, 포르투갈어, 스페인어, 독일어 등 주요 언어에서 98%의 정확도를 제공하는 업계 최고 수준의 정확도
- 단어별 정확한 타임스탬프로 각 단어가 언제 발화되었는지 정확히 확인 가능
- 서로 다른 화자를 자동으로 식별하고 분리하는 스마트 화자 분리
- 비음성 소리를 감지하는 동적 오디오 태깅
- 높은 정확도를 유지하면서 최대 32명의 화자 지원
Scribe v2의 새로운 기능
Scribe v2는 더 까다로운 사용 사례를 위해 설계된 추가 기능을 갖춘 핵심 모델입니다.
- 키워드 프롬프팅. 중요한 용어를 올바르게 전사하도록 모델을 안내하기 위해 최대 100개의 단어 또는 문구를 제공할 수 있습니다. 키워드 프롬프팅을 사용하면 비용이 20% 증가합니다.
- 엔터티 감지. 신용카드 번호, 이름 또는 질환 등 전사문에서 감지할 특정 정보 카테고리를 선택할 수 있습니다. 엔터티 감지는 API에서만 사용할 수 있으며 비용이 30% 증가합니다.
- 스마트 다국어 지원. 여러 언어가 포함된 오디오를 제출하면 Scribe v2가 각 언어를 자동으로 감지하고 정확하게 전사합니다.
- 향상된 안정성. Scribe v2는 일시 정지, 톤 변화, 긴 침묵도
끊김이나 정확도 저하 없이 처리합니다.
어떤 버전을 사용해야 하나요?
높은 정확도의 전사가 필요한 경우 Scribe v2를 권장합니다. 웹사이트와 API를 통해 사용할 수 있습니다. 웹사이트에서 음성-텍스트를 사용할 경우 Scribe v2가 기본 모델입니다.
의료 및 임상 오디오에는 동일한 API를 통해 Scribe v2 Medical (scribe_v2_medical)을 사용하세요. Scribe v2와 동일한 요금이 적용됩니다.
실시간 사용 사례에는 ElevenAgents 및 API를 통해 제공되는 Scribe v2 Realtime을 권장합니다.
자세한 내용은 음성-텍스트 문서를 참조하세요.