- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
전례 없는 트랜스크립션 정확도
Scribe v2는 업계 최고 수준의 트랜스크립션 정확도를 제공하며, 까다로운 오디오 환경이나 다양한 억양에서도 깔끔하고 편집 가능한 텍스트를 생성합니다.
모든 상황을 고려한 설계
소음이 많은 환경, 배경 음악, 강한 억양, 낮은 품질의 오디오에서도 작동하는 트랜스크립션입니다.
타이밍, 화자, 비음성 이벤트를 세밀하게 제어하세요.
ElevenLabs 트랜스크립션 API는 웃음, 감정, 음향 효과를 감지할 수 있습니다. 키텀 프롬프팅으로 도메인별 용어에 맞춰 트랜스크립션을 유도하세요.
오디오 및 비디오 트랜스크립션
.webp&w=3840&q=95)
깔끔하고 편집 가능한 트랜스크립션
.webp&w=3840&q=95)
키텀 프롬프팅

동적 오디오 태깅
웃음, 박수, 음악, 배경 소음과 같은 비음성 이벤트를 포착합니다. 트랜스크립션에는 단어뿐 아니라 오디오의 전체 맥락이 담깁니다.
스마트 화자 분리
최대 48명의 화자를 자동으로 식별하고 라벨링합니다. 누가 무엇을 말했는지 명확하게 구분해 읽기 쉬운 트랜스크립션으로 정리합니다.
개체 감지
트랜스크립션 내에서 이름, 날짜, 위치, 조직을 포함한 56가지 개체 유형을 자동으로 식별하고 태그합니다.
Scribe v2 Medical로 임상 오디오 트랜스크립션
의약품명, 해부학, 병리학 용어 인식을 강화해 의료 트랜스크립션 및 임상 workflow에 최적화한 텍스트 음성 변환 모델입니다.

임상 음성 트랜스크립션
의료진-환자 대화, 의사 구술, 환자 접수 내용을 정확한 텍스트로 변환합니다. 의료진 검토는 물론 기록, 코딩, 후속 문서화 workflow에 바로 활용할 수 있습니다.

의학 용어 오류 감소
term-WER 기준으로 Scribe v2 Medical은 Eka Medical ASR 테스트 분할에서 Scribe v2보다 오류가 15% 적으며, 임상 어휘 전반에서 의료 음성 인식 성능이 향상되었습니다.

Scribe v2 Realtime
실시간 작업을 위한 최저 지연 시간 모델입니다.
- 150ms 미만 지연 시간
- 90개 이상 언어
- 트랜스크립션 스트리밍
- 음성 활동 감지
- 자동 언어 인식

Scribe v2 Medical
임상 트랜스크립션을 위한 의료 Finetune 모델입니다.
- 의료 어휘 튜닝
- 90개 이상 언어 트랜스크립션
- 일상 음성에서 Scribe v2와 동일한 성능
- 의약품명 인식 향상
- 엔터프라이즈 고객 대상 HIPAA 적격
90개 이상의 언어와 폭넓은 억양으로 음성을 트랜스크립션하세요
억양, 방언, 녹음 조건 전반에서 탁월한 정확도를 제공합니다.
언어를 미리 보려면 languageCode를 변경하세요
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // 언어 설정
diarize: true
});
console.log(transcription);


