- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
かつてない文字起こし精度
Scribe v2は業界最高水準の文字起こし精度を実現。厳しい音声条件や多様なアクセントでも、編集しやすいクリーンなテキストを生成します。
あらゆるシナリオに対応
ノイズの多い環境、バックグラウンド音楽、強いアクセント、低品質な音声にも対応する文字起こし。
タイミング、話者、非音声イベントを細かく制御。
ElevenLabs Transcription APIは、笑い声、感情、サウンドエフェクトを検出できます。キータームプロンプティングを使えば、ドメイン固有の用語に沿って文字起こしを誘導できます。
オーディオとビデオを文字起こし
.webp&w=3840&q=95)
クリーンで編集可能な文字起こし
.webp&w=3840&q=95)
キータームプロンプティング

動的オーディオタグ付け
笑い声、拍手、音楽、バックグラウンドノイズなどの非音声イベントを捉えます。文字起こしには言葉だけでなく、音声の完全な文脈が含まれます。
スマート話者ダイアライゼーション
最大48人の話者を自動で識別・ラベル付けします。誰が何を話したかを明確に示し、読みやすい文字起こしに整理します。
エンティティ検出
文字起こし内の名前、日付、場所、組織などを含む56種類のエンティティを自動で識別・タグ付けします。
Scribe v2 Medicalで臨床音声を文字起こし
医療文字起こしと臨床ワークフロー向けに最適化されたスピーチtoテキストモデルです。薬剤名、解剖学用語、病理学用語の認識を強化しています。

臨床音声を文字起こし
医療従事者と患者の会話、医師の口述、患者の問診内容を正確なテキストに変換。医療従事者による確認や、ノート、コーディング、後続の文書作成ワークフローにすぐ活用できます。

医療用語の誤認識を削減
用語WERでは、Scribe v2 MedicalはEka Medical ASRテスト分割でScribe v2よりエラーを15%削減。臨床用語全般で医療音声認識を向上させています。
90以上の言語と幅広いアクセントの音声を文字起こし
アクセント、方言、録音条件を問わず、優れた精度を実現します。
languageCodeを変更して言語をプレビュー
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // 言語を設定
diarize: true
});
console.log(transcription);




