Scribe v2のご紹介
- 公開日
Scribe v2は、バッチ文字起こし、大規模な字幕・キャプション作成のために設計されています。Scribe v1の安定性と精度をさらに高め、長時間オーディオ、間、声のトーンの変化、長い無音もより適切に処理します。

Scribe v2 Realtimeは超低レイテンシーとエージェントのユースケースに最適化されている一方、Scribe v2は長時間かつ複雑な録音向けに最適化されています。話者、アクセント、話し方が多様でも精度を維持し、幅広い実環境のオーディオ条件で一貫して信頼性の高い文字起こしを実現します。
Scribe v2は、業界標準ベンチマークで記録された中で最も低い単語誤り率を達成しています。

文脈を理解する文字起こしのためのキータームプロンプティング
キータームプロンプティングは、文字起こしの文脈を活用し、標準のカスタム語彙を超える機能です。最大100個の単語やフレーズを選択すると、Scribe v2がそれらの用語を文字起こしすべきタイミングを正確に判断します。技術分野、ブランド名、業界固有の言葉に適しています。

高精度なタイムスタンプを備えた組み込みエンティティ検出
Scribe v2には、構造化されたオーディオ分析のためのネイティブのエンティティ検出機能が搭載されています。
個人識別情報、健康データ、支払い情報にわたる最大56のカテゴリを選択できます。Scribe v2が該当する情報とその正確なタイムスタンプを文字起こし内で自動検出するため、機密情報のレビュー、編集、処理を大規模に行いやすくなります。
詳しくはAPIドキュメントをご覧ください:https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection
自動多言語文字起こし
Scribe v2は、すぐに使えるスマートな多言語ワークフローに対応しています。
複数の言語を含むオーディオを1つのファイルとして送信できます。手動での分割や設定をしなくても、モデルが各言語を自動で検出し、正確に文字起こしします。
本番ワークフロー向けの追加機能
Scribe v2には、エンタープライズおよびデベロッパーのユースケース向けに設計された機能が揃っています:
- 明確で直感的な話者ラベル付けを実現するスマート話者ダイアライゼーション
- 正確な字幕アラインメントとインタラクティブな体験を実現する、精密な単語レベルのタイムスタンプ
- 笑い声や足音など、音声以外のイベントを検出する動的オーディオタグ付け
- SOC 2、ISO 27001、PCI DSS L1、HIPAA、GDPRへの準拠、EUおよびインドでのデータレジデンシー、ゼロ保持モードのサポートを備えたエンタープライズ対応
Scribe v2、ElevenLabs Studioで利用可能に
Scribe v2は現在ElevenLabs Studioで利用されており、より正確な字幕、キャプション、文字起こしを実現します。マーケティング、メディア、研究、トレーニング、コンプライアンスにおいて、大規模なオーディオ・ビデオライブラリを管理するチームを支援します。

今すぐ試す:https://elevenlabs.io/app/studio
APIで構築する
Scribe v2を使えば、デベロッパーやエンタープライズは複雑なオーディオパイプラインを自動化し、グローバルなコンテンツワークフローの精度を向上させ、コンプライアンスとデータレジデンシーを完全に管理しながら安全にスケールできます。

Scribe v2は本日より、APIおよびCreativeプラットフォームでご利用いただけます。
今すぐ試す:https://elevenlabs.io/app/speech-to-text
ドキュメントを読む:https://elevenlabs.io/docs/capabilities/speech-to-text




