スピーチtoテキストとは何ですか?
スピーチtoテキストとは何ですか?
スピーチtoテキストは、話し言葉のオーディオを文章テキストに変換します。ElevenLabsのスピーチtoテキストモデルはScribeです。90以上の言語の音声を高精度で文字起こしでき、オーディオを読みやすく検索可能なテキストへ簡単に変換できます。
Scribeの主な機能
- 英語、フランス語、イタリア語、ポルトガル語、スペイン語、ドイツ語などの主要言語で98%の精度を実現する、業界最高水準の精度。
- 単語単位の正確なタイムスタンプにより、各単語が発話された時点を正確に確認できます。
- 話者を自動的に識別・分離するスマート話者ダイアライゼーション。
- 非音声を検出する動的オーディオタグ付け。
- 高精度を維持しながら最大32人の話者に対応。
Scribe v2の新機能
Scribe v2は、より要求の厳しいユースケース向けに設計された追加機能を備え、コアモデルをさらに強化しています。
- キータームプロンプト。重要な用語を正しく文字起こしできるようモデルを誘導するために、最大100個の単語またはフレーズを指定できます。キータームプロンプトを使用すると、料金が20%増加します。
- エンティティ検出。クレジットカード番号、氏名、病状など、文字起こし内で検出する情報のカテゴリを指定できます。エンティティ検出はAPIでのみ利用でき、料金が30%増加します。
- スマートな多言語対応。複数の言語を含むオーディオを送信すると、Scribe v2が各言語を自動検出して正確に文字起こしします。
- 安定性の向上。Scribe v2は、休止、声のトーンの変化、長い無音にも、途切れたり精度を損なったりすることなく対応します。
どのバージョンを使用すべきですか?
高精度の文字起こしが必要な場合は、Scribe v2をおすすめします。ウェブサイトおよびAPIから利用できます。ウェブサイトでスピーチtoテキストを使用する場合、Scribe v2がデフォルトモデルです。
医療・臨床オーディオには、同じAPIからScribe v2 Medical(scribe_v2_medical)を使用してください。料金はScribe v2と同じです。
リアルタイムのユースケースには、ElevenAgentsおよびAPIから利用できるScribe v2 Realtimeをおすすめします。
詳しくは、スピーチtoテキストのドキュメントをご覧ください。