スピーチtoテキスト

ElevenLabsでオーディオを文字起こしする方法のガイド

テキスト読み上げのプロダクト機能

概要

スピーチtoテキストでは、最先端の精度で音声をテキストに文字起こしできます。自動言語検出により、多数の言語のオーディオを文字起こしできます。

文字起こしを作成

1

オーディオをアップロード

ElevenLabsダッシュボードでスピーチtoテキストページに移動し、「ファイルを文字起こし」ボタンをクリックします。モーダルから、文字起こしするオーディオまたはビデオファイルをアップロードできます。

スピーチtoテキストのアップロード

2

オプションを選択

  • わかる場合は、オーディオの主な言語を選択します。「検出」のままにしておくと、オーディオ内の言語が自動的に検出されます。

  • 「オーディオイベントにタグ付け」トグルで、笑い声や拍手などのオーディオイベントにタグを付けるかどうかを選択します。

  • キータームプロンプトでは、モデルが文字起こしする際に優先する単語やフレーズを最大1000件追加できます。これは、プロダクト名、人名、その他の固有用語など、オーディオ内で一般的ではない特定の単語や文を書き起こす場合に役立ちます。

準備ができたら、「ファイルをアップロード」ボタンをクリックして送信します。

3

結果を表示

結果を表示するには、中央ペインでアップロードしたオーディオファイル名をクリックします。単語をクリックすると、その箇所からオーディオの再生を開始できます。

右上の「エクスポート」ボタンをクリックすると、さまざまな形式で結果をダウンロードできます。

文字起こしエディター

文字起こしを作成したら、文字起こしエディターで編集できます。詳しくはこのガイドをご覧ください。

よくある質問

はい。このツールでは、オーディオファイルとビデオファイルの両方をアップロードできます。どちらも最大ファイルサイズは3GBです。

話者名を変更

はい。「話者」ラベルの横にある「編集」ボタンをクリックすると、話者名を変更できます。

スピーチtoテキストは、話し言葉のオーディオを文章テキストに変換します。ElevenLabsのスピーチtoテキストモデルはScribeです。90以上の言語の音声を高精度で文字起こしでき、オーディオを読みやすく検索可能なテキストへ簡単に変換できます。

Scribeの主な機能

  • 英語、フランス語、イタリア語、ポルトガル語、スペイン語、ドイツ語などの主要言語で98%の精度を実現する、業界最高水準の精度。
  • 単語単位の正確なタイムスタンプにより、各単語が発話された時点を正確に確認できます。
  • 話者を自動的に識別・分離するスマート話者ダイアライゼーション。
  • 非音声を検出する動的オーディオタグ付け。
  • 高精度を維持しながら最大32人の話者に対応。

Scribe v2の新機能

Scribe v2は、より要求の厳しいユースケース向けに設計された追加機能を備え、コアモデルをさらに強化しています。

  • キータームプロンプト。重要な用語を正しく文字起こしできるようモデルを誘導するために、最大100個の単語またはフレーズを指定できます。キータームプロンプトを使用すると、料金が20%増加します。
  • エンティティ検出。クレジットカード番号、氏名、病状など、文字起こし内で検出する情報のカテゴリを指定できます。エンティティ検出はAPIでのみ利用でき、料金が30%増加します。
  • スマートな多言語対応。複数の言語を含むオーディオを送信すると、Scribe v2が各言語を自動検出して正確に文字起こしします。
  • 安定性の向上。Scribe v2は、休止、声のトーンの変化、長い無音にも、途切れたり精度を損なったりすることなく対応します。

どのバージョンを使用すべきですか?

高精度の文字起こしが必要な場合は、Scribe v2をおすすめします。ウェブサイトおよびAPIから利用できます。ウェブサイトでスピーチtoテキストを使用する場合、Scribe v2がデフォルトモデルです。

医療・臨床オーディオには、同じAPIからScribe v2 Medical(scribe_v2_medical)を使用してください。料金はScribe v2と同じです。

リアルタイムのユースケースには、ElevenAgentsおよびAPIから利用できるScribe v2 Realtimeをおすすめします。

詳しくは、スピーチtoテキストのドキュメントをご覧ください。

スピーチtoテキストは90以上の言語に対応しています。 

対応言語の詳細は、スピーチtoテキストのドキュメントの対応言語のセクションをご覧ください。

同時実行制限(並行して実行できる同時リクエスト数)は、サブスクリプションと、スピーチtoテキストまたはリアルタイムスピーチtoテキストのどちらを使用しているかによって異なります。

以下は、現在のスピーチtoテキストの同時実行制限です。

プランスピーチtoテキストの同時実行制限リアルタイムスピーチtoテキストの同時実行制限
無料86
スターター129
クリエイター2015
プロ4030
スケール6045
ビジネス6045
エンタープライズ拡張拡張

より多くの同時リクエストが必要な場合は、こちらのページからエンタープライズ部門へ直接お問い合わせください。ご要件に合わせたプランをご提案します。

No results