強制アラインメント

ElevenLabsで、音声とテキストをタイミングが一致した文字起こしに変換する方法をご紹介します。

概要

ElevenLabsの強制アラインメントAPIは、音声とテキストをタイミングが一致した文字起こしに変換します。音声録音と文字起こしはあるものの、文字起こし内の各単語またはフレーズの正確なタイムスタンプが必要な場合に便利です。以下の用途に活用できます:

  • 字幕をビデオ録画に合わせる
  • 電子書籍のオーディオブック録音のタイミングを生成する

使用方法

強制アラインメントAPIは、ElevenLabs APIに直接接続して使用できます。

対応言語

Multilingual v2モデルは、29言語に対応しています。

英語(米国、英国、オーストラリア、カナダ)、日本語、中国語、ドイツ語、ヒンディー語、フランス語(フランス、カナダ)、韓国語、ポルトガル語(ブラジル、ポルトガル)、イタリア語、スペイン語(スペイン、メキシコ)、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語(サウジアラビア、アラブ首長国連邦)、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。

主なポイント

  • 入力テキスト形式:プレーン文字列のみ。入力テキストをJSONやその他の構造でラップしないでください
  • 話者分離:非対応です。話者分離済みテキストを指定すると、予期しない結果になる可能性があります
  • 料金:スピーチtoテキストAPIと同じ料金
  • 最大ファイルサイズ:3GB
  • 最大オーディオ時間:10時間
  • 最大テキスト長:675,000文字