Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

タイムスタンプとイベントタグを用いた音声文字起こしは、どのように機能しますか?

執筆者
Jack Limebear
公開日

聴くこの記事を聴く

ネイティブの単語レベル文字起こしモデルは、音声録音またはリアルタイムストリームを入力として受け取り、発話や非発話音を表す、タグとタイムスタンプ付きのトークンオブジェクトの構造化配列を出力します。各トークンはword、spacing、audio_eventの3種類のいずれかです。音声イベントには、笑い声、拍手、その他のバックグラウンドサウンドがあります。

この記事では、タイムスタンプ付き音声文字起こしの仕組みと、強制アラインメントに依存する従来の文字起こしよりも柔軟かつ強力である理由を解説します。

概要

  • 単語レベル文字起こしは、発話データと非言語音声イベントの構造化されたタイムスタンプ付き配列を直接出力します。
  • これは、テキスト全体のブロックを出力する従来の自動音声認識モデルとは対照的です。生の音声にタイムスタンプを付けるには、2回目の強制アラインメント処理が必要となり、時間がかかるうえ、コンピューティングのオーバーヘッドも増えます。
  • イベントタグを使うと、笑い声や拍手などの非言語コンテンツを捉えられます。このデータは検索可能なため、視聴者の反応に基づいてハイライトやバイラルになる瞬間を特定するのに役立ちます。
  • 構造化された出力データは、高精度なキャプション、検索可能な音声アーカイブ、自動SNSクリッピングなど、さまざまな用途でアプリケーションに渡せます。
  • Scribeの単語レベル文字起こしは、最大5チャンネルをサポートし、それぞれを個別に文字起こしできます。

タイムスタンプとイベントタグを用いた音声文字起こしとは?

タイムスタンプ付き文字起こしは、自動音声認識(ASR)の一種で、文字起こしと同時に、単語や拍手などの音声イベントの正確な開始・終了位置を追跡します。出力は完全に構造化され、ナビゲーション可能なデータです。

従来のASR文字起こしでは、音声を人が読める大きなテキストブロックに解析します。人間向けのキャプションや文字起こしは得られますが、データとしてはあまり有用ではありません。

タイムスタンプ付きで構造化するには、テキストを音声に対応付けるため、別の機械学習サービスにもう一度通す必要があります。最終的には似た出力を生成できますが、APIからネイティブに出力されるのではなく複数の処理工程を要するため、レイテンシーと追加のコンピューティングオーバーヘッドが発生します。

音声にナビゲーション機能を追加

タイムスタンプとイベントタグ付き文字起こしの大きな利点は、人間にも機械にも読み取れることです。重要なビジネス用途として、次のようなものがあります。

  • コンプライアンス監査:文字起こし内のキーワードを検索し、機密データへの言及について正確なタイムスタンプを取得できます。
  • 動画制作・編集:動画制作ソフトウェアは、画面上で話されている内容に字幕をミリ秒単位で同期できます。視聴者の反応にも適切にラベル付けできます。
  • 検索可能なアーカイブ:広報、営業、研修チームなどは、大量の顧客インタビュー、展示会でのスピーチ、ウェビナー、全社会議を文字起こしし、大規模で検索可能なアーカイブにできます。
  • マーケティング分析と顧客感情:イベントタグ付けにより、基本的なテキスト文字起こしでは失われる可能性のある視聴者の反応にラベルを付けられます。

ネイティブの単語レベルタイムスタンプを取得する利点とは?

標準的なスピーチtoテキストモデルは通常、文章や段落全体などのまとまりで音声を処理します。単語ごとのタイムスタンプが必要な場合、2回目の処理で強制アラインメントと呼ばれる処理を行うための追加処理レイヤーを構築する必要があります。これによりインフラとレイテンシーが増え、障害が起きる可能性も高まります。たとえば、速い発話や大きなバックグラウンドノイズに埋もれた発話を処理しようとすると、タイミングがずれたり、完全に失敗したりする可能性があります。

タイムスタンプ付き文字起こしは、Scribeのように単語ごとのより細かなレベルで文字起こしすることで、この問題を回避します。これは1回のAPI呼び出しで実行されます。追加のインフラやスクリプトは不要です。モデルは文字起こしと同時にタイムスタンプを計算するため、発話データは常に音声を正確に反映します。

Audio transcription with timestamps guide. Native transcription provides word timestamps in one API call, avoiding forced-alignment drift.

タイムスタンプ・イベントタグ付き文字起こしの仕組みは?

例として、Scribeを見てみましょう。

ネイティブの単語レベル文字起こしモデルは、音声フィード内の発話音をトークンオブジェクトの構造化配列にマッピングします。すべてのトークンに、word、spacing、audio_eventの3種類のいずれかとしてラベルを付けます。

  • word:認識された個々の発話単語。開始・終了時刻とspeaker_idタグが記録されます。
  • spacing:明示的にタグ付けされた無音または発話中の間。キャプションサービスが適切なペースで表示するのに役立ちます。日本語、標準中国語、タイ語、ラオ語、ビルマ語、広東語など、単語間のスペースを使わないと識別された言語では使用されません。
  • audio_event:笑い声や拍手など、意味のある非言語音声。モデルはこれらを別のイベントタイプとして構造化し、音声を存在しない発話として無理に文字起こししません。
Timestamped token array separates speech, silence, and laughter across two speakers.

リアルタイムストリーミングのパラメータ

単語レベル文字起こしモデルには、ライブWebSocket音声文字起こしをサポートする特別な機能も含められます。例:

  • include_timestamps=true:このパラメータにより、確定した各音声チャンクの最後に送信されるcommitted_transcript_with_timestamps JSONメッセージに単語レベルのタイムスタンプが含まれるため、ストリームの実行中にタイムスタンプを取得できます。音声イベントタグは、tag_audio_eventsも有効な場合にのみ含まれます。
  • include_language_detection=true:このパラメータは、検出された異なる話し言葉の言語と、その検出に対するモデルの信頼度スコアを接続にタグ付けさせます。これにより、多言語キャプションをライブで実行できます。

スピーチtoテキストモデルは非発話イベントにどのようにタグ付けしますか?

tag_audio_eventsパラメータを有効にすると、Scribeは音声イベントにタグを付けます。その場合、単語と同様に特定の開始・終了時刻にタグとタイムスタンプを付与します。最も一般的な笑い声や拍手のほか、足音やバックグラウンドミュージックなど、文脈上意味を持つ可能性のある環境音を含むさまざまな反応にタグ付けできます。

最も直接的には、重要な文脈が加わることで、文字起こしとキャプションがより豊かになります。皮肉は、単純で平坦なテキストを読むだけでは、読者が直感的に理解しにくい場合があります。[laughter]タグを付けることで文字起こしが充実し、感情的な響きが増します。

より優れた分析

イベントタグ付けにより、下流で実行する分析もより明確になります。ツールが単一の非構造化テキストブロックを解析する必要がなくなるためです。ネイティブの単語レベル文字起こしでは音声イベントが構造化データとして分離されるため、ツールは必要に応じてそれらを除外し、発話コンテンツのみを対象に処理できます。

spacingトークンにより間が可視化されるため、分析できます。たとえば、カスタマーサービス担当者が通話中にどれだけ沈黙していたかを測定するなど、感情分析やQAのユースケースで役立ちます。

タイムスタンプ検索を簡単に

これらを特に対象に検索することもできます。製品テストのインタビューで感情分析を行う場合は、意味のある感情的な反応を抽出できます。また、SNSアカウントを運用している場合は、1時間のスピーチから笑い声を素早く検索し、バイラルになる可能性が最も高いと思われるクリップを見つけられます。

大規模にSTTをアプリケーションへ統合

他にお困りですか?こちらもご覧ください: ヘルプセンター

構造化されたタイムスタンプ付き文字起こしの実用的な用途とは?

文字起こしでネイティブに構造化データを取得すると、いくつかの重要な用途があります。

キャプションと字幕の生成

タイムスタンプ付き文字起こしは、中間処理なしでSRTやVTTを含む制作向けキャプション形式に直接エクスポートできます。動画編集ツールは単語のタイミングを使い、発話に合わせてキャプション内の単語をハイライトできます。

文字起こしモデルは単語ごとに処理するため、速い発話も簡単に解析できます。従来のモデルでは早口の発話や重なり合う声につまずくことがありますが、Scribeのような単語レベルモデルは、明確で構造化された文字起こしを出力できます。

音声・動画検索

従来の文字起こしではテキストブロック内のキーワードを一致させられますが、強制アラインメントがなければ、フレーズが話された瞬間に移動することはできません。単語レベル文字起こしでのキーワード検索は完全にインデックス化され、フレーズが音声内で話された秒数まで直接移動できます。これにより、音声アーカイブは完全に検索可能な参照カタログへと変わります。この機能は、大規模なメディアライブラリ、ポッドキャストネットワーク、企業アーカイブの管理に特に役立ちます。

コンプライアンス・リスク監査

たとえばQAのためにカスタマーサービスの通話を録音するなど、機密情報を含む音声を録音したい場面は多くあります。こうした通話には、機密性の高い、または規制対象となる個人情報が含まれる可能性が特に高くなります。 

コンプライアンスを維持しながら分析用の音声データを保持するには、文字起こしから機密データをリアルタイムで編集する方法が必要です。ネイティブの単語レベルタイムスタンプにより、ElevenLabsのEntity Detectionのような機能を活用できます。これはクレジットカード番号や氏名などの機密エンティティを検出し、そのオフセットとタイムスタンプを返すため、文字起こしのストリーミング中に該当箇所を隠せます。

たとえば、本人確認の通話中に話されたクレジットカード番号、母親の旧姓、生年月日、顧客名を検出して編集できます。

SNSクリップ作成の自動化

長尺コンテンツからハイライトを見つけるため、キーワード検索をプログラムで自動化することもできます。たとえば、選挙演説や企業セミナーから重要な瞬間をハイライトできます。これにより、最近のコンテンツをYouTube、LinkedIn、TikTok向けのプロ品質の編集済みハイライトに変えられます。

マルチチャンネル・マルチスピーカーのタイミング

Scribeは、最大5チャンネルを独立して並列に文字起こしできます。各チャンネルにはスピーカーIDとタイムスタンプが割り当てられます。これは、会話のやり取りをうまく処理できないことが多い標準的な音響話者ダイアライゼーションよりも信頼性が高い方法です。マルチチャンネル録音では、Scribeの話者割り当ては完全に決定論的です。つまり、チャンネル0はspeaker_0、チャンネル1はspeaker_1というように対応付けられます。

同時に話そうとしている話者を認識し、それぞれの発話に独立したタイムスタンプを生成できます。異なる言語で話していても対応可能です。

Multichannel transcription keeps five channels separate, mapping each to speaker 0–4.

必要な形式でタイムスタンプ付きデータをエクスポート

従来型の文字起こしを複数の形式で配布したい場合、解析スクリプトを自分で作成する必要がある可能性が高いでしょう。Scribeは、用途に応じて複数の形式で文字起こしをエクスポートできます。完全なスキーマ定義は、 ElevenLabs Create Transcript APIリファレンスで確認できます。

デベロッパー向け構造化データ:JSON

Scribeは、下流のアプリケーションに渡せるスキーマのデータを必要とするデベロッパー向けに、JSONへのエクスポートをサポートしています。たとえばデベロッパーは、このJSONデータを使用して、インタラクティブメディアや組織向けのセマンティック検索データベースを構築できます。word、spacing、audio_eventトークンの完全な配列が、開始・終了オフセットとスピーカーIDとともに出力されます。

メディアキャプション:SRTとVTT

Scribeは、手動で同期することなくAdobe Premiereなどの制作アプリケーションに直接取り込めるSRTおよびVTT文字起こしを出力できます。

人間が読みやすい形式:TXT、DOCX、PDF

読み手に優しい形式で文字起こしを出力することもできます。これらの形式では、Scribeはテキストを読みやすくし、法的文書や監査文書に適したものにするため、低レベルのタイミングマーカーを除去します。たとえば、セッション直後に取締役会議事録を効率的に配布する必要がある場合、SEO向けにポッドキャストの文字起こしを公開する場合、または法的記録をアーカイブする場合に役立ちます。

Scribe exports one transcript as JSON, SRT/VTT, or TXT/DOCX/PDF for different uses.

ElevenLabsのタイムスタンプ・イベントタグ付き文字起こしを始める 

ネイティブの単語レベル文字起こしなら、ワークフローに必要な構造化データを迅速かつ効率的に取得できます。

今すぐElevenAPIでScribeを使った音声文字起こしを始めるか、単語レベル文字起こしについて詳しくご覧ください。

タイムスタンプ・イベントタグ付き文字起こしに関するよくある質問

執筆者

Jack LimebearはGrowthチームに所属し、ブログやインサイトページのコンテンツライター兼ストラテジストとして活躍しています。ElevenLabsに入社する前は、急成長中のSaaSスタートアップからFortune 500企業まで、さまざまな組織で10年以上にわたりコンテンツ戦略をリードしてきました。ケンブリッジ大学で英文学の修士号を取得しています。

関連記事

最高品質のAIオーディオで創造する