Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

自動音声認識(ASR)とは?

執筆者
Jack Limebear
公開日
最終更新日

聴くこの記事を聴く

1952年、世界最先端の音声認識システムが理解できた単語は、わずか9語でした。 

それから約75年後、自動音声認識(ASR)は数十の言語をリアルタイムで文字起こしし、スマートフォンの音声アシスタントからライブ動画に表示される字幕まで、幅広く活用されています。

このガイドでは、1952年の技術と現代の技術の隔たりを埋めた仕組みを解説します。ASRとは何か、音声をどのようにテキストへ変換するのか、そして現在も進化を続けるASRについて紹介します。

概要:

  • ASRは自動音声認識を指し、話し言葉のオーディオをテキストに変換する技術です。
  • ASRの原型は1952年に登場し、2010年代後半にはディープラーニングシステムが人間のベンチマークに匹敵する性能に達しました。
  • 現代のASRでは、数百万時間分のオーディオで学習したエンドツーエンドのニューラルネットワークを使用します。
  • 単語誤り率(WER)は標準的な精度指標ですが、本番環境のASRではレイテンシー、話者ダイアライゼーションの品質、文脈理解も重要です。
  • ElevenAPIはデベロッパーに本番環境向けのASRを提供しています。Artificial Analysisの独立ベンチマークでは、単語誤り率2.2%を記録し、同社のインデックスで最も低い値となりました(2026年7月)。

自動音声認識(ASR)とは?

自動音声認識は、一般にASRという略称でも知られ、人の話し声を聞き取り、正確で機械可読なテキストへ変換するソフトウェアを指します。一般にはスピーチtoテキストや音声認識、あるいはコンピューター音声認識とも呼ばれます。

ASRは非常に広く普及しているため、気づかないうちに毎日利用しているかもしれません。メッセージを音声入力するとき、音声アシスタントに質問するとき、ライブ動画の字幕を読むとき、あるいは自動音声応答電話システムを操作するとき、ASRを利用しています。

スピーチtoテキストとASRは同義語として使われることが多く、密接に関連していますが、厳密には同じものではありません。ASRは何が話されたかを識別する技術であり、STTはその技術をツールとして応用したものです。音声認識ソフトウェアはASRの上に構築され、特定の単語を誰が話したかを識別します。これが話者ダイアライゼーション機能の基盤になります。

小さな違いですが、ASR/STT/音声認識システムをアプリやウェブサイトに統合する場合は、理解しておく価値があります。

自動音声認識技術の簡単な歴史

自動音声認識技術の歴史は、多くの人が思うよりはるかに古く、初期の試みは1950年代までさかのぼります。誕生から70年以上の間に、ASRは歴史的な進歩の基盤となる重要な段階をいくつも経てきました。

ASR技術が歩んできた主な時代を紹介します。

  • 1952年と最初のASR: 1952年、AUDREYとして知られるAutomatic Digit Recognizerが、1から9までの数字を理解するためにベル研究所で開発されました。このツールの精度は約90%にとどまり、発明者本人が使う場合にしか機能しなかったため、非常に限定的でした。現代の性能とは大きく隔たっていますが、1~9を認識できるだけでも当時としては印象的な成果でした。
  • 1960~70年代と拡大するASR語彙: その後の数十年で、IBM、ユニバーシティ・カレッジ・ロンドン、日本のNECを含む世界中の研究所が、異なる文脈でAUDREYに似たモデルを開発しました。スタンフォード大学のインド出身の大学院生Raj Reddyは、博士課程の研究として母音認識器を開発し、単語ごとに間を置かずに認識する連続音声認識の基礎を築きました。この時期にDARPA(国防高等研究計画局)が資金提供した研究から、文の構築と復号に用いるBeam Searchが生まれ、1976年までに1,000語を超える単語を認識するうえで重要な役割を果たしました。
  • 1980年代から2010年代初頭の統計的進歩: 1987年、Raj Reddyの元学生で当時は教授だった研究者が、隠れマルコフモデルとBeam Searchを組み合わせました。これにより、特定の話者だけで学習する必要のないASRが実現しました。この画期的な進歩により、音声認識システムの学習時間は大幅に短縮されました。Dragon Systemsは1997年、初の商用ASRであるNaturallySpeaking Preferredを発売しました。毎分100語を認識でき、好調に販売されました。 
  • 現代とディープラーニング: 2010年代、研究者たちは、オーディオと文字起こしデータを用いてエンドツーエンドで学習した単一のニューラルネットワークが、純粋な統計的パイプラインを上回ることを示しました。ディープニューラルネットワークの登場により、ASRは誤り率5~10%の、人間に近い性能に到達しました。この時期にAlexaやSiriなどの音声アシスタントが市場に登場しました。 

それ以降、ASRはさらに高精度になり、利用範囲も広がっています。2026年7月時点で、Artificial Analysisの独立調査では、ElevenLabs Scribe v2が業界最高水準となるわずか2.2%の単語誤り率(WER)を達成したとされています。 

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

ASRの仕組み:スピーチtoテキスト技術の基礎

ASRは、オーディオサンプルを取得して数値表現に変換し、学習済みモデルで、その数値が表す可能性が最も高い単語列を予測します。現代のASRはこの仕組みをリアルタイム化し、エンドツーエンドのプロセス全体を1秒未満で完了します。

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

ASRパイプラインには、主に5つの段階があります。

  1. オーディオの取得と前処理: システムはオーディオ信号を録音し、バックグラウンドノイズを除去し、エコーを低減して、音量レベルを正規化します。モデルによっては、文字起こしを始める前に音声活動検出(VAD)を使い、音声と無音・背景音を区別します。
  2. 特徴抽出: オーディオを数値表現に変換します。通常は、話し言葉に含まれる周波数やパターンを正確に示すスペクトログラムまたはメル周波数特徴を使用します。この段階では、未加工の波形を機械学習モデルが効率的に処理できるデータへ変換します。
  3. 音響モデリング: ニューラルネットワークが前段階の特徴を分析し、音素などの音声単位を予測します。これにより、音響パターンと話し言葉の関係を学習します。現代のエンドツーエンドモデルでは、この処理を完全に独立した段階としてではなく、言語理解と合わせて実行することが一般的です。
  4. 言語モデリングと復号: 次にシステムは、文法、文脈、数学的確率などのルールに基づき、もっともらしい単語列に重み付けします。後者の2つは特に重要です。2つの文はIPA(国際音声記号)での表記が似ていても、文脈はまったく異なる場合があるためです。たとえば、「Recognize Speech」と「Wreck a nice peach」は同じように聞こえても、意味は完全に異なります。精度だけでは判断できない場合、文脈が正しい候補の選択を助けます。 
  5. 出力形式の整備: 音声の内容を判断した後、句読点や大文字・小文字を含む最終テキストを文字起こしします。単語単位のタイムスタンプや話者ラベルなどの追加メタデータにより、より詳細な文字起こしを作成できます。

これらの主要な段階を通じて、モデルは入力オーディオデータをテキストの文字起こしへ変換します。

従来のハイブリッドシステムとエンドツーエンドのディープラーニングASR

上記のパイプラインはASRの仕組みを示していますが、その中間部分には実際には2つの技術的アプローチがあります。 

従来のシステムでは、単語の発音を符号化するレキシコンモデル、オーディオを音素に対応付ける音響モデル、もっともらしい単語列を予測する言語モデルなど、複数のコンポーネントを連結します。各コンポーネントの構築には、発音辞書を手作業で作成する言語学者から、各単語をオーディオ内の正確な位置にアラインメントするアノテーターまで、人の専門知識が必要です。

エンドツーエンドのディープラーニングは、これらすべてのコンポーネントを単一のニューラルネットワークに統合します。このネットワークは、何百万時間もの対応付けられたオーディオと文字起こしデータから、発音、音響、言語確率の統計を暗黙的に理解し、オーディオを直接テキストに対応付けます。

ASR技術における従来のアプローチと現代のアプローチの違いを見ていきましょう。 

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

ASRの精度測定:単語誤り率(WER)のベンチマーク

あらゆるスピーチtoテキストおよびASRワークフローにおいて、単語誤り率(WER)は企業が使用する主要な精度指標です。ASRで生成した機械の文字起こしを、人が検証した版と比較します。主な誤りには、置換、削除、挿入の3種類があります。

WERの算出式では、総誤り数を参照文字起こし内の単語数で割ります。WERが5%なら、システムがテキストの95%を正確に文字起こしできたことを意味します。現在の主要モデルは、5%を大きく下回り、さらなる精度向上を目指しています。

WERは有用なベンチマークですが、ASRツールの有効性を判断する際には、ほかの要素も考慮する必要があります。

  • フォーマット精度: システムは非標準的な文字列を正しく整形できるでしょうか?たとえば、$1,225のような金額をそのまま表示できるか、それとも「千二百二十五ドル」と表記するか、といった点です。
  • レイテンシー: 精度は重要ですが、単純な文字起こしの生成に数分かかるようでは、ツールは実用になりません。いかに高精度でも、実用性を高めるには低レイテンシーとのバランスが必要です。
  • 堅牢性: 強い アクセントや騒がしい背景といったユースケースでも、モデル精度が大幅に低下すべきではありません。 
  • ダイアライゼーションの品質: 複数話者のユースケースでは、すべての単語を正しい話者に正確に割り当てる必要があります。異なる話者を識別し、正しいラベルを付ける機能は、特に法廷のように複数話者が多い業界でASRの品質に貢献します。

詳しくは、単語誤り率に関する包括的なガイドをご覧ください。

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

現代のビジネスにおけるASRの主なメリット

世界の音声・ボイス認識市場は、2030年までに231.1億ドル超に成長すると予測されています。市場の年平均成長率19.1%は、この技術が商用デバイスに広く普及していることを示しています。現代の携帯電話にはすべて音声入力キーボードと音声アシスタントが搭載され、ほとんどの新車は音声コマンドに対応し、スマートスピーカーやアシスタントは世界中の家庭に普及しています。

音声によるテクノロジーとの対話は、今や顧客が幅広い場面で利用できる標準的な手段です。企業にとってASRは、顧客通話の文字起こしからボイスエージェントの支援までを提供し、プロセスに統合されて生産性を高めます。

現代のビジネスにおけるASRの主なメリットをいくつか紹介します。

  • より速い入力と文書化: 10年以上前にも、スタンフォード大学が論文を発表し、音声認識技術は誤り率を低く保ちながら、キーボード入力の約3倍の速さであることを示しました。大多数の人にとって、ASRは文字起こしワークフローの文書化や、音声優先のメモ作成をより迅速にします。
  • 運用コストの削減: かつて何時間もの手作業によるメモ作成に頼っていた多くのユースケースで、ASR技術は高品質な文字起こしのコストを大幅に削減します。裁判、コンタクトセンター、医療クリニック、ビジネス会議では、詳細なメモや会話の完全な話者ダイアライゼーション付き文字起こしを作成する高精度ASRシステムを利用できます。 
  • アクセシビリティの向上: 世界保健機関は、25億人が2050年までに何らかの聴覚障害を抱えると予測しています。高度なASRツールが提供するリアルタイム字幕により、デジタル会議やメディアをユーザーが利用しやすくすることができます。
  • 検索可能な音声データ: ASRで音声を自動文字起こしすると、すべての顧客と企業のやり取りが完全に記録されます。営業通話、サポートチケット、見込み顧客との通話、会議のすべてが、検索・監査可能なテキストになります。特にAI時代には、機械可読形式で文脈を取り出せることが、広範なナレッジベースの構築に役立ちます。機能面でもコンプライアンス面でも、情報を可視化し続けることにつながります。 
  • 常時対応の顧客体験: ASRは、ボイスエージェントの基盤技術の一つであり、顧客の通話を解決する24時間365日の自動サポートユースケースを可能にします。

自動音声認識がテクノロジーで広く使われているのは、導入によるメリットが多く、対応できるユースケースも非常に広いためです。医療分野でも、感情分析のために顧客通話を文字起こしする場合でも、ASRは導入・活用する基盤技術です。 

業界を横断するASRの代表的な活用例

自動音声認識は、数え切れないワークフローやプロダクトの中核技術です。広く普及したことで、ユーザーは利用中のテクノロジーにASRが組み込まれていることを意識しないことも少なくありません。

世界で利用されているASRの代表的なユースケースを簡単に紹介します。

カスタマーサービスとコンタクトセンター

コンタクトセンターはASRを早期に導入し、品質保証とコンプライアンスのために通話を文字起こししていました。現在ではASRをリアルタイムで実行し、会話の途中でエージェントに提案を表示したり、何千件もの顧客対応をチームが分析できるデータに変換したりできます。 

メディアとエンターテインメント

放送局やストリーミングプラットフォームは、ASRを利用して、人間の文字起こし担当者では到底対応できない規模で会話の字幕やキャプションを生成できます。ASRはリアルタイム文字起こしを可能にし、ビデオやオーディオのライブラリ全体を検索可能にします。

医療

臨床スタッフは、驚くほど多くの時間を文書作成や記録に費やしています。ASRはその時間を取り戻し、医師にリアルタイムでメモを音声入力できる医療STTプラットフォームを提供します。

バーチャル会議

会議プラットフォームでは、会話をその場で文字起こしするデジタルメモ機能が提供されることが多く、参加するかメモを取るかを誰かが選ぶ必要はありません。Google Meetのようなサービスでは、各会議の後にアクションアイテムを強調表示した文字起こしを送信し、検索可能な情報インデックスの作成に役立てています。 

法務とコンプライアンス

法的な場面では、誰が何を発言したかを正確に記録することが、法廷における重要な要件です。法律事務所は、将来の参照に備え、会議、審問、顧客との通話、法廷審理を正確なタイムスタンプ付きで文字起こしするためにASRプラットフォームを使用します。 

教育

大学教授は、学生が受講した授業の記録を作れるよう、講義の文字起こしを提供できます。情報を理解して記憶する際、学生は出発点となる包括的な資料を利用できます。

ボイスエージェントのパイプラインにおけるASRの位置付け

ASRはさまざまな技術導入における標準的な要素です。ボイスエージェント技術では、継続的なループで動作する3つの大きな段階の最初にあたります。

  • 聞く(ASR): エージェントは入力オーディオストリームを取得し、リアルタイムで音声をテキストに変換します。現代のASRは、到着したオーディオを継続的に処理し、バックグラウンドノイズを除去し、中断を処理し、部分的な文字起こしを生成して、各人が話しているタイミングを識別します。 
  • 考える(言語モデル): 大規模言語モデルが文字起こしを解釈し、ユーザーの意図を理解します。接続されたツールやナレッジベースから情報を取得し、会話の文脈を維持し、最も適切な応答またはアクションを決定します。 
  • 話す(テキスト読み上げ): テキスト読み上げモデルは、生成されたLLMの応答を自然で表現力豊かなオーディオに変換します。現代のTTSシステムでは、応答全体を待つのではなく、生成と同時に発信者へオーディオをストリーミングしながら、話す速さ、イントネーション、感情、強調を調整できます。 

会話のレイテンシーは、これらすべての段階で積み重なります。ストリーミングASRは、レイテンシーを抑えるため、発話が終わるまで待たず、話された単語をすぐに出力し始めます。ElevenAgentsはこれをリアルタイムのボイスエージェントの標準として採用し、高効率なエージェント体験を実現します。

ASRにおける課題と技術の進化

ASR技術は1952年の誕生以来大きく進歩しましたが、精度を低下させる可能性のある課題は依然として残っています。

現在でもASRツールが直面する課題を紹介します。

  • アクセントと方言: 利用可能な学習データは通常、少数の言語やアクセントに偏りがちです。そのため、あまり一般的でないアクセントや、話者数の少ない言語はASRツールにとってより困難になります。この解決策となるのが、豊富で多様な学習データセットです。
  • バックグラウンドノイズと話者の重なり: 音量が変動する環境や大きなバックグラウンドノイズがある環境では、録音内の個々の単語を特定しにくくなります。話者の発話が重なる場合も同様に、ASR文字起こしの精度が低下する可能性があります。
  • 業界固有の語彙: 特有の専門用語や略語を使う分野では、精度を高めるために分野レベルの辞書や参照情報が必要です。医療と法務は、ASRツールに追加の支援または専門的な学習が必要となる代表的な分野です。
  • プライバシーとセキュリティ: 多くの法域で、音声データは個人データと見なされます。企業は、音声データの取り扱いを保護し、より広範な規制への準拠を確保するために、明確な保持ポリシーとガードレールを整備する必要があります。

ASR技術を扱ううえで、より広い観点から考慮すべきなのは、レイテンシーと精度のトレードオフです。一部のユースケースでは両者のバランスが必要ですが、医療のような分野では、精度が何よりも優先されるでしょう。 

本番環境向けASR統合をElevenAPIで始める

ElevenAPIは、ElevenLabsのスピーチtoテキストモデルであるScribe v2を通じて、本番環境向けの自動音声認識をプロダクトに提供します。Scribe v2は、単語単位のタイムスタンプ、話者ダイアライゼーション、オーディオイベントのタグ付けに加え、リアルタイムアプリケーションに必要な精度と信頼性を提供します。

詳しくはElevenLabs スピーチtoテキストページをご覧ください。または、無料アカウントを作成して、数分でAPIをセットアップできます。 

ASRに関するよくある質問

関連記事

最高品質のAIオーディオで創造する