コンテンツへ移動

Audio Tagsとは?感情豊かなTTSの完全ガイド

執筆者
Jack Limebear
公開日
最終更新日

聴くこの記事を聴く

Audio Tagsは、[laughs]、[gasps]、[excited]、[worried]のように角括弧で囲まれた自然言語のキューです。Eleven v3はこれらを読み上げる言葉ではなく、演技指示として解釈します。テキスト読み上げモデル用のスクリプトにAudio Tagsを挿入すると、文章の感情表現を細かくコントロールできます。 

Eleven v3 は2026年3月に一般提供を開始しました。v3以前は、特定の感情表現をテキスト読み上げモデルでは、特定の感情表現を得るにはコンテンツを何度も再生成し、うまくいくことを願うしかありませんでした。Audio Tagsなら、そうした手探りをなくし、感情豊かなテキスト読み上げの表現を完全にコントロールできます。

このガイドでは、Audio Tagsとは何か、仕組み、利用可能なすべてのタグカテゴリー、そしてSSML(音声合成マークアップ言語)との違いを解説します。よくあるユースケースも、それぞれの詳細ガイドへのリンクとともにご紹介します。

概要

  • Audio Tagsは、[shouts]や[excited]のように角括弧で囲まれたキューで、Eleven v3のTTSにおける感情、ペース、話し方、トーンを指示します。
  • Eleven v3はSSMLをサポートしていませんが、より自然に書けるAudio Tagsで代替できます。
  • タグには、感情、話し方とペース、人間らしい反応、アクセント、サウンドエフェクトなどのカテゴリーがあります。
  • テキスト内の句読点や大文字表記を使うと、AI音声の話すペースを調整できます。
  • ElevenLabsでは、UIまたはAPIからAudio Tagsを利用できます。

Audio Tagsの仕組みは?

Audio Tagsはトランスクリプト内にそのまま記述し、角括弧で囲みます。たとえば通常の話し方から[worried]へと表現を変えたい場合は、Audio Tagを追加するだけです。

1つの文に複数のタグを使うことも、タグを組み合わせてより多層的な表現にすることもできます。例:[tired] 長い一日だった… [upset] あと何日、耐えられるの?

Eleven v3のアーキテクチャにより、モデルは従来のモデルより深いレベルで文脈を読み取り、別途パラメーターや設定を指定しなくても、感情の指示、トーンの変化、話者の切り替わり、文脈上の手がかりに従えます。その場面で求められることをモデルに伝えるだけで、意図したとおりにセリフを演じます。

Eleven v3は、タグとスクリプト構造だけで、割り込み、感情の変化、実際の会話のような自然なやり取りを含む、自発的に感じられる複数話者の対話も処理できます。 

Audio TagsとSSMLの比較

他のTTSシステムを使ったことがあれば、Speech Synthesis Markup Languageを目にしたことがあるでしょう。Amazon PollyやMicrosoft Azure Speechなどのプラットフォームでは、<break>や<emphasis>といったSSMLタグを使い、TTSスクリプトに追加の文脈を与えます。 

Eleven v3はSSMLのbreakタグを含むSSMLタグセットをサポートしていません。その代わりに、Audio Tags、句読点、テキストの構造そのものがその役割を担い、話し方を細かくコントロールできます。

以下の表で、一般的なSSMLタグとEleven v3での対応する機能を確認できます。

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

書き手の視点では、セリフに[whispers]を追加するほうが、プロソディの速度を設定するよりも、はるかに手軽です。

v3におけるAudio Tagsのカテゴリー:Audio Tagsで表現を演出する

スクリプト内のどこにでもAudio Tagsを配置して、話し方をリアルタイムに調整できます。スクリプト内、あるいは一つの文の中で複数のタグを組み合わせることも可能です。

タグは、次の主要カテゴリーに分かれます。

感情

これらのタグは、沈んだ雰囲気、強烈な表現、明るい表現など、音声の感情的なトーンを設定するのに役立ちます。たとえば、[sad]、[angry]、[happily]、[sorrowful]を単独または組み合わせて使えます。

Background
Background

話し方とペース

こちらは主にトーンと演技に関するタグです。抑制や迫力が求められるシーンで、音量やエネルギーを調整できます。たとえば、[whispers]、[shouts]、[softly]といったタグがあります。

Background
Background

人間らしい反応

本当に自然な話し方には反応が含まれます。たとえば、自然で台本にない瞬間を音声に埋め込むことで、リアリティを加えられます。[laughs]、[clears throat]、[sighs]などのタグは、人間らしい感情を表現できるTTSモデルの実現に役立ちます。

その他のオーディオタグカテゴリーの例:

  • アクセントとキャラクターボイス: アクセントタグを使うと、モデルを切り替えることなく、[French accent]、[British accent]、[pirate voice]のように、特定の地域やペルソナの声に変えられます。1つの声を固定された1つの演技ではなく、柔軟なキャストへと変えることができます。
  • サウンドエフェクト: サウンドエフェクトタグを使うと、[gunshot]、[explosion]、[clapping]のような非音声オーディオを生成結果に直接追加できます。声だけでは足りないシーンの没入感あふれるオーディオ、ゲーム、ドラマチックなナレーションに適しています。代わりに、ElevenCreative AIサウンドエフェクトジェネレーターも使用できます。

タグを使うと高いレベルでコントロールできますが、句読点でリズムや強調を調整することも可能です。たとえば、省略記号を加えれば自然な間を作れ、読点を使えば自然な息継ぎのパターンを作れます。単語をすべて大文字にして強調してみてください:「今すぐ欲しいんだ、NOW。」

Background
Background

Audio Tagsでできること

Audio Tagsなら、スクリプトに含まれる複雑な感情を直感的に表現できます。自然に書きながら、必要な箇所にタグを加えてください。

Audio Tagsを使った感情豊かなTTSのユースケースを、いくつかご紹介します。

AIオーディオにおける状況認識

[whisper]や[shouting]などのタグにより、Eleven v3はその場の状況に反応できます。警告をやわらげることから、緊張感を高める長い間を取ることまで、動的な状況認識をスクリプトに組み込めます。

詳しくは、AIオーディオにおける状況認識のガイドをご覧ください。

音声におけるキャラクター演技の演出

複数のキャラクターが登場するスクリプトを作る際は、それぞれの声の違いを明確に示す必要があります。[sarcastically]で性格を調整したり、[British accent]で話し方を定義したりすることで、TTSエンジンを使って幅広い感情を表現できます。

詳細は、AI音声におけるキャラクター演技の演出をご覧ください。

音声で感情的な文脈を表現する

Audio Tagsを使うと、セリフの進行に合わせて感情表現を形作れます。スピーチ全体で感情を高め、キャラクターが最高潮に達する瞬間へと導けます。[awe]、[booming]、[big laugh]のようなタグを使えば、AI音声の表現に幅広い感情を加えられます。

詳しくは、AI音声における感情的な文脈の活用方法をご覧ください。 

複数キャラクターの対話を生き生きと表現する

複数キャラクターによる対話を演出する際は、各セリフの冒頭にオーディオタグを付けることで、豊かなキャラクター同士の会話を作れます。 

次の例をご覧ください:トム:[coughing] [beginning to speak] ごめん、今日は少し体調が悪くて— エマ:[interrupting] —体調が悪い? 咳が大嫌いなの、知ってるでしょ、トム! トム:[surprised] ただの軽い咳だよ。大したことない。もし君が— エマ:[overlapping] [annoyed] —家に帰ったほうがいいと思う。 

ほかにできることは、Eleven v3での複数キャラクターの対話をご覧ください。

AI音声の話し方を精密にコントロール

Eleven v3では、Audio Tagsや句読点を使って話すペースをコントロールできます。[pause]、[rushed]、[drawn out]のようなタグで、セリフを精密に演出できます。あるいは、三点リーダー、句点、感嘆符を加えることで、TTSの表現に自然な感情を込めることもできます。

詳細なガイドとして、Eleven v3での話し方の精密なコントロールをご用意しています。

感情豊かなTTSはAPIでも利用可能

Audio Tagsは、テキスト読み上げAPIでもElevenLabsのUIと同じように機能します。スクリプトのテキスト内にタグを直接記述すれば、APIはタグ付きの演技を生成オーディオとして返します。オーディオブックのパイプラインから広告のボイスオーバーまで幅広く活用できます。 

Eleven v3の詳細を確認するか、営業担当に問い合わせることで、今すぐ始められます。

Audio Tagsと感情豊かなTTSに関するよくある質問

関連記事

最高品質のAIオーディオで創造する