Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

Eleven v4のAudio Tagsリスト:まず試して、次は自分で書いてみよう

執筆者
Jack Limebear
公開日

聴くこの記事を聴く

Eleven v4は、テキストを演技へと変える画期的なテキスト読み上げモデルです。Audio Tagsなら、感情表現を細かくコントロールして演技を演出できます。[whispers]や[excited]のような自然言語のキューを角括弧で入れるだけで、v4がそれに合わせて話し方を変えます。

このElevenLabs Audio Tagsリストでは、完全なEleven v4の感情レンジに含まれるすべての感情に加え、話し方、ペース、リアクション、アクセント、サウンドエフェクト用のタグを紹介します。基本を押さえたら、自然な言葉で独自のタグを書く方法もご紹介します。

Eleven v4の感情を体験する

感情レンジを聴く
ExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTired

概要

  • Audio Tagsは、Eleven v4が演技指示として読み取る、角括弧内の自然言語シグナルです。後に続く言葉の話し方を変えられます。
  • Eleven v4はArtificial Analysis Speech Arena[2026年9月]で最高評価を獲得したモデルです。Audio Tagsを使えば、セリフごとに演技を演出できます。
  • Eleven v4の感情レンジホイールでは、さまざまな感情を聴いてモデルの能力をすばやく把握できます。
  • タグは決まったリストに限定されません。[whispering, fearful]のように特性を組み合わせたり、セリフの背景にある状況やキャラクターを説明したりして、独自のタグを作れます。
  • Audio TagsはElevenAPIを通じて、Eleven v4、Eleven v4 Turbo、Eleven v3で利用できます。

ElevenLabs Audio Tagsとは?

Audio Tagsは、文章内に角括弧で埋め込める自然言語のキューです。Eleven v4はこれを演技マーカーとして読み取り、特定の単語やフレーズの話し方を変える指示として使います。ElevenLabsのテキスト読み上げアプリでスクリプト内に直接書き込むと、モデルがそれを表現します。

Eleven v4は、Artificial Analysis Speech Arenaで最高評価を獲得したTTSモデルです。ここではリスナーが最も自然に聞こえるテキスト読み上げに投票します。1 Audio Tagsを使えば、各セリフをどのように話すかを正確に指示し、その演技をさらに高められます。

スクリプトでAudio Tagsを使う方法:

  • 影響させたい言葉の前にタグを置く:「[shouts] I can’t believe you said that to me」と書くと、セリフ全体が叫び声で読まれます。
  • 感情はそのまま続く:タグを追加すると、その感情はセリフ全体に引き継がれます。話し方を切り替えたい箇所でのみ、別のタグを追加すれば十分です。たとえば、「[proud] I’ve been cooking for over a decade. I know how to boil an egg. [startled] What’s that burning smell?"
  • タグを組み合わせて指示を重ねる:[whispering, playful]のように、1組の角括弧内でAudio Tagsをカンマ区切りにすると、TTSの演技にニュアンスを加えられます。
  • タグと句読点を組み合わせる:Audio Tagsで雰囲気や話し方を指定し、スクリプト内の句読点で自然にペースを調整できます。省略記号、ダッシュ、大文字を加えて、セリフのプロソディを整えましょう。

タグの仕組みやSSMLを置き換える方法について詳しく知りたい方のために、Audio Tags完全ガイドをご用意しました。

Text-to-speech leaderboard: Eleven v4 leads with 1319 Elo, ahead of Sonic 3.6. Take this further by selecting from the ElevenLabs Audio Tags list

感情用Audio Tagsリスト

Eleven v4の感情ホイールには数十種類の感情があり、それぞれをv4が演じます。タグを1つ書く前に、その違いを聴けます。 

下の感情をクリックするとホイール上で聴けます。また、文章と感情を直接試して、Eleven v4が感情的なAudio Tagsをどう表現するか確認できます。

ここでは一部の感情のみを紹介しましたが、自然言語を使えば好きな感情を指定できます。以下の例では、自然言語プロンプトでできることを示すため、上で紹介していないさまざまなAudio Tagsを使っています。

[jittery] Okay, final question of the pub quiz, and we're tied for first. [intrigued] "Which planet has the most moons?" Hmm. [smug] Easy. It's Saturn, everyone knows that. [puzzled] Wait, why is Priya shaking her head? [disgusted] Jupiter? You want to write down Jupiter? [frazzled] We only have ten seconds, just pick one, pick one! [hopeful] [nervous] Fine. Saturn. Hand it in. [long pause] [triumphant] YES! Saturn! We won! [mischievous] [slightly pause] Priya, I believe you owe me a drink.
0:00

このサンプルは、Jonathan Livingstonの声で作成しました。

話し方・音量用Audio Tagsリスト

話し方と音量のタグは、付与する感情とは別に、セリフの大きさや強さをコントロールします。v4により具体的なイメージを反映させたい場合は、話し方と感情のタグを重ねて、さらに細かく調整しましょう。

いくつか例をご紹介します:

  • [whispers] 動かないで、すぐ後ろにいる。
  • [shouts] 全員、今すぐ建物から避難しろ! 
  • [softly] できることはすべてやったよ。 
  • [quietly] もう行ったと思う。 
  • [low, threatening] ここに来るべきじゃなかったな。

音量と話し方のコントロールを実際に見てみましょう。

[hushed] Eighteenth hole. One putt to win the championship, and the crowd has gone completely silent. [barely audible] He's lining it up now. The ball is rolling... still rolling... [booming] IT'S IN! HE'S DONE IT! The championship is his, and this place has gone absolutely wild! [disbelief] Twenty years I've been calling golf, and I have never seen anything like that.
0:00

上のサンプルは、Rodの声で作成しました。

ペース用Audio Tagsリスト

ペース用Audio Tagsはセリフの速度を変えます。サスペンスを生み出したり、絶妙なコメディの間を作ったりするために加えましょう。言葉そのものと同じくらいタイミングが重要なときは、ペースタグを使うのがおすすめです。

補足として、句読点もテキスト読み上げの表現を自然に助けます。組み合わせることで、文章を完全にコントロールできます: 

  • [slowly] そして優勝者は…… 
  • [rushed] ごめん、遅れた。電車が止まって、ずっと走ってきたんだ。 
  • [pause] すると電話が鳴った。 
  • [drawn out] まさかぁ。
[slowly] Ten... nine... eight... seven... [rushed] Wait, wait, wait, hold the countdown, someone left their coffee on the console! [snappy] Can you get that out of here? [long pause] [drawn out] Okaaay, thank you. It's been moved. [excited] Resume the count! [speedy] Three... two... one... LIFTOFF!
0:00

Adamの声で、このサンプルを作成しました。

人間らしいリアクション用Audio Tagsリスト

リアクションタグは、笑い声、息をのむ音、泣き声、咳、ため息などを文章に加えます。テキストに生き生きとした表現を与え、スクリプトを読んでいるのではなく、思いつくまま話している人のように自然なTTSオーディオサンプルに仕上げます。

リアクション用Audio Tagsの例:

  • [laughs] 本当に引っかかったの? 
  • [sighs] わかった。皿洗いは私がやる。 
  • [gasps] それ、本物のダイヤモンド? 
  • [clears throat] 皆さん、ご注目いただけますでしょうか。 
  • [crying] 戻ってくるとは思わなかった。

Eleven v4は、感情に応じて小さな人間らしさも加えます。感情ホイールを聴くと、「Y- you came back?」や「Ugh, this is real?」のようなセリフが聞こえます。v4が自動的にどもりやうめき声を加えています。

[clears throat] Hi, everyone. For those who don't know me, I'm the best man. [laughs] Well, I'm the only man Tom could find at short notice. [sighs] When Tom first told me about Adam, I thought, there's no way he’s real. [gasps] Sorry, is that the cake? It's enormous. Anyway. [starts crying] I've never seen him this happy. [laughs] Okay, I'm fine. I'm fine. To Tom and Adam!
0:00

この声を自分の作品で使うには、Jack Johnを探してください。 

アクセント・キャラクター用Audio Tagsリスト

Eleven v4なら、さまざまなアクセントやキャラクターボイスで豊かなシーンを作るのがこれまで以上に簡単です。少数のAudio Tagsだけで、元の声の特徴を保ちながら新しいペルソナへ切り替えられます。1回の生成で、1つの声がキャスト全員を演じることも可能です。

  • [British accent] 紅茶でも一杯どう?
  • [French accent] 小さなカフェへようこそ。
  • [Australian accent] 心配ないよ、相棒。何とかするさ。
  • [pirate voice] 帆を上げろ、ラム酒を回せ。
Let's visit four stops in thirty seconds. First, London. [British accent] Mind the gap. Lovely weather we're having. [excited] Next, Dublin! [Irish accent] Grand day for it, isn't it? Sure, a bit of rain never hurt anyone. [rushed] No time, no time, on to Sydney! [Australian accent] G'day! Watch out for the seagulls, they'll nick your chips. [pirate voice] Arg, now the high seas, where the tour ends and the treasure begins!
0:00

Laurenが、このサンプルの作成に協力しました。

サウンドエフェクト用Audio Tagsリスト

サウンドエフェクト用Audio Tagsは、非音声イベントを生成に直接追加します。たとえば物語のシーンやゲームのトラックを作る際、別のSFXトラックなしでドラマチックな演出に使えます。特定の音が必要なら、いつでもAIサウンドエフェクトジェネレーターを使えます。 

  • [thunder rumbling] 近づいている。
  • [footsteps] 誰かが階段を上がってくる。
  • [door creaking] もしもし?誰かいますか?
  • [clapping] ありがとう、ありがとう。どうぞお気遣いなく。
[owl hooting] [nervous] Did you hear that? [gulp] It's just an owl, right? [twig snapping] [nervous] Okay, owls don't do that. [many footsteps] [scared] Something's walking around the tent. [zipper opening] [startled] Wait, who just opened the tent? [dog barking] [laughs] Biscuit! You scared me half to death. [sighs] Fine, you can sleep in here too.
0:00

上のクリップの声は、Sirenです。

自然言語で独自のAudio Tagsを書く

上で紹介したAudio Tagsは、どれも始めるのに最適です。しかしElevenLabs TTSの魅力は、モデルが使える追加コンテキストを与えるために、自然言語で新しいAudio Tagを自由に書けることです。 

また、1語のタグだけでは求める表現を捉えられない場合は、より詳しい指示を書きましょう。

  • 感情と特性を組み合わせる: [tense, cautious]または[whispering, fearful]
  • 話し方を説明する: [like a sports commentator, speeding up]
  • 状況を説明する: [out of breath after running up the stairs]
  • キャラクターを説明する: [a tired detective who has heard it all before]
  • 変化を説明する: [starting calm, then losing patience]
[hushed and reverent, like a nature documentary narrator] Here, in the quiet of the office kitchen, a rare creature emerges. [barely containing excitement] The intern. [slow and suspenseful] He approaches the last slice of birthday cake. He has been waiting for this moment all afternoon. [speeding up, like a sports commentator] He's going for it, he's reaching, he's almost there, he's- [sudden, crushed disappointment] Someone from accounts got there first. [hushed and reverent] Nature, as always, is cruel.
0:00

シーンに命を吹き込むなら、Spuds Oxleyをどうぞ。 

Audio Tagsを選ぶヒント 

自然言語で書くと、テキスト読み上げオーディオサンプル作成の柔軟性が大きく広がります。一方で、理想の出力を得るまでに何度か試行錯誤が必要になることもあります。

Eleven v4でのTTS体験をできるだけスムーズにするため、Audio Tagsを使う際のヒントをご紹介します:

  • 書く前に聴く: 感情ホイールでいくつかの感情を再生し、v4がそれぞれをどう解釈するかを確認しましょう(インスピレーションを得るのにも使えます)。その後、セリフに最も近いものを選びます。
  • セリフを書き直す前にタグを変える: 話し方がうまくいかない場合は、[despair]の代わりに[let down]のような近い感情を試し、再生成してください。
  • 句ごとにタグを1つ使う: 同じ言葉に対照的なタグを付けると、演技がぼやけることがあります。感情を変えたい箇所に新しいタグを追加してください。
  • モデルにシーン全体を与える: Eleven v4はコンテキストがあると、より良い演技をします。テキスト読み上げアプリでは1回の生成につき最大10,000文字のウィンドウがあるため、レイヤー化した指示を書き込み、シーンに魔法を生み出せます。
  • プリセットから始め、具体化する。 [nervous]が近いけれど少し違うなら、足りない要素を書き出しましょう:[nervous, trying to sound confident]。

何よりも、ElevenLabsのTTSアプリを開いて試してみることが、使い方をすばやく身につけ、高品質なTTSオーディオを作り始める一番の方法です。

Guide to six ElevenLabs audio tag list types and layering multiple cues with comma-separated tags.

Eleven v4で没入感のあるオーディオを始めよう

自然言語で書けば好きな組み合わせを作れるため、決定版のElevenLabs Audio Tagsリストは存在しません。このリストのすべてのタグはEleven v4で使えますが、シーンを書きながら思いついたタグも同様に使えます。

17,500以上の声から1つをボイスライブラリで選び、スクリプトを貼り付けて、最初のAudio Tagを追加しましょう。 

詳しくは Eleven v4をご覧ください。または登録して印象的なオーディオパフォーマンスを作りましょう。

ElevenLabs Audio Tagsに関するよくある質問

  1. Artificial Analysis、Provider Voice Arena Preference Elo、2026年9月30日

関連記事

最高品質のAIオーディオで創造する