Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

Eleven v3 Audio Tags:音声でキャラクターの演技を演出

執筆者
Ryan Morrison
公開日
最終更新日

聴くこの記事を聴く

Audio Tagsは、新たな研究プレビュー版テキスト読み上げモデルであるEleven v3(alpha)の強力なツールです。トーンやペースだけでなく、キャラクターや音声パフォーマンスまで細かく演出できます。 

[pirate voice]、[French accent]、[sarcastically]のようなタグを使えば、音声は単なるナレーションではなく、物語を語るためのツールになります。優れたキャラクターのボイスクローンと組み合わせれば、単なる音ではなく、完成されたパフォーマンスを捉えられます。

これらのタグを使えば、元の台本を変えたり別の音声に切り替えたりせずに、セリフの途中で声のアイデンティティを変えたり、アクセントを再現したり、悪役、語り手、相棒といったアーキタイプを演じたりできます。

AI音声におけるキャラクターパフォーマンスとは?

キャラクターパフォーマンスとは、役になりきる力です。派手な悪役、荒々しい海の船長、メルボルンの地元商店主など、どんな役でも、新しいAudio Tagsで伝えたいペルソナに合わせて話し方を演出できます。

シンプルな角括弧のフレーズで、場面を設定できます。「[pirate voice] よう、広い海だ。におうか、野郎ども? 自由の香りだ……そして、ほんの少しの反乱の気配もな。」

モデルは単に言葉を発音するだけではありません。キャラクターとして演じます。

アクセントからアーキタイプまで

Arr, the open ocean. Smell that, lads? That's the scent of freedom and just a hint of mutiny. [laughs wickedly] Now grab your cutlasses, stow your fear. Tonight, we dine like kings or we sink like legends. [evil laugh]
0:00

ボイスパフォーマンスは、音量や感情だけでは決まりません。誰が話しているかも重要です。Eleven v3なら、特定のアクセント、方言、話し方をその場で指定できます。たとえば:

[American accent] 旧モデルでアクセントを変えられたか? [dismissive] できなかっただろ。 [Australian accent] でも今ならできる——ほら、見てみなよ! [French accent] 愛は……赤く赤いバラのようなものです。

このように流動的にアイデンティティを切り替えられる機能は、アニメーション、ゲーム、インタラクティブフィクションなど、話し手の個性が重要になるあらゆる場面に最適です。

キャラクターパフォーマンスでよく使われるタグ

キャラクターに焦点を当てたタグで、声のアイデンティティや存在感を形作れます:

  • アクセント&方言: [British accent], [Australian accent], [Southern US accent]
  • アーキタイプ&役柄: [pirate voice], [evil scientist voice], [childlike tone]
  • 話し方: [dramatic], [sarcastically], [matter-of-fact], [whiny]
  • ジャンルの手がかり: [fantasy narrator], [sci-fi AI voice], [classic film noir]

タグを重ねると、キャラクターに命を吹き込めます。「[dramatic][French accent] あなたには分からない……これは復讐のためではなかった。運命のためだったのです。」

語り手からアンサンブルキャストへ

複数キャラクターの台本では、Audio Tagsを使うことで、声を簡単に切り替えられます。会話の途中でキャラクターパフォーマンスを切り替えるだけで、緊張感、ユーモア、驚きを加えられます。追加の編集は不要です。

[excited] Yo, Jessica. Oh my goodness, have you tried the new ElevenLabs v3?
[chuckles] Hey, Dr. Von Fusion. Yeah, I just got it. The clarity is amazing. Like, I can actually do whispers now, [whispers] like this.
[sarcastically] Ooh, well, look at you, miss fancy pants. Hey, check this out. I can do full Shakespeare now. [dramatically] To be or not to be, that is the question.
[chuckles] Nice. Though I'm more excited about the laugh upgrade. Listen to this. [laughs hard] Isn't that great?
Oh my gosh, that's so much better than our old ha ha ha robot chuckle.
[chuckles] I know, right? And apparently, we can do accents now too. Listen to me in French. [french accent] This is spectacular, isn't it?
[surprised] Wow, version two could never. You know, I'm actually excited to have conversations now instead of just talking at people.
Same here. It's like we finally got our personality software fully installed.
You know, I forgot it was your birthday. I have to sing before you go.
[chuckles] Oh, Von Fusion, that's so sweet. You don't have to.
Oh, but I insist. Here we go. [sings] "Happy birthday to you. Happy birthday to you. Happy birthday, dear Jessica. Happy birthday to you." [clapping]
[clapping] Wow, bravo. That was [sarcastic] beautiful.
Thank you.
0:00

デモから次の抜粋をご紹介します: 「ジェシカ: [laughs] あれは……美しかった。フュージョン博士: [dramatic] 生きるべきか、死ぬべきか——それが問題だ! ジェシカ: [French accent] これは素晴らしいですよね?」

かつてはフルキャストが必要だった表現も、今では一つの音声トラックで台本化できます——幅広さや深みを犠牲にすることなく。

セリフを書くのではなく、声を演出する

Eleven v3は、ダイナミックな声の変化、文脈に応じた切り替え、キャラクター間で一貫した話し方に対応しています。つまりモデルは、何を話すかだけでなく、各キャラクターがどのように話すべきかも理解します。

クリエイターにとって、これは新たな次元のコントロールをもたらします。単に会話を書くだけではありません。パフォーマンスを演出するのです。

適切な音声を選ぶ

プロフェッショナルボイスクローン(PVC)は現在、Eleven v3向けに完全には最適化されていないため、以前のモデルと比べてクローン品質が低くなる可能性があります。この研究プレビュー期間中にv3の機能を使う必要がある場合は、プロジェクトに適したインスタントボイスクローン(IVC)またはデザインされた音声を見つけることをおすすめします。v3向けのPVC最適化は、近いうちに提供予定です。

関連記事

最高品質のAIオーディオで創造する