Eleven v3 Audio Tags:音声でキャラクターの演技を演出
- 公開日
- 最終更新日
Audio Tagsは、新たな研究プレビュー版テキスト読み上げモデルであるEleven v3(alpha)の強力なツールです。トーンやペースだけでなく、キャラクターや音声パフォーマンスまで細かく演出できます。
[pirate voice]、[French accent]、[sarcastically]のようなタグを使えば、音声は単なるナレーションではなく、物語を語るためのツールになります。優れたキャラクターのボイスクローンと組み合わせれば、単なる音ではなく、完成されたパフォーマンスを捉えられます。
これらのタグを使えば、元の台本を変えたり別の音声に切り替えたりせずに、セリフの途中で声のアイデンティティを変えたり、アクセントを再現したり、悪役、語り手、相棒といったアーキタイプを演じたりできます。
AI音声におけるキャラクターパフォーマンスとは?

キャラクターパフォーマンスとは、役になりきる力です。派手な悪役、荒々しい海の船長、メルボルンの地元商店主など、どんな役でも、新しいAudio Tagsで伝えたいペルソナに合わせて話し方を演出できます。
シンプルな角括弧のフレーズで、場面を設定できます。「[pirate voice] よう、広い海だ。におうか、野郎ども? 自由の香りだ……そして、ほんの少しの反乱の気配もな。」
モデルは単に言葉を発音するだけではありません。キャラクターとして演じます。
アクセントからアーキタイプまで
ボイスパフォーマンスは、音量や感情だけでは決まりません。誰が話しているかも重要です。Eleven v3なら、特定のアクセント、方言、話し方をその場で指定できます。たとえば:
[American accent] 旧モデルでアクセントを変えられたか? [dismissive] できなかっただろ。 [Australian accent] でも今ならできる——ほら、見てみなよ! [French accent] 愛は……赤く赤いバラのようなものです。
このように流動的にアイデンティティを切り替えられる機能は、アニメーション、ゲーム、インタラクティブフィクションなど、話し手の個性が重要になるあらゆる場面に最適です。
キャラクターパフォーマンスでよく使われるタグ
キャラクターに焦点を当てたタグで、声のアイデンティティや存在感を形作れます:
- アクセント&方言: [British accent], [Australian accent], [Southern US accent]
- アーキタイプ&役柄: [pirate voice], [evil scientist voice], [childlike tone]
- 話し方: [dramatic], [sarcastically], [matter-of-fact], [whiny]
- ジャンルの手がかり: [fantasy narrator], [sci-fi AI voice], [classic film noir]
タグを重ねると、キャラクターに命を吹き込めます。「[dramatic][French accent] あなたには分からない……これは復讐のためではなかった。運命のためだったのです。」
語り手からアンサンブルキャストへ
複数キャラクターの台本では、Audio Tagsを使うことで、声を簡単に切り替えられます。会話の途中でキャラクターパフォーマンスを切り替えるだけで、緊張感、ユーモア、驚きを加えられます。追加の編集は不要です。
デモから次の抜粋をご紹介します: 「ジェシカ: [laughs] あれは……美しかった。フュージョン博士: [dramatic] 生きるべきか、死ぬべきか——それが問題だ! ジェシカ: [French accent] これは素晴らしいですよね?」
かつてはフルキャストが必要だった表現も、今では一つの音声トラックで台本化できます——幅広さや深みを犠牲にすることなく。
セリフを書くのではなく、声を演出する
Eleven v3は、ダイナミックな声の変化、文脈に応じた切り替え、キャラクター間で一貫した話し方に対応しています。つまりモデルは、何を話すかだけでなく、各キャラクターがどのように話すべきかも理解します。
クリエイターにとって、これは新たな次元のコントロールをもたらします。単に会話を書くだけではありません。パフォーマンスを演出するのです。
適切な音声を選ぶ
プロフェッショナルボイスクローン(PVC)は現在、Eleven v3向けに完全には最適化されていないため、以前のモデルと比べてクローン品質が低くなる可能性があります。この研究プレビュー期間中にv3の機能を使う必要がある場合は、プロジェクトに適したインスタントボイスクローン(IVC)またはデザインされた音声を見つけることをおすすめします。v3向けのPVC最適化は、近いうちに提供予定です。


