Eleven v4でAIボイスオーバーに間を追加する方法
- 公開日
- 最終更新日
AIテキスト読み上げモデルでは、話し方がすべてです。声の品質とプロソディへの理解は大切ですが、タイミングがなければ文章はまとまりません。セリフの後に少し間を置いたり、長めの沈黙を入れたりすることは、高品質な出力を生み出すうえで重要です。
一般的なテキスト読み上げツールでは、間の入り方は偶然任せです。ある生成では意図どおりでも、再生成すると失われてしまうことがあります。Eleven v4では再生成ワークフローが改善され、そうした問題は過去のものになりました。スクリプト内の個々のセリフやフレーズを簡単に微調整できます。
さらに、最初から最高のスクリプトを作るために、Eleven v4ではテキストに直接AIボイスオーバーの間を組み込む3つの方法を用意しています。それぞれの機能と使いどころをご紹介します。
Eleven v4を聴いてみる
Eleven v4を見るまとめ
- Eleven v4ではSSMLタグは使えません。代わりにオーディオタグを使用し、[long pause]や[whispers]のような演出指示をスクリプトに直接書き込みます。
- 句読点を変えることで文章のリズムを調整できます。ダッシュ、三点リーダー、短い文によって、TTS出力の聞こえ方を形作れます。
- 効果的な間を入れるには、人が話すときに自然に止まる場所に配置してください。
- 長尺オーディオでは、出力の一貫性を保つため、全体を通して同じ間のルールを使ってください。
以前のモデルから何が変わった?
Multilingual v2などの以前のElevenLabsモデルでは、SSML構文に対応していました。<break time=”2.0s” />のような構造を文中に書くことで、2秒の間を追加できました。Eleven v4では、Eleven v3で導入されたアプローチを引き継ぎ、SSMLタグをより直感的なAudio Tagsに置き換えています。
ライターにとって、この変更によりAIボイスオーバーに間を入れる作業が大幅に簡単になります。どのSSMLタグを使うべきかを正確に把握する必要はありません。[pause]や[long pause]を使い、自然な言葉で書くだけです。これらのタグはモデルへの指示となり、モデルはシーンの文脈に応じて反応し、ニュアンス豊かな最終パフォーマンスを生み出します。あらかじめ定義された機械的な無音時間ではなく、その瞬間に合った長さの間が入ります。
この記事の主題ではありませんが、Audio Tagsを使って、段落ごとに感情を変化させることで感情豊かなテキスト読み上げを作成することもできます。

Eleven v4の3つの間の調整方法
Eleven v4では、AIボイスオーバーに間を追加する3つの方法を利用できます。
テキストエディターでの実際の使い方と、音声例でそれぞれがどのように聞こえるかをご紹介します。
![Eleven v4 pause controls: [pause], [long pause], and punctuation, with context-based timing. Discover how to add pauses in AI voiceover with these tags](/_next/image?url=https%3A%2F%2Feleven-public-cdn.elevenlabs.io%2Fpayloadcms%2Ft0acu8ggm9-three-pause-controls-eleven-v4.webp&w=3840&q=80)
[pause]
pauseは短い間です。息継ぎや、話し手が文を続ける前に自然に取る間にほぼ相当します。[pause] Audio Tagは、前置きのセリフの後、分けたい2つのアイデアの間、特に強調したいフレーズの後、または句点だけでは急ぎすぎに感じる場所に使うのが最適です。
以下の例では、同じセリフを[pause] Audio Tagあり・なしで使っています。音声クリップを聞かなくても、一方は4秒、もう一方は6秒だとわかるでしょう。[pause]による追加の間が、最終的なクリップの長さに反映されます。
[pause]ありの例
上記のクリップは、FlintをEleven v4で使用して生成しました。
[long pause]
long pauseはより意図的な間で、オーディオクリップに沈黙の瞬間を作ります。この沈黙は、劇的な緊張感を演出したいとき、シーンの切れ目、何かを明かす前、または沈黙を強調したい場所で使えます。
シーン内での[long pause]の例をご紹介します。
このオーディオクリップは、Spuds OxleyがEleven v4で音声を担当しました。
句読点
Eleven v4では、句読点をペース配分の指示として扱います。三点リーダーを加えるとセリフの読み上げが遅くなり、ためらいの瞬間を作れます。文の構成を変えることで、長い文章の単調さも解消できます。短く。小気味よく。直接的に。
スクリプト全体でAudio Tagsを使用できますし、パフォーマンスの読み上げを改善するために使用すべきです。しかし、句読点だけでも大きな効果を発揮します。
次の文章では、Audio Tagsがなくても、句読点だけでテキストにどれほど生命感を与えられるかがわかります。
この音声サンプルは、Lauren BをEleven v4で使用して制作しました。
長尺オーディオでの間
長尺オーディオの生成では、スクリプト全体で一貫したアプローチを取ることが最も効果的です。たとえば、最初の1,500文字では句読点だけを使用し、最後の1,000文字で[long pause] Audio Tagsを使い始めると、出力が不自然に聞こえる可能性があります。
スクリプトを書く前に、どのアプローチを取るか決めましょう。すでに書き終えている場合は、Audio Tagsを全体に一貫して適用してください。「Generate speech」の横にある「v4 Enhance」ボタンを使うと、文章にAudio Tagsが自動で追加されます。

ElevenCreativeでEleven v4を始める
Eleven v4がシーンに命を吹き込みます。
テキストのペースを調整し、Audio Tagsを追加することで、ボイスライブラリの17,500以上の声を使って、豊かなボーカルパフォーマンスを作成できます。
詳しくは完全版の感情豊かなテキスト読み上げガイドをお読みください。または、登録して、今日から最初の生成を始めましょう。



