ポーズを追加するにはどうすればよいですか?

ポーズや間を加え、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。

オーディオタグ(Eleven v3のみ)

Eleven v3では、オーディオタグと句読点を使って話すペースや話し方を制御します。Eleven v3はSSMLのbreakタグには対応していません。

v3でポーズや話し方を指示する方法については、Eleven v3プロンプトガイドをご覧ください。

Breakタグ(Multilingual v2、Flash v2、Flash v2.5)

Multilingual v2、Flash v2、Flash v2.5でポーズを追加する最も一貫した方法は、SSMLのbreakタグ構文<break time="1.5s" />を使用することです。これにより、発話に正確で自然なポーズが生まれます。単に単語の間に無音を挿入するだけではありません。モデルが構文を理解し、自然なポーズを加えます。

これらのポーズの処理方法は、モデルによって異なる場合があります。使用する音声が出力に重要な役割を果たします。「えー」や「あー」が含まれるデータで学習した音声は、実際の話者のように、ポーズ中にそうした発声の癖を挿入することがあります。

たとえば、次のようになります:

「少し考えさせてください。」<break time="1.0s" />「はい、それで大丈夫です。」

breakの時間は秒単位で指定してください。AIは最大3秒のポーズを処理でき、テキスト読み上げとAPIで使用できます。

テキスト内でSSMLのbreakを過度に使用すると、問題が発生する場合があります。発話速度が速くなったり、オーディオにノイズなどのアーティファクトが増えたりすることがあります。この問題は解決に取り組んでいます。

句読点

これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、話すペースに影響を与えることはできます。

単純なハイフン-やダッシュ—は、よく機能します。より長いポーズには、-- --のように複数のハイフンを追加できます。

「もう - 遅く - なってきました。」

省略記号...は単語の間にポーズを加えることがありますが、通常は声にためらいや緊張感も加わるため、常に適しているとは限りません。

「私…うん、そうだと思う…」