ポーズを追加するにはどうすればよいですか?
ポーズを追加するにはどうすればよいですか?
ポーズや間を加え、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。
オーディオタグ(Eleven v3のみ)
Eleven v3では、オーディオタグと句読点を使って話すペースや話し方を制御します。Eleven v3はSSMLのbreakタグには対応していません。
v3でポーズや話し方を指示する方法については、Eleven v3プロンプトガイドをご覧ください。
Breakタグ(Multilingual v2、Flash v2、Flash v2.5)
Multilingual v2、Flash v2、Flash v2.5でポーズを追加する最も一貫した方法は、SSMLのbreakタグ構文<break time="1.5s" />を使用することです。これにより、発話に正確で自然なポーズが生まれます。単に単語の間に無音を挿入するだけではありません。モデルが構文を理解し、自然なポーズを加えます。
これらのポーズの処理方法は、モデルによって異なる場合があります。使用する音声が出力に重要な役割を果たします。「えー」や「あー」が含まれるデータで学習した音声は、実際の話者のように、ポーズ中にそうした発声の癖を挿入することがあります。
たとえば、次のようになります:
「少し考えさせてください。」<break time="1.0s" />「はい、それで大丈夫です。」
breakの時間は秒単位で指定してください。AIは最大3秒のポーズを処理でき、テキスト読み上げとAPIで使用できます。
テキスト内でSSMLのbreakを過度に使用すると、問題が発生する場合があります。発話速度が速くなったり、オーディオにノイズなどのアーティファクトが増えたりすることがあります。この問題は解決に取り組んでいます。
句読点
これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、話すペースに影響を与えることはできます。
単純なハイフン-やダッシュ—は、よく機能します。より長いポーズには、-- --のように複数のハイフンを追加できます。
「もう - 遅く - なってきました。」
省略記号...は単語の間にポーズを加えることがありますが、通常は声にためらいや緊張感も加わるため、常に適しているとは限りません。
「私…うん、そうだと思う…」