インスタントボイスクローン
インスタントボイスクローン
最高クラスのモデルを使って、音声をすぐにクローンする方法をご紹介します。
インスタントボイスクローンを作成する
ボイスをクローンする際は、AIがどのようなデータで学習しているか、つまり対応言語やデータセットの種類を考慮することが重要です。各モデルの詳細と強みについては、モデルページをご覧ください。
ガイド
法的に許可される内容が不明な場合は、詳しくは利用規約とAIセーフティに関する情報をご確認ください。
ベストプラクティス
少なくとも1分間のオーディオを録音する
少なくとも1分間のオーディオを録音する
3分を超えて録音しても改善はほとんど見込めず、場合によってはクローンの品質を損なうこともあります。
サンプルの合計時間(総再生時間)よりも、オーディオをどのように録音したかのほうが重要です。使用するサンプル数は重要ではなく、重要なのは合計時間(総再生時間)です。
リバーブ、アーティファクト、あらゆる種類のバックグラウンドノイズがない、明瞭なオーディオを約1〜2分用意することをおすすめします。「オーディオまたは録音品質」とは、MP3やWAVなどのコーデックではなく、オーディオの収録方法を指します。ただし、オーディオコーデックについては、128kbps以上のMP3を使用することをおすすめします。ビットレートを上げても、クローンの品質に大きな影響はありません。
オーディオの一貫性を保つ
オーディオの一貫性を保つ
AIは、オーディオ内で聞こえるあらゆる要素を模倣しようとします。話す速度、抑揚、アクセント、音色、呼吸のパターンや強さに加え、ノイズや口のクリック音も含まれます。AIを混乱させる可能性があるノイズやアーティファクトも反映されます。
一貫した話し方で、ボイスのトーンを最初から最後まで一定に保ってください。また、すべてのサンプルでボイスのオーディオ品質が一貫していることを確認してください。サンプルを1つだけ使用する場合でも、そのサンプル全体で一貫性を保ってください。ピッチや音量の変動が大きい、非常にダイナミックなオーディオをAIに与えると、結果の予測が難しくなります。
話し方を再現する
話し方を再現する
もう1つ重要なのは、AIが提供されたボイスの話し方を再現しようとすることです。感情をあまり込めず、ゆっくりと単調に話せば、AIもそれを模倣します。一方、感情を込めて速く話せば、AIもそれを再現しようとします。
トーンだけでなく話し方についても、すべてのサンプルでボイスの一貫性を保つことが重要です。ばらつきが大きすぎるとAIが混乱し、生成ごとの出力の差が大きくなる可能性があります。
適切な音量バランスを見つける
適切な音量バランスを見つける
オーディオが小さすぎたり大きすぎたりしないよう、適切な音量バランスを見つけてください。理想は、トゥルーピーク-3dBで、RMSが-23dB〜-18dBの範囲です。

