ボイスクローン
ボイスクローン
最高クラスのモデルを使ってボイスをクローンする方法を学びましょう。
概要
ボイスをクローンするには、主にインスタントボイスクローンとプロフェッショナルボイスクローンの2つの方法があります。インスタントボイスクローンは、手軽かつ迅速にボイスをクローンする方法です。一方、プロフェッショナルボイスクローンは、より高精度でカスタマイズ性に優れた方法です。
インスタントボイスクローン

インスタントボイスクローンでは、短いサンプルからほぼ瞬時にボイスクローンを作成できます。インスタントボイスクローン(IVC)の作成では、カスタムAIモデルの学習や作成は行いません。代わりに、対象のボイスそのものを学習するのではなく、学習データから得た既存の知識をもとに推定します。
これは多くのボイスで非常に効果的です。ただし、IVCの最大の制約は、非常にユニークなボイスや、AIが学習時に十分に経験していないアクセントのボイスをクローンしようとする場合です。このような場合は、明示的な学習によってカスタムモデルを作成できるプロフェッショナルボイスクローンが最適な選択肢となることがあります。
プロフェッショナルボイスクローン

プロフェッショナルボイスクローンは、クリエイタープラン以上で利用できる機能です。より多くのボイスデータを使用して専用モデルを学習することで、元のボイスとほぼ区別できないモデルを生成し、よりリアルなボイスモデルを作成できます。
カスタムモデルには微調整と学習が必要なため、PVCの学習にはIVCよりも時間がかかります。通常、微調整の完了には3〜6時間かかりますが、微調整待ちのPVC数によってはさらに時間がかかることがあります。
オーディオ録音初心者ガイド
オーディオ録音を初めて行う場合は、以下のヒントをご覧ください。
録音場所
オーディオを録音する際は、適切な場所を選び、室内のエコーやリバーブを最小限に抑える環境を整えてください。 できるだけ部屋の響きを抑えることが重要です。これは、音響処理されたボーカルブースがまさにそのために作られている理由です。ボーカルブースをすぐに用意できない場合は、自作のボーカルブース、「毛布の要塞」、またはクローゼットなどを試してみてください。
自作の音響対策アイデアを紹介するYouTube動画をいくつかご紹介します。
マイク、ポップフィルター、オーディオインターフェース
優れたマイクは不可欠です。マイクの価格帯は$100〜$10,000と幅広いですが、ほとんどのボイスオーバー作業には$150〜$300のプロ仕様XLRマイクで十分です。
手頃な価格で高品質なボイスオーバー用セットアップとしては、FocusriteインターフェースとAudio-Technica AT2020またはRode NT1 microphoneの組み合わせをご検討ください。$300〜$500のこのセットアップは、自己ノイズを最小限に抑えたプロ仕様の高品質録音を実現します。
録音時は、破裂音、呼吸音、空気がダイアフラムやマイクに直接当たるのを防ぐため、マイク前方に適切なポップフィルターを設置してください。これらは音質を損ない、クローンプロセスでも問題を引き起こします。
デジタルオーディオワークステーション(DAW)
オーディオを録音するためのソリューションは数多くありますが、すべてが同じ品質というわけではありません。少なくとも24ビットのビット深度で、44.1kHzまたは48kHzのWAVファイルを録音できれば問題ありません。オーディオ録音はシンプルに保ちたいので、高度なポストプロセッシング、プラグイン、ノイズ除去などは必要ありません。
おすすめを挙げるなら、非常に柔軟性に優れた素晴らしいDAWであるREAPERがおすすめです。多くのオーディオ作業における業界標準です。もう1つの優れた無料オプションはAudacityです。
デジタル歪みや過度なノイズを避けるため、最適な録音レベルを維持してください(大きすぎず、小さすぎず)。ボイスオーバーでは、ノイズフロアを抑えながら明瞭さを確保するため、ピークを-6dB〜-3dB、平均ラウドネスを-18dBにすることを目安にしてください。プロジェクトや録音環境に応じて注意深くモニタリングし、最良の結果が得られるようレベルを調整してください。
位置
役立つ目安として、マイクとの距離を拳2つ分、約20cm(7〜8インチ)に保ち、その間にポップフィルターを設置してください。ポップフィルターをマイクにぴったり接する位置まで後ろに下げることを好む人もいます。こうすると、マイクとの距離を一定に保ちやすくなります。
マイクに直接息がかかることや破裂音を避けるもう1つの一般的なテクニックは、少し角度をつけて話すことです。角度をつけて話すことで、吐いた息がマイクに直接当たりにくくなり、マイクの横を通り抜けます。
話し方
録音セッション全体において、話し方は最も重要な要素の1つです。AIは非常に高い精度で、ボイスに関するあらゆる要素をクローンしようとします。つまり、話すリズム、音色、話し方のスタイル、間の長さ、吃音、深い呼吸、息混じりの声、「えー」や「あの」といったフィラーの多さまで再現しようとします。これらも再現可能です。したがって、オーディオファイルには、クローンしたい話し方とボイスを過不足なく収録する必要があります。そのため、目指す音色に合った読み上げ用スクリプトを見つけることも重要です。
AI用に録音する際は、一貫性を保つことが非常に重要です。活気のあるボイスを録音するなら最初から最後まで活気を保ち、落ち着いたボイスを録音するなら最後まで落ち着いた状態を保ってください。混在させると、AIはボイスのどの部分をクローンすべきか判断できず、不安定になる可能性があります。アクセントを使用する場合も、録音全体で同じアクセントを維持してください。適切なクローンには一貫性が不可欠です!






