プロフェッショナルボイスクローン
プロフェッショナルボイスクローン
最高クラスのモデルを使って、プロ仕様のボイスクローンを作成する方法を学びましょう。
プロフェッショナルボイスクローンの作成
ボイスをクローンする際は、AIが何を学習しているか、つまり対応言語やデータセットの種類を考慮することが重要です。各モデルとその強みについては、モデルページをご覧ください。
ガイド
プロフェッショナルボイスクローンのページに移動する
ElevenLabsダッシュボードで、左側のVoicesセクションを選択し、Create Voiceをクリックします。
ポップアップから、Professional Voice Cloneを選択します。
オーディオをアップロードする
プロフェッショナルボイスクローンは現在、歌唱には対応していません。オーディオ録音には、話し声のみを含める必要があります。

Upload samplesをクリックして、オーディオサンプルをアップロードします。
事前に録音した学習用オーディオがない場合は、Record yourselfを選択してインターフェース上で直接録音することもできます。ナレーション、会話、広告向けのサンプルスクリプトも用意されています。独自のスクリプトをアップロードすることも可能です。
サンプルの長さに関するフィードバックを確認する
オーディオをアップロードすると、サンプルの長さに関するフィードバックが表示されます。最良の結果を得るには、少なくとも1時間、できれば3時間程度の学習用オーディオをアップロードすることをおすすめします。

オーディオを処理する
オーディオサンプルをアップロードしたら、品質向上のために処理できます。バックグラウンドノイズを除去したり、複数の話者が含まれるオーディオでは話者ごとに分離したりできます。これらのオプションにアクセスするには、処理したいクリップの横にあるAudio settingsボタンをクリックします。

サンプルのアップロードを始める前に注意すべき点と、可能な限り良い結果を得るために必要な手順がいくつかあります。
高品質なオーディオを録音する
プロフェッショナルボイスクローンは、学習に使用したサンプルを非常に正確にクローンします。声の細かな特徴や特性だけでなく、サンプルに含まれるアーティファクトや不要な音声まで含めて、聞こえたものをほぼ完璧にクローンします。つまり、バックグラウンドノイズ、室内の残響・エコー、音楽や複数人の話し声などの不要な音を含む低品質なサンプルをアップロードすると、AIはそれらの要素もクローンで再現しようとします。
話している声を1人だけにする
複数の話者、過度なノイズ、または上記のような要素があるとAIが混乱するため、オーディオ全体を通して話している声が1人だけであることを確認してください。この混乱により、AIがどの声をクローンすべきか判断できなかったり、ほかの音に覆われて実際の声質を誤って解釈したりして、最適とは言えないクローンになる場合があります。
十分な素材を用意する
ボイスを適切にクローンできるだけの素材があることを確認してください。推奨する最低限の長さは30分ですが、最適かつ最も正確なクローンを得るには、2〜3時間程度のオーディオをおすすめします。提供するオーディオが多いほど、生成されるクローンの品質も向上します。
スタイルを一貫させる
提供したサンプルの話し方は出力にも再現されるため、求める話し方に応じて、学習データもそのスタイルに合わせる必要があります(例:自分の声のクローンでオーディオブックを読み上げたい場合は、使用したい声のトーンで本を読んでいる録音を学習用に送信してください)。一貫性を保つため、アップロードするサンプルには1つのスタイルだけを含めることをおすすめします。
PVCで使用したい言語を話しているサンプルを使う
PVCで主に使用する言語を話しているサンプルを使用するのが最適です。もちろん、AIは現在対応しているすべての言語を話せます。ただし、AIに話させたい言語がそのボイスの母語ではない場合、つまり別の言語を話しているボイスをクローンした場合は、元の言語のアクセントが残ったり、単語や抑揚を誤って発音したりする可能性があります。たとえば、英語を話しているボイスをクローンしてからスペイン語を話させると、スペイン語を話す際に英語アクセントが付く可能性が非常に高くなります。クローンできるのは対応言語のいずれかで録音されたサンプルのみです。非対応言語で録音されたサンプルは、アプリケーションで拒否されます。
良い録音と悪い録音で何が期待できるかについては、以下の例をご覧ください。
現在は、ご自身のボイスのみクローンできます。微調整リクエストを送信する前に、認証プロセスを完了する必要があります。
ヒントと提案
プロ仕様の録音機材
プロ仕様の録音機材
AIはオーディオのあらゆる要素をクローンするため、最適な結果を得るには高品質な録音機材を使用してください。高品質な入力は高品質な出力につながります。どのマイクでも使用できますが、専用のオーディオインターフェースに接続したXLRマイクがおすすめです。低価格帯では、Audio Technica AT2020やRode NT1をFocusriteのインターフェースなどに接続する構成が一般的なおすすめです。
ポップフィルターを使用する
ポップフィルターを使用する
録音時にはポップフィルターを使用してください。これにより、録音時の破裂音を最小限に抑えられます。
マイクとの距離
マイクとの距離
マイクから適切な距離に位置してください。目安はマイクから拳2つ分程度ですが、どのような録音をしたいかにも左右されます。
ノイズのない録音
ノイズのない録音
バックグラウンドミュージックやノイズなど、オーディオ入力に干渉がないことを確認してください。AIクローンは、クリアで雑音のないオーディオで最も効果を発揮します。
室内音響
室内音響
可能であれば、音響処理を施した部屋で録音してください。不要なエコーやバックグラウンドノイズが減り、AIによりクリアなオーディオを入力できます。厚手の羽毛布団やキルトを使って録音スペースを吸音すれば、一時的な対策も可能です。
オーディオの前処理
オーディオの前処理
AIに特定の音を出力させたい場合は、事前にオーディオを編集することを検討してください。たとえば、洗練されたポッドキャストのような出力が必要な場合は、その品質に合わせてオーディオを前処理してください。また、単語の間に長い間や「あの」「えー」が多くある場合も、AIはそれらを再現します。
音量管理
音量管理
明瞭に聞こえる十分な音量を維持しつつ、歪みが発生するほど大きくしないようにしてください。目標は、バランスが取れた安定したオーディオレベルです。理想的には、RMSが-23dB〜-18dB、トゥルーピークが-3dBです。
十分なオーディオの長さ
十分なオーディオの長さ
最良の結果を得るには、上記のガイドラインに従った高品質なオーディオを少なくとも30分、できれば2時間以上提供してください。AIに入力できる高品質なデータが多いほど、ボイスクローンの品質も高くなります。サンプル数は関係なく、重要なのは合計の再生時間です。ただし、数時間分のオーディオをアップロードする場合は、約30分ごとの複数サンプルに分割することをおすすめします。アップロードがしやすくなります。






