インスタントボイスクローン

最高クラスのモデルを使って、音声をすぐにクローンする方法をご紹介します。

ボイスクローンのプロダクト機能

インスタントボイスクローンを作成する

ボイスをクローンする際は、AIがどのようなデータで学習しているか、つまり対応言語やデータセットの種類を考慮することが重要です。各モデルの詳細と強みについては、モデルページをご覧ください。

ガイド

法的に許可される内容が不明な場合は、詳しくは利用規約とAIセーフティに関する情報をご確認ください。

1

インスタントボイスクローンのページを開く

ElevenLabsダッシュボードで、左側のVoicesセクションを選択し、プラスアイコンをクリックします。

モーダルでInstant Voice Cloneを選択します。

2

オーディオをアップロードまたは録音する

画面の指示に従って、オーディオをアップロードまたは録音します。

3

ボイスの詳細を確認する

ボイスクローンのIVCモーダル

ボイスクローンに名前とラベルを設定し、そのボイスをクローンする権利と同意があることを確認してから、Save voiceをクリックします。

4

ボイスクローンを使用する

ダッシュボードのVoicesセクションで、My Voicesをクリックし、次にUse voiceをクリックすると使用を開始できます。

ベストプラクティス

少なくとも1分間のオーディオを録音する

3分を超えて録音しても改善はほとんど見込めず、場合によってはクローンの品質を損なうこともあります。

サンプルの合計時間(総再生時間)よりも、オーディオをどのように録音したかのほうが重要です。使用するサンプル数は重要ではなく、重要なのは合計時間(総再生時間)です。

リバーブ、アーティファクト、あらゆる種類のバックグラウンドノイズがない、明瞭なオーディオを約1〜2分用意することをおすすめします。「オーディオまたは録音品質」とは、MP3やWAVなどのコーデックではなく、オーディオの収録方法を指します。ただし、オーディオコーデックについては、128kbps以上のMP3を使用することをおすすめします。ビットレートを上げても、クローンの品質に大きな影響はありません。

オーディオの一貫性を保つ

AIは、オーディオ内で聞こえるあらゆる要素を模倣しようとします。話す速度、抑揚、アクセント、音色、呼吸のパターンや強さに加え、ノイズや口のクリック音も含まれます。AIを混乱させる可能性があるノイズやアーティファクトも反映されます。

一貫した話し方で、ボイスのトーンを最初から最後まで一定に保ってください。また、すべてのサンプルでボイスのオーディオ品質が一貫していることを確認してください。サンプルを1つだけ使用する場合でも、そのサンプル全体で一貫性を保ってください。ピッチや音量の変動が大きい、非常にダイナミックなオーディオをAIに与えると、結果の予測が難しくなります。

話し方を再現する

もう1つ重要なのは、AIが提供されたボイスの話し方を再現しようとすることです。感情をあまり込めず、ゆっくりと単調に話せば、AIもそれを模倣します。一方、感情を込めて速く話せば、AIもそれを再現しようとします。

トーンだけでなく話し方についても、すべてのサンプルでボイスの一貫性を保つことが重要です。ばらつきが大きすぎるとAIが混乱し、生成ごとの出力の差が大きくなる可能性があります。

適切な音量バランスを見つける

オーディオが小さすぎたり大きすぎたりしないよう、適切な音量バランスを見つけてください。理想は、トゥルーピーク-3dBで、RMSが-23dB〜-18dBの範囲です。

FAQ

2分未満のオーディオで音声をすばやくクローンできるインスタントボイスクローンとは異なり、プロフェッショナルボイスクローンでは、よりリアルな音声モデルをトレーニングできます。大量の音声データで専用モデルをトレーニングすることで、元の音声とほとんど区別できないモデルを生成します。

プロフェッショナルボイスクローンには微調整とトレーニングが必要なため、ボイスクローンを使用できるようになるまで時間がかかります。待機中の人数など複数の要因に左右されるため正確な見積もりは難しいですが、通常、微調整には3~6時間かかります。

プロフェッショナルボイスクローンの準備が完了すると、メールで通知されます。

インスタントボイスクローンでのクローン作成はやや複雑で、一般的なガイドラインがあります。ただし、あくまでガイドラインです。サンプル数や長さについて決まったルールはありません。30秒のみのサンプルで優れた結果を得たユーザーもいれば、10分のオーディオを使用しても結果が悪かったユーザーもいます。ただし、考慮すべき点がいくつかあります。

  • インスタントボイスクローンを使用する際、最も重要なのはオーディオ品質です。
  • サンプル数は重要ではなく、重要なのは合計再生時間です。2〜3分を超えるオーディオを使用しても改善はほとんどなく、場合によってはクローンの安定性に悪影響を及ぼすことがあります。

インスタントボイスクローンとプロフェッショナルボイスクローンでは、さまざまなファイル形式に対応しています。192kbps以上のMP3を強く推奨します。

推奨形式

  • MP3、192kbps以上

推奨される長さ

  • インスタントボイスクローン:高品質なオーディオを1〜2分
  • プロフェッショナルボイスクローン:高品質なオーディオを30〜180分

WAVなどの非圧縮形式は通常、クローンの品質を向上させず、アップロード処理で問題が発生する可能性があります。代わりに録音品質を重視してください。バックグラウンドノイズ、部屋の残響、複数の話者がなく、音量と声のトーンが一定で、長い無音部分のないクリアな録音を使用してください。

詳細は、インスタントボイスクローン(IVC)およびプロフェッショナルボイスクローン(PVC)をご覧ください。

ElevenLabsは、知的財産権の尊重と、テクノロジーの悪用を防ぐための保護策の実装に全力で取り組んでいます。

  • 違法または有害と見なされる目的での悪意あるテクノロジーの使用を禁止する利用規約および禁止利用ポリシーを遵守するクライアントとのみ提携しています。
  • 音声の権利者およびそのライセンサーによる権利の主張を支援し、既知のすべての侵害を確認して対応します。
  • モデルによって生成されたすべてのオーディオは、生成を行ったユーザーまで即座に追跡できます。

開発中のテクノロジーは新しく、明確な規制はまだ導入されていません。AI研究ラボとしての目標の一つは、このテクノロジーの存在、その可能性、そして限界についての認識を広めることです。

詳しいガイドについては、インスタントボイスクローンとプロフェッショナルボイスクローンのドキュメントを読むことを強くおすすめします。

要点は、良質で一貫した入力=良質で一貫した出力、ということです。

長さ

  • インスタントボイスクローン:良質なオーディオを1~2分
  • プロフェッショナルボイスクローン:良質なオーディオを30~180分

可能な限り、最良で最もクリアなオーディオクリップを使用してください。話者は1人だけにし、バックグラウンドノイズや干渉がなく、声が大きく明瞭である必要があります。

長さを増やすためだけに品質の異なるクリップを多数使うのではなく、合計再生時間を増やすことよりも、マイクの品質が明らかに高く、全体を通して品質とトーンが一貫しているクリップを優先してください。

クリップ内の会話の大部分が、最も望ましい話者の話し方やイントネーションに合っていることを確認してください。聞きたい話し方のパターンから話者が外れている会話部分が多すぎないようにしましょう。

必要に応じて、ノイズ除去ツールを使ってバックグラウンドノイズを減らしてください。

詳細は、こちらのドキュメントをご覧ください。

はい。Flash v2.5とMultilingual v2がサポートする任意の言語で、声をクローンできます。サポートされている言語の一覧はこちらをご覧ください。

AIがサポートしていない言語を話す音声をクローンすることもできます。クローンは話者のトーンを捉える可能性がありますが、その言語を話すことはできず、結果は予測できない場合があります。これはおすすめしません。

ボイスクローンを単独のファイルとしてダウンロードまたはエクスポートすることはできません。ボイスクローンはElevenLabsアカウント内に保持されます。

ElevenLabsのウェブサイト以外でもElevenLabs音声を使用できます。APIキーを使うと、サードパーティサービスからElevenLabs APIを呼び出し、アカウント内の音声で音声を生成できます。

後でクローンを再作成したい場合は、作成時に使用した元のオーディオサンプルを保管しておいてください。同じオーディオを使っても、クローンごとに音声はわずかに異なります。

ElevenLabsでは、2種類のクローン作成オプションを提供しています。

  • インスタントボイスクローン: 約1~3分のオーディオからすばやく作成できます。ほとんどの音声に適していますが、一般的でないアクセントや特徴的な音声では十分に再現できない場合があります。
  • プロフェッショナルボイスクローン: 30分から約3時間のオーディオを使用し、より高い忠実度を実現します。微調整には通常3~6時間かかり、多くの音声が待機中の場合はさらに時間がかかることがあります。

インスタントボイスクローンで音声やアクセントを十分に再現できない場合は、プロフェッショナルボイスクローンをお試しください。

作成後にクローンのアクセントやトーンを変更することはできません。結果を改善するには、使用するオーディオサンプルを変更してください。サンプルを少し変えるだけでも、大きな違いが生まれることがあります。

プロフェッショナルボイスクローン(PVC)の微調整が完了し、使用可能になる前に使用しようとすると、このエラーが表示されます。

PVCを作成すると、使用可能になるまでにいくつかのプロセスを経る必要があります。ボイスを認証すると、処理されて微調整のキューに追加されます。現在微調整のキューに入っている他のボイスの数によって異なりますが、このプロセスには通常3〜6時間、最長で24時間かかると見込まれます。

My VoicesでPVCの進行状況を確認するには、ボイスリストから対象のボイスを見つけ、表示をクリックして詳細を確認します。各モデルにカーソルを合わせると、現在のステータスを確認できます。  

各ステータスの詳細については、プロフェッショナルボイスクローンのステータスは何を意味しますか?をご覧ください。

PVCの微調整が完了して使用可能になると、ポップアップ通知とメールでお知らせします。

No results