プロフェッショナルボイスクローン

最高クラスのモデルを使って、プロ仕様のボイスクローンを作成する方法を学びましょう。

プロフェッショナルボイスクローン機能

プロフェッショナルボイスクローンの作成

ボイスをクローンする際は、AIが何を学習しているか、つまり対応言語やデータセットの種類を考慮することが重要です。各モデルとその強みについては、モデルページをご覧ください。

ガイド

法的に許可される範囲が不明な場合は、詳細について利用規約およびAIセーフティ情報をご確認ください。

1

プロフェッショナルボイスクローンのページに移動する

ElevenLabsダッシュボードで、左側のVoicesセクションを選択し、Create Voiceをクリックします。

ポップアップから、Professional Voice Cloneを選択します。

2

オーディオをアップロードする

プロフェッショナルボイスクローンは現在、歌唱には対応していません。オーディオ録音には、話し声のみを含める必要があります。

新しいプロフェッショナルボイスクローンを作成

Upload samplesをクリックして、オーディオサンプルをアップロードします。

事前に録音した学習用オーディオがない場合は、Record yourselfを選択してインターフェース上で直接録音することもできます。ナレーション、会話、広告向けのサンプルスクリプトも用意されています。独自のスクリプトをアップロードすることも可能です。

3

サンプルの長さに関するフィードバックを確認する

オーディオをアップロードすると、サンプルの長さに関するフィードバックが表示されます。最良の結果を得るには、少なくとも1時間、できれば3時間程度の学習用オーディオをアップロードすることをおすすめします。

新しいプロフェッショナルボイスクローンを作成

4

オーディオを処理する

オーディオサンプルをアップロードしたら、品質向上のために処理できます。バックグラウンドノイズを除去したり、複数の話者が含まれるオーディオでは話者ごとに分離したりできます。これらのオプションにアクセスするには、処理したいクリップの横にあるAudio settingsボタンをクリックします。

新しいプロフェッショナルボイスクローンを作成

5

ボイスを認証する

すべての録音とアップロードが完了すると、ボイスの認証が求められます。スムーズに認証を行うため、サンプルの録音に使用したものと同じ、または似た機材を使い、サンプルに近いトーンと話し方で認証してください。同じ機材を利用できない場合は、できる限り近い環境で認証してください。認証に失敗した場合は、24時間待ってから再試行するか、サポートにお問い合わせください。

6

ボイスの微調整が完了するまで待つ

ボイスを使用するには、微調整プロセスが完了する必要があります。処理中はMy Voicesでボイスのステータスを確認できます。使用可能になると通知されます。

7

ボイスクローンを使用する

ダッシュボードのVoicesセクションでPersonalタブを選択し、ボイスクローンの横にあるUseをクリックすると、使用を開始できます。

サンプルのアップロードを始める前に注意すべき点と、可能な限り良い結果を得るために必要な手順がいくつかあります。

1

高品質なオーディオを録音する

プロフェッショナルボイスクローンは、学習に使用したサンプルを非常に正確にクローンします。声の細かな特徴や特性だけでなく、サンプルに含まれるアーティファクトや不要な音声まで含めて、聞こえたものをほぼ完璧にクローンします。つまり、バックグラウンドノイズ、室内の残響・エコー、音楽や複数人の話し声などの不要な音を含む低品質なサンプルをアップロードすると、AIはそれらの要素もクローンで再現しようとします。

2

話している声を1人だけにする

複数の話者、過度なノイズ、または上記のような要素があるとAIが混乱するため、オーディオ全体を通して話している声が1人だけであることを確認してください。この混乱により、AIがどの声をクローンすべきか判断できなかったり、ほかの音に覆われて実際の声質を誤って解釈したりして、最適とは言えないクローンになる場合があります。

3

十分な素材を用意する

ボイスを適切にクローンできるだけの素材があることを確認してください。推奨する最低限の長さは30分ですが、最適かつ最も正確なクローンを得るには、2〜3時間程度のオーディオをおすすめします。提供するオーディオが多いほど、生成されるクローンの品質も向上します。

4

スタイルを一貫させる

提供したサンプルの話し方は出力にも再現されるため、求める話し方に応じて、学習データもそのスタイルに合わせる必要があります(例:自分の声のクローンでオーディオブックを読み上げたい場合は、使用したい声のトーンで本を読んでいる録音を学習用に送信してください)。一貫性を保つため、アップロードするサンプルには1つのスタイルだけを含めることをおすすめします。

5

PVCで使用したい言語を話しているサンプルを使う

PVCで主に使用する言語を話しているサンプルを使用するのが最適です。もちろん、AIは現在対応しているすべての言語を話せます。ただし、AIに話させたい言語がそのボイスの母語ではない場合、つまり別の言語を話しているボイスをクローンした場合は、元の言語のアクセントが残ったり、単語や抑揚を誤って発音したりする可能性があります。たとえば、英語を話しているボイスをクローンしてからスペイン語を話させると、スペイン語を話す際に英語アクセントが付く可能性が非常に高くなります。クローンできるのは対応言語のいずれかで録音されたサンプルのみです。非対応言語で録音されたサンプルは、アプリケーションで拒否されます。

良い録音と悪い録音で何が期待できるかについては、以下の例をご覧ください。

現在は、ご自身のボイスのみクローンできます。微調整リクエストを送信する前に、認証プロセスを完了する必要があります。

ヒントと提案

プロ仕様の録音機材

AIはオーディオのあらゆる要素をクローンするため、最適な結果を得るには高品質な録音機材を使用してください。高品質な入力は高品質な出力につながります。どのマイクでも使用できますが、専用のオーディオインターフェースに接続したXLRマイクがおすすめです。低価格帯では、Audio Technica AT2020やRode NT1をFocusriteのインターフェースなどに接続する構成が一般的なおすすめです。

ポップフィルターを使用する

録音時にはポップフィルターを使用してください。これにより、録音時の破裂音を最小限に抑えられます。

マイクとの距離

マイクから適切な距離に位置してください。目安はマイクから拳2つ分程度ですが、どのような録音をしたいかにも左右されます。

ノイズのない録音

バックグラウンドミュージックやノイズなど、オーディオ入力に干渉がないことを確認してください。AIクローンは、クリアで雑音のないオーディオで最も効果を発揮します。

室内音響

可能であれば、音響処理を施した部屋で録音してください。不要なエコーやバックグラウンドノイズが減り、AIによりクリアなオーディオを入力できます。厚手の羽毛布団やキルトを使って録音スペースを吸音すれば、一時的な対策も可能です。

オーディオの前処理

AIに特定の音を出力させたい場合は、事前にオーディオを編集することを検討してください。たとえば、洗練されたポッドキャストのような出力が必要な場合は、その品質に合わせてオーディオを前処理してください。また、単語の間に長い間や「あの」「えー」が多くある場合も、AIはそれらを再現します。

音量管理

明瞭に聞こえる十分な音量を維持しつつ、歪みが発生するほど大きくしないようにしてください。目標は、バランスが取れた安定したオーディオレベルです。理想的には、RMSが-23dB〜-18dB、トゥルーピークが-3dBです。

十分なオーディオの長さ

最良の結果を得るには、上記のガイドラインに従った高品質なオーディオを少なくとも30分、できれば2時間以上提供してください。AIに入力できる高品質なデータが多いほど、ボイスクローンの品質も高くなります。サンプル数は関係なく、重要なのは合計の再生時間です。ただし、数時間分のオーディオをアップロードする場合は、約30分ごとの複数サンプルに分割することをおすすめします。アップロードがしやすくなります。

よくある質問

2分未満のオーディオで音声をすばやくクローンできるインスタントボイスクローンとは異なり、プロフェッショナルボイスクローンでは、よりリアルな音声モデルをトレーニングできます。大量の音声データで専用モデルをトレーニングすることで、元の音声とほとんど区別できないモデルを生成します。

プロフェッショナルボイスクローンには微調整とトレーニングが必要なため、ボイスクローンを使用できるようになるまで時間がかかります。待機中の人数など複数の要因に左右されるため正確な見積もりは難しいですが、通常、微調整には3~6時間かかります。

プロフェッショナルボイスクローンの準備が完了すると、メールで通知されます。

いいえ。プロフェッショナルボイスクローンを作成できるのは自分の声のみです。本人の同意があっても、他人の声をクローンすることはできません。すべてのプロフェッショナルボイスクローンでは、その声が自分のものであることを確認するための認証プロセスが必要です。

誰かが自分と声を共有したい場合、その人自身のアカウントでプロフェッショナルボイスクローンを作成・認証し、共有リンクを使って非公開で共有できます。詳しくは、音声を共有するには?をご覧ください。

プロフェッショナルボイスクローン(PVC)のスロット数は、サブスクリプションのプランによって異なります:


基本PVCスロット
  • 無料およびスタータープラン:PVCスロットは利用できません
  • クリエイター、プロ、および旧スケールプラン:PVCスロット1つ
  • スケールおよび旧ビジネスプラン:PVCスロット3つ
  • ビジネスプラン:PVCスロット10個
  • エンタープライズプラン:PVCスロット数はカスタム

追加PVCスロット

ボイスライブラリで共有したプロフェッショナルボイスクローンがスタジオ品質として認定されると、追加のPVCスロットを獲得できます。

  • スタジオ品質の審査は、ボイスライブラリで共有した音声にのみ適用されます
  • 音声がボイスライブラリに承認されると、スタジオ品質の審査は自動的に行われます。すぐに完了するわけではありません
  • 共有したPVCがスタジオ品質として認定されると、追加のPVCスロットが自動的に付与されます
  • 複数の共有音声がスタジオ品質として認定された場合、これが複数回発生することがあります
  • 次のいずれかを満たさない限り、これ以上PVCを作成できません:
    • ボイスライブラリで共有した音声がスタジオ品質の審査を通過し、追加スロットを獲得する
    • スケール以上にアップグレードする
重要な注意事項
  • プロフェッショナルボイスクローンは、自分自身の声のクローン作成にのみ使用できます
  • クリエイター未満のプランにダウングレードした場合、PVCはアカウントに残りますが、クリエイター以上にアップグレードするまで使用できません
  • PVCを含む作成可能なカスタム音声の合計数は、サブスクリプションのプランによって異なります

すべてのプロフェッショナルボイスクローン(PVC)は、Flash v2.5、Turbo v2.5、Multilingual v2モデルで自動的にトレーニングされます。英語のオーディオでトレーニングされたPVCは、Flash v2およびTurbo v2モデルでも自動的にトレーニングされます。

既存のPVCがある場合、追加のモデルで微調整できるようになりました。今後、微調整に対応した新しいモデルがリリースされた場合は、通知が届きます。これは感嘆符アイコンで表示され、My Voices.のボイスリストで、ボイスの右側に表示されます。このアイコンにカーソルを合わせると、通知を確認できます。

微調整を開始するには、My Voices,のリストでボイス名にカーソルを合わせます。利用可能なすべてのモデルが表示されます。すでにそのボイスで微調整済みのモデルにはチェックアイコン、微調整可能なモデルにはプラスアイコンが表示されます。微調整を開始するには、モデルをクリックしてください。 

ボイスの微調整中は、モデル名にカーソルを合わせると進行状況を確認できます。ボイスのキャッシュにより、最新の進行状況を確認するにはページを更新する必要がある場合があります。微調整が完了すると、アプリ内とメールの両方で通知されます。

プロフェッショナルボイスクローンは、処理中にいくつかの異なる段階を経ます。これらの段階は、My Voicesに表示されるプロフェッショナルボイスクローンのステータスに反映されます。

現在のステータスを確認するには、リストでボイスを見つけ、その右側に表示されるアイコンを確認してください。

下書き: このステータスは、ボイスが未完成であることを意味します。通常は、ボイスの作成が完了していないか、まだボイスを認証していないことが原因です。

認証プロセスを開始するには、チェックアイコンをクリックしてください。

ボイス作成プロセスに戻るには、その他のアクション(3点)をクリックし、ボイスを編集を選択します。

ボイスを認証すると、使用する前にモデルで微調整する必要があります。My Voicesでボイス名にカーソルを合わせると、このプロセスを確認できます。利用可能なすべてのモデルが一覧表示され、各モデルのステータスを示すアイコンが表示されます。 

詳細を確認するにはモデル名にカーソルを合わせてください。次のいずれかが表示されます。

トレーニングがスケジュールされました:ボイスのトレーニングを開始できるスロットが空くのを待っている状態です。キューで待機する時間は、キューに入っている他のボイスの数によって異なります。

データセットを作成中および微調整を実行中:スロットが空くと、微調整プロセスが開始されます。これには6〜24時間かかる場合があります。トレーニングプロセスの各ステップがどこまで進んでいるかは、パーセンテージで表示されます。

トレーニング中に問題が発生したため、再試行されました。追加の操作は必要ありません。

これは問題が発生したことを意味しますが、ボイスは微調整プロセスを再試行するキューに自動的に追加されています。次回の試行で微調整は正常に完了するはずですが、何度も失敗する場合は、support@elevenlabs.ioまでメールでサポートにお問い合わせください。

このモデルでボイスを使用できます:このモデルの微調整プロセスが完了し、このモデルでボイスを使用できる状態です。

クリックして微調整を開始:一部のモデルは自動的にトレーニングされないため、微調整を開始するにはモデル名をクリックする必要があります。ボイスで微調整できる追加モデルが利用可能になると、ボイスの横に感嘆符アイコンが表示されます。 

微調整を開始するには、ボイス名にカーソルを合わせ、モデル名をクリックしてください。

プロフェッショナルボイスクローンでは、特定の話者の大量の音声データを用いてモデルをトレーニング(微調整)し、カスタムモデルを作成します。

サンプルをアップロードして音声を確認すると、プロフェッショナルボイスクローンが待機リストに追加されます。推定トレーニング時間は約3~6時間です。いくつかの要因に左右されるため、正確な見積もりをお伝えするのは困難です。場合によっては、さらに時間がかかることがあります。

音声の現在のステータスはマイボイス。で確認できます。詳細は、プロフェッショナルボイスクローンのステータスは何を意味しますか?をご覧ください。

PVCの微調整プロセスが完了すると、音声を使用できるようになったことをアプリ内通知とメールでお知らせします。

ボイスの認証後、使用可能になる前にモデルで微調整する必要があります。この間、My Voicesでボイス名にカーソルを合わせると、ボイスのステータスを確認できます。ボイスで利用可能なすべてのモデルが表示されます。各モデルのステータスを確認するには、モデル名にカーソルを合わせてください。 

問題が発生した場合、次のステータスが表示されることがあります。

トレーニング中に問題が発生したため、再試行されました。追加の操作は必要ありません。 これは問題が発生したことを意味しますが、ボイスは微調整プロセスを再試行するキューに自動的に追加されています。次回の試行で微調整は正常に完了するはずですが、何度も失敗する場合は、AIでは解決できないデータセットの問題である可能性があります。

ボイスを削除し、最初からデータを再度アップロードすることで解決できる場合があります。これにより改善したユーザーもいます。

問題が解決しない場合は、トレーニング用オーディオを確認し、別のトレーニング用オーディオの使用を検討してください。

微調整中に失敗が発生する場合は、support@elevenlabs.ioまでメールでいつでもサポートにお問い合わせいただけます。

プロフェッショナルボイスクローンの作成中にすべての認証試行に失敗した場合、24時間待つと、プロセスを再試行できるようになります。

support@elevenlabs.ioまでメールでサポートにお問い合わせいただくこともできます。サポートが確認し、すべて問題なければ認証試行回数をリセットするため、プロセスを再試行できます。

プロフェッショナルボイスクローンを正常に認証するための推奨事項は次のとおりです。

  • Webブラウザによるマイクの使用が許可されており、ミュートになっていないことを確認してください。
  • コンピューターのマイクで録音したオーディオが、バックグラウンドノイズやその他の外部オーディオの干渉なしに、クローン作成用にアップロードしたオーディオと似た音であることを確認してください。
  • ボイスのトレーニングに使用したオーディオと似た話し方をしてください。
  • 各認証用の文章は一度だけ読み、その後停止を押して録音を停止してください。文章を複数回読むと、認証プロセスに失敗することがあります。

申し訳ありませんが、これはできません。プロフェッショナルボイスクローン(PVC)の設定時にご案内したとおり、認証ステージに進むと、音声の認証が完了するまで変更できません。

プロフェッショナルボイスクローンについてサポートが必要な場合は、support@elevenlabs.ioまでメールでお問い合わせください。

Flash v2.5モデルでサポートされているすべての言語で、プロフェッショナルボイスクローンをご利用いただけます。

現在、プロフェッショナルボイスクローンでサポートしている言語は次のとおりです。

  • 🇺🇸 英語(米国)
  • 🇬🇧 英語(英国)
  • 🇦🇺 英語(オーストラリア)
  • 🇨🇦 英語(カナダ)
  • 🇯🇵 日本語
  • 🇨🇳 中国語
  • 🇩🇪 ドイツ語
  • 🇮🇳 ヒンディー語
  • 🇫🇷 フランス語(フランス)
  • 🇨🇦 フランス語(カナダ)
  • 🇰🇷 韓国語
  • 🇧🇷 ポルトガル語(ブラジル)
  • 🇵🇹 ポルトガル語(ポルトガル)
  • 🇮🇹 イタリア語
  • 🇪🇸 スペイン語(スペイン)
  • 🇲🇽 スペイン語(メキシコ)
  • 🇮🇩 インドネシア語
  • 🇳🇱 オランダ語
  • 🇹🇷 トルコ語
  • 🇵🇭 フィリピン語
  • 🇵🇱 ポーランド語
  • 🇸🇪 スウェーデン語
  • 🇧🇬 ブルガリア語
  • 🇷🇴 ルーマニア語
  • 🇸🇦 アラビア語(サウジアラビア)
  • 🇦🇪 アラビア語(UAE)
  • 🇨🇿 チェコ語
  • 🇬🇷 ギリシャ語
  • 🇫🇮 フィンランド語
  • 🇭🇷 クロアチア語
  • 🇲🇾 マレー語
  • 🇸🇰 スロバキア語
  • 🇩🇰 デンマーク語
  • 🇮🇳 タミル語
  • 🇺🇦 ウクライナ語
  • 🇷🇺 ロシア語
  • 🇭🇺 ハンガリー語
  • 🇳🇴 ノルウェー語
  • 🇻🇳 ベトナム語

インスタントボイスクローンとプロフェッショナルボイスクローンでは、さまざまなファイル形式に対応しています。192kbps以上のMP3を強く推奨します。

推奨形式

  • MP3、192kbps以上

推奨される長さ

  • インスタントボイスクローン:高品質なオーディオを1〜2分
  • プロフェッショナルボイスクローン:高品質なオーディオを30〜180分

WAVなどの非圧縮形式は通常、クローンの品質を向上させず、アップロード処理で問題が発生する可能性があります。代わりに録音品質を重視してください。バックグラウンドノイズ、部屋の残響、複数の話者がなく、音量と声のトーンが一定で、長い無音部分のないクリアな録音を使用してください。

詳細は、インスタントボイスクローン(IVC)およびプロフェッショナルボイスクローン(PVC)をご覧ください。

ElevenLabsは、知的財産権の尊重と、テクノロジーの悪用を防ぐための保護策の実装に全力で取り組んでいます。

  • 違法または有害と見なされる目的での悪意あるテクノロジーの使用を禁止する利用規約および禁止利用ポリシーを遵守するクライアントとのみ提携しています。
  • 音声の権利者およびそのライセンサーによる権利の主張を支援し、既知のすべての侵害を確認して対応します。
  • モデルによって生成されたすべてのオーディオは、生成を行ったユーザーまで即座に追跡できます。

開発中のテクノロジーは新しく、明確な規制はまだ導入されていません。AI研究ラボとしての目標の一つは、このテクノロジーの存在、その可能性、そして限界についての認識を広めることです。

詳しいガイドについては、インスタントボイスクローンとプロフェッショナルボイスクローンのドキュメントを読むことを強くおすすめします。

要点は、良質で一貫した入力=良質で一貫した出力、ということです。

長さ

  • インスタントボイスクローン:良質なオーディオを1~2分
  • プロフェッショナルボイスクローン:良質なオーディオを30~180分

可能な限り、最良で最もクリアなオーディオクリップを使用してください。話者は1人だけにし、バックグラウンドノイズや干渉がなく、声が大きく明瞭である必要があります。

長さを増やすためだけに品質の異なるクリップを多数使うのではなく、合計再生時間を増やすことよりも、マイクの品質が明らかに高く、全体を通して品質とトーンが一貫しているクリップを優先してください。

クリップ内の会話の大部分が、最も望ましい話者の話し方やイントネーションに合っていることを確認してください。聞きたい話し方のパターンから話者が外れている会話部分が多すぎないようにしましょう。

必要に応じて、ノイズ除去ツールを使ってバックグラウンドノイズを減らしてください。

詳細は、こちらのドキュメントをご覧ください。

はい。Flash v2.5とMultilingual v2がサポートする任意の言語で、声をクローンできます。サポートされている言語の一覧はこちらをご覧ください。

AIがサポートしていない言語を話す音声をクローンすることもできます。クローンは話者のトーンを捉える可能性がありますが、その言語を話すことはできず、結果は予測できない場合があります。これはおすすめしません。

ボイスクローンを単独のファイルとしてダウンロードまたはエクスポートすることはできません。ボイスクローンはElevenLabsアカウント内に保持されます。

ElevenLabsのウェブサイト以外でもElevenLabs音声を使用できます。APIキーを使うと、サードパーティサービスからElevenLabs APIを呼び出し、アカウント内の音声で音声を生成できます。

後でクローンを再作成したい場合は、作成時に使用した元のオーディオサンプルを保管しておいてください。同じオーディオを使っても、クローンごとに音声はわずかに異なります。

ElevenLabsでは、2種類のクローン作成オプションを提供しています。

  • インスタントボイスクローン: 約1~3分のオーディオからすばやく作成できます。ほとんどの音声に適していますが、一般的でないアクセントや特徴的な音声では十分に再現できない場合があります。
  • プロフェッショナルボイスクローン: 30分から約3時間のオーディオを使用し、より高い忠実度を実現します。微調整には通常3~6時間かかり、多くの音声が待機中の場合はさらに時間がかかることがあります。

インスタントボイスクローンで音声やアクセントを十分に再現できない場合は、プロフェッショナルボイスクローンをお試しください。

作成後にクローンのアクセントやトーンを変更することはできません。結果を改善するには、使用するオーディオサンプルを変更してください。サンプルを少し変えるだけでも、大きな違いが生まれることがあります。

プロフェッショナルボイスクローン(PVC)の微調整が完了し、使用可能になる前に使用しようとすると、このエラーが表示されます。

PVCを作成すると、使用可能になるまでにいくつかのプロセスを経る必要があります。ボイスを認証すると、処理されて微調整のキューに追加されます。現在微調整のキューに入っている他のボイスの数によって異なりますが、このプロセスには通常3〜6時間、最長で24時間かかると見込まれます。

My VoicesでPVCの進行状況を確認するには、ボイスリストから対象のボイスを見つけ、表示をクリックして詳細を確認します。各モデルにカーソルを合わせると、現在のステータスを確認できます。  

各ステータスの詳細については、プロフェッショナルボイスクローンのステータスは何を意味しますか?をご覧ください。

PVCの微調整が完了して使用可能になると、ポップアップ通知とメールでお知らせします。

No results