Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

ElevenLabsで自分の声をクローンする方法:徹底解説

執筆者
Jack Limebear
公開日
最終更新日

聴くこの記事を聴く

同じ声は二つとしてありません。声は生まれ持った特性や環境によって形づくられ、長年の表現を通じて磨かれていきます。とても個人的なものです。

つい最近まで、こうした個性を再現することはできませんでした。しかしAIの進歩により、驚くほど高精度に声をクローンできるようになりました。わずか数分のオーディオで、AIシステムは元の声に非常に近い音声を生成できます。

このガイドでは、ElevenLabsで声をクローンする方法を詳しくご紹介します。録音すべき内容や、インスタントとプロフェッショナルのボイスクローンの選び方、完成したクローンの活用方法を解説します。どちらの方法にも、手順を追って実践できる詳しいガイドを用意しました。

概要

  • ElevenLabsでは、インスタントボイスクローンとプロフェッショナルボイスクローンを提供しています。
  • インスタントボイスクローンには、数分間のクリアで一貫したオーディオが必要です。
  • プロフェッショナルボイスクローンには、最大3時間の音声データが必要です。
  • クローンを作成した後は、ElevenLabsのほかのプロダクトと連携できます。
  • 声をクローンするには、明示的な同意が必要です。ElevenLabsでは、これらのサービスを利用する前に同意の確認を求めています。

インスタントクローンとプロフェッショナルボイスクローン:どちらが必要?

ElevenLabsでは、異なる2種類のボイスクローン方法から選べます。 

インスタントクローンなら、わずか数分で利用可能な声を作成でき、声のクローンをすぐに実用的な用途で使い始められます。プロフェッショナルボイスクローンは時間がかかりますが、極めて高忠実度のモデルを作成できます。

最適な選択肢を選ぶための早見ガイドをご紹介します。

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

これらのアプローチの違いを理解すれば、事前の時間を節約し、すぐに始められます。

ElevenLabsで声をクローンする前に必要なもの

ElevenLabsのプロフェッショナルボイスクローンとインスタントボイスクローンのどちらを選ぶ場合も、準備しておくと便利な基本事項がいくつかあります。特にインスタントの場合は必須ではありませんが、クローンの品質に大きく影響します。

録音を始める前に、次の点を確認しましょう。

  • オーディオ品質の要件:プロ仕様の録音用マイクを使うと、大きな違いが生まれます。ただし最低限、44.1kHzまたは48kHz、24ビット以上のビットレートでWAVファイルを録音できれば問題ありません。WAVファイルに対応したデジタルオーディオワークステーション(DAW)で、静かな場所にて録音してください。無料で使えるAudacityもおすすめです。
  • サンプルの最小長:必要なオーディオデータの量を確認してください。重要なのはファイル数ではなく、合計再生時間です。プロフェッショナルボイスクローンでは、できるだけ3時間に近い長さのファイルをアップロードしてください。
  • 話す内容:ElevenCreativeのボイスクローンは、提供された声を再現することを目指します。ゆっくり単調に読めば、録音にもその特徴が反映されます。感情や話す速さに変化をつけながら、自然に話してください。ElevenLabsには、プロフェッショナルボイスクローン用のスクリプトが組み込まれています。

これらを事前に準備するために少し時間をかけることで、最終的なボイスクローンの品質が向上します。

ElevenLabsでインスタントボイスクローンを作成する方法

数分の時間があり、静かな場所にいれば、声をクローンする準備は完了です。ElevenCreativeなら、自然な話し方の感情的なニュアンスやプロソディを再現しながら、32以上の言語で利用できる声のデジタルレプリカを作成できます。 

ElevenLabsのインスタントボイスクローンの使い方:

  1. Voicesにアクセスする
  2. サンプルをアップロードする
  3. 声に名前を付けて保存する
  4. スクリプトでテストする
  5. 安定性と類似性の設定を調整する

各手順を詳しく見ていきましょう。

ステップ1:Voicesでインスタントボイスクローンのページを開く

まず、ElevenLabsのダッシュボードにログインします。左側のサイドバーでVoicesを選択し、プラスアイコンをクリックしてください。

画面にポップアップ(下図)が表示され、いくつかの選択肢が表示されます。

  • ボイスデザイン
  • インスタントボイスクローン
  • プロフェッショナルボイスクローン
  • ボイスリミックス 

モジュールからインスタントボイスクローンを選択すると、該当するページが開きます。

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

ステップ2:サンプルをアップロードする

画面の指示に従い、事前録音したオーディオファイルをアップロードするか、ブラウザで直接録音します。この段階では、複数のファイルをエンジンにアップロードできます。ElevenLabsは、個々のファイルの長さではなく、合計再生時間をもとにボイスクローンを作成します。

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

少なくとも1~2分間の、クリアで一貫したオーディオを用意することをおすすめします。

ノイズの多い環境を避ける、マイクの品質を確認する、すべての録音で同じ機材を使うなどのベストプラクティスも表示されます。

ステップ3:声に名前を付けて保存する

声を録音すると、ElevenLabsがボイスクローンの合成を開始します。この段階で、声をプレビューして音を確認し、名前を付けられます。

言語、アクセント、性別、年齢のラベルなど、クローンの情報に詳細を追加することもできます。説明欄には、この声を整理するため、または自分用のメモとして役立つ詳細を入力できます。 

Voice cloning interface for uploading and describing audio samples.

最後に、同意内容を読み、承諾したことを確認するために同意ボックスをクリックします。自分自身の声でも他者の声でも、扱う声のクローンを作成するには同意を得ることが不可欠です。

ステップ4:インスタントボイスクローンをテストする

声を作成したら、My Voicesに移動してUse voiceをクリックし、テキスト読み上げプレイグラウンドでクローンを使い始めます。ボイスクローンに話させる短いスクリプトを書いてください。しっかりテストするために、トレーニング用オーディオには含めていない内容を書きましょう。

ボイスクローンを選択してテキストを入力したら、ページ下部のGenerate speechをクリックして音声を生成します。

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

ステップ5:モデルを調整して改善する

ボイスクローンを聞いて何か違和感があっても、最初からやり直す必要はありません。ElevenLabsには、最終的なオーディオ出力を設定できるさまざまなスライダーがあります。

画面右側にある以下のコントロールを調整して、ボイスクローンへの影響を確認してください。

  • 安定性:安定性を高くすると、一貫性があり予測可能な声になります。低くすると表現力は増しますが、一貫性が損なわれる場合があります。ほとんどの用途では中程度の設定が最適です。
  • 類似性:ボイスクローンが提供された音声サンプルにどれだけ忠実であるかを設定します。このスライダーを上げると、より自分らしい声になります。歪みが聞こえる場合は、スライダーを下げてください。
  • スタイル:トレーニング用オーディオの表現力を強調したい場合は、このスライダーを上げてください。ただし、高く設定しすぎると最終サンプルが歪む場合があります。

これらのスライダーの値を調整したら、もう一度Generate speechをクリックし、モデルがどう変化するか確認してください。 

この5つのステップを完了すれば、ElevenLabsのボイスクローンをすぐに使い始められます。

オリジナル
ボイスクローン
Lily
Lily
オリジナル
Lily
Lily
クローン
Chris
Chris
オリジナル
Chris
Chris
クローン
Laura
Laura
オリジナル
Laura
Laura
クローン
自分の声とそっくりなレプリカを作成します。

ElevenLabsでプロフェッショナルボイスクローンを作成する方法

ElevenLabsでプロフェッショナルに声をクローンする場合、インスタント版より時間はかかりますが、声を高精度に再現するモデルを作成できます。 

クリエイタープラン以上をご利用の場合は、以下の手順でElevenLabsのプロフェッショナルボイスクローンを作成できます。

  1. Voicesにアクセスする
  2. オーディオをアップロードする
  3. サンプルの長さに関するフィードバックを確認する
  4. オーディオサンプルを処理して品質を高める
  5. セキュリティのため自分の声を検証する
  6. 声の微調整プロセスを待つ
  7. ボイスクローンを使う

各手順を詳しく見ていきましょう。

ステップ1:Voicesでプロフェッショナルボイスクローンのページを開く

ElevenLabsのダッシュボードにログインし、左側のサイドバーでVoicesを選択してからCreate Voiceをクリックします。ポップアップには、先ほどと同じ選択肢が表示されます。

今回は、Professional Voice Cloneを選択します。以下を含む幅広い推奨事項が表示されます。

  • ポップフィルターを使用する
  • 録音時のノイズをなくす
  • 音響処理された部屋で録音する
  • オーディオを前処理する
  • 録音全体で音量を一定に保つ
  • 少なくとも30分、理想的には3時間近くのオーディオを用意する

ステップ2:オーディオをアップロードする

Upload samplesをクリックして、事前録音したオーディオファイルを追加します。自分で録音し、ソフトウェアに直接アップロードすることもできます。広告、ナレーション、会話モデリングなど、さまざまな目的に使えるスクリプトも用意しています。

Professional Voice Clone interface for uploading and describing audio samples.

これらのオーディオファイルには、話し声のみを含めてください。現在、歌唱は入力および出力としてサポートしていません。 

ステップ3:サンプルの長さに関するフィードバックを確認する

オーディオを正常にアップロードしたら、長さに関するフィードバックを必ず確認してください。インスタントボイスクローンには1~2分で十分ですが、このサービスでは1~3時間のオーディオをアップロードすることをおすすめします。

さまざまな感情表現を含むオーディオファイルを用意してください。モデルに最適な情報を提供するため、スタジオ品質の多様なコンテンツを選びましょう。

Professional Voice Clone interface showing voice sample upload and configuration options.

ステップ4:オーディオサンプルを処理して品質を高める

プロフェッショナルボイスクローンプラットフォームでは、オーディオサンプルの品質を直接向上できます。バックグラウンドノイズの除去から話者の分離まで、ElevenLabsが高品質なオーディオ入力の作成を支援します。

必須ではありませんが、この段階を行うことで最終的なボイスクローンモデルの品質が向上します。

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

ステップ5:セキュリティのため自分の声を検証する

ElevenLabsでは、プロフェッショナルボイスクローンの作成時に検証が必要です。すべてをアップロードした後、インターフェースで短いクリップを直接録音するよう求められます。可能であれば、トレーニング用録音と同じマイクと部屋のセットアップを使用し、声のトーンや話し方のスタイルもできるだけ合わせてください。

検証に失敗した場合は、24時間後に再試行できます。それまでに始める必要がある場合は、ElevenLabsサポートまで直接お問い合わせください。 

ステップ6:声の微調整プロセスを待つ

声の検証が完了すると、ElevenLabsがモデルの微調整を開始します。通常は3~6時間かかりますが、先に多くのプロフェッショナルボイスクローンが待機している場合は、さらに時間がかかることがあります。

クローンのステータスを確認するには、My Voicesに移動します。声のモデルが使用可能になったら、通知もお送りします。

ステップ7:ボイスクローンを使う

おめでとうございます。これで、本格的なプロ品質のボイスクローンが完成しました。完成したモデルはMy Voicesに表示され、テキスト読み上げ、Studio、ダビング、API、音声エージェントなど、ほかのすべてのElevenLabsプロダクトで利用できます。

開始するには、ボイスピッカーダッシュボードで、作成時に付けた名前から声を選択してください。

ElevenLabsボイスクローンのベストプラクティス

上記の手順に従えば、インスタントボイスクローンとプロフェッショナルボイスクローンのどちらでもクローンを作成できます。さらに、声のクローンの品質を高めるために、録音機材や戦略に加えられる小さな調整があります。

以下のAIボイスクローンのベストプラクティスは、インスタント版とプロフェッショナル版の両方に適用されます。

  • 部屋の音響とバックグラウンドノイズ:オーディオのクリーンさは、最終品質に直接影響します。バックグラウンドノイズや反響のない場所で録音してください。プロ仕様の録音には、録音ブースが最適です。スタジオを予約せずにその品質を得たい場合は、近くのコワーキングスペースに防音ポッドがないか確認してみましょう。
  • マイクとの距離:話すときは、マイクから拳二つ分ほど離れるのが目安です。これは有用な目安ですが、詳しくはマイクの仕様も確認してください。
  • 感情の幅をサンプルに含める:AIモデルは、声が持つ自然なプロソディや話し方の特徴を利用します。表現が平板だと、モデルの話し方も同様に乏しくなる可能性があります。さまざまな状況における自然な話し方を示せるよう、感情の幅があるサンプルを含め、最大限に表現してください。 
  • 文のバリエーションとスクリプトの読み上げ:スクリプトを声に出して読むことは、長いサンプルを用意するよい出発点です。ただし、リハーサルしたような不自然さが出る場合があります。特に初見のスクリプトでは、文に必要な感情的ニュアンスを正確に表現できないことがあります。バランスを取るには、より会話的な話し方で、異なるスクリプトの文章を幅広く提供してください。 

これらのベストプラクティスに従うことで、ElevenLabsにより高品質な入力を提供できます。その結果、あなたらしい声をより正確に再現したボイスクローンを作成できます。 

ElevenLabsのボイスクローンはどのように使えますか?

ElevenLabsでプロフェッショナルまたはインスタントのボイスクローンを作成すると、声がMy Voicesに表示されます。そこから、ほかのすべてのElevenLabsプロダクトで利用できます。

ElevenLabsのボイスクローンは、次の場所で使用できます。

  • アプリのテキスト読み上げ:ElevenLabsのテキスト読み上げプレイグラウンドでは、声を選択して、入力した任意のテキストを読み上げられます。ボイスオーバーやポッドキャストのイントロなど、単発の音声生成に使用できます。リアルタイム設定でスタイル、類似性、安定性を調整し、できるだけ自然な声にしてください。
  • API経由:List Voices APIエンドポイントを使用すると、API呼び出しで利用可能なすべての声のリストを取得できます。各声には固有のvoice IDがあり、ElevenAPIを接続する場所ならどこでも実装できます。 
  • 音声エージェントで:ElevenLabsのボイスクローンをエージェントに接続すると、エージェントが話す際にあなたの声を使えます。異なるプラットフォームで一貫した声の存在感を保ちたい企業にとって、エージェントにブランドらしさを持たせるのに役立ちます。 
  • 言語をまたいで:ボイスクローンは32の言語で機能し、コンテンツを翻訳して自分の声で制作できます。その言語の音声サンプルがなくても、ElevenCreativeは言語をまたいで話し方のプロソディや感情的な特性を高精度に再現します。 

すべてのプロダクトで活用すれば、声に命を吹き込み、高品質なコンテンツを大規模に制作する準備が整います。

ElevenCreativeで声をクローンする

ビデオ制作を加速したいコンテンツクリエイターにも、自分の声を残したい方にも、ElevenLabsのボイスクローンはシンプルで高速、そして効果的です。 

インスタントボイスクローンは無料プランで利用でき、数分で完了します。クリエイタープランでは、プロフェッショナルボイスクローンを始められます。詳しくはElevenLabsのボイスクローンまたは登録して、今すぐ声をクローンしましょう。

よくある質問

関連記事

最高品質のAIオーディオで創造する