コンテンツへ移動

ElevenLabsで自分の声をクローンする方法:徹底解説

執筆者
Jack Limebear
公開日
最終更新日

聴くこの記事を聴く

同じ声は二つとしてありません。声は、生まれ持った特性や環境によって形づくられ、長年にわたる表現を通じて磨かれていくものです。とても個人的なものです。

こうした個性は、つい最近まで再現できませんでした。しかし、AIの進歩により、驚くほど高い精度で声をクローンできるようになりました。わずか数分の音声があれば、元の声に非常によく似た音声をAIシステムで生成できます。

このガイドでは、ElevenLabsで声をクローンする方法を詳しく説明します。録音する内容や、インスタントボイスクローンとプロフェッショナルボイスクローンの選び方、完成したクローンの活用方法をご紹介します。どちらの方法についても、手順を追って詳しく解説します。

概要

  • ElevenLabsでは、インスタントボイスクローンとプロフェッショナルボイスクローンサービスを提供しています。
  • インスタントボイスクローンには、数分間のクリアで一貫した音声が必要です。
  • プロフェッショナルボイスクローンには、最大3時間の音声データが必要です。
  • クローンを作成した後は、ElevenLabsの他のプロダクトと連携できます。
  • 声をクローンするには、明示的な同意が必要です。ElevenLabsでは、これらのサービスを利用する前に同意の確認を求めます。

インスタントクローンとプロフェッショナルボイスクローン:どちらが必要?

ElevenLabsでは、2種類のボイスクローン方法から選べます。 

インスタントクローンなら、わずか数分で実用的な音声を作成でき、声のクローンをすぐに活用できます。プロフェッショナルボイスクローンはより時間がかかりますが、非常に高忠実度なモデルを作成できます。

自分に最適な方法を選ぶための早見ガイドです:

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

これらの方法の違いを理解すれば、事前の時間を節約し、すぐに始められます。

ElevenLabsで声をクローンする前に必要なもの

ElevenLabsのプロフェッショナルボイスクローンとインスタントボイスクローンのどちらを選ぶ場合でも、用意しておくと便利な基本事項がいくつかあります。特にインスタントの場合は必須ではありませんが、クローンの品質に大きな差が出ることがあります。

録音を始める前に、次の点を確認してください:

  • 音質の要件: プロ仕様の録音用マイクを使うと大きな違いが出ます。最低要件は、44.1kHzまたは48kHz、ビット深度24ビット以上でWAVファイルを録音できることです。WAVファイルに対応するデジタルオーディオワークステーション(DAW)を使い、静かな場所で録音してください。無料で使えるAudacityもおすすめです。
  • サンプルの最小時間: 必要な音声データ量を必ず確認してください。重要なのはファイル数ではなく、すべてを合わせた合計再生時間です。プロフェッショナルボイスクローンでは、できるだけ3時間に近い長さのファイルをアップロードしてください。
  • 話す内容: ElevenCreativeのボイスクローンは、提供された声の再現を目指します。ゆっくりと単調に読めば、その特徴が録音に反映されます。感情や話すペースに変化をつけ、自然に話してください。ElevenLabsでは、プロフェッショナルボイスクローン用のスクリプトを用意しています。

こうした点を事前に数分かけて準備しておくことで、最終的なボイスクローンの品質が向上します。

ElevenLabsでインスタントボイスクローンを作成する方法

数分の時間があり、静かな場所にいるなら、声をクローンする準備はできています。ElevenCreativeでは、自然な話し方の感情表現やプロソディを再現した、32以上の言語で利用可能な声のデジタルレプリカを作成できます。 

ElevenLabsのインスタントボイスクローンの使い方:

  1. Voicesにアクセスする
  2. サンプルをアップロードする
  3. 声に名前を付けて保存する
  4. スクリプトでテストする
  5. 安定性と類似性の設定を調整する

それぞれの手順を詳しく見ていきましょう。

ステップ1:Voicesでインスタントボイスクローンのページを開く

まず、ElevenLabsのダッシュボードにログインします。左側のサイドバーでVoicesを選択し、プラスアイコンをクリックしてください。

画面にポップアップ(下の画像)が表示され、いくつかの選択肢が表示されます:

  • ボイスデザイン
  • インスタントボイスクローン
  • プロフェッショナルボイスクローン
  • ボイスリミックス 

モジュールからインスタントボイスクローンを選択すると、該当ページが開きます。

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

ステップ2:サンプルをアップロードする

画面の指示に従って、事前に録音した音声ファイルをアップロードするか、ブラウザから直接録音してください。この段階では、複数のファイルをエンジンにアップロードできます。ElevenLabsでは、各ファイルの長さではなく、合計再生時間をボイスクローンに使用します。

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

少なくとも1~2分間の、クリアで一貫した音声を用意してください。

ノイズの多い環境を避ける、マイクの品質を確認する、すべての録音で同じ機材を使うといったベストプラクティスも表示されます。

ステップ3:声に名前を付けて保存する

声を録音すると、ElevenLabsがボイスクローンの合成を開始します。この段階で音声をプレビューして聞き、名前を付けられます。

言語、アクセント、性別、年齢などのラベルを追加することもできます。説明欄には、この声を整理するために役立つ情報や、後で思い出すためのメモを追加できます。 

Voice cloning interface for uploading and describing audio samples.

最後に、同意内容を読み、承諾したことを確認するために同意ボックスをクリックします。自分の声でも他人の声でも、扱っている声のクローンを作成するには必ず同意を得ている必要があります。

ステップ4:インスタントボイスクローンをテストする

声を作成したら、My Voicesに移動し、Use voiceをクリックして、テキスト読み上げプレイグラウンドでクローンを使い始めます。ボイスクローンに話させる短いスクリプトを書いてください。しっかりテストするには、トレーニング用音声に含めていない内容を書くようにしましょう。

ボイスクローンを選択してテキストを書いたら、ページ下部のGenerate speechをクリックして音声を生成します。

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

ステップ5:モデルを調整して改善する

ボイスクローンを聞いて、少し違和感があると感じても、最初から作り直す必要はありません。ElevenLabsでは、最終的な音声を調整できるさまざまな設定スライダーを用意しています。

画面右側にある次のコントロールを調整し、ボイスクローンにどのような影響があるか試してみてください:

  • 安定性: 安定性を高くすると、一貫性があり予測しやすい声になります。低くすると表現力は増しますが、一貫性がやや失われる場合があります。ほとんどの用途では中程度の設定が最適です。
  • 類似性: ボイスクローンが提供された音声サンプルにどれだけ忠実に従うかを決めます。このスライダーを上げると、より自分らしい声になります。歪みが聞こえる場合は、スライダーを下げてください。
  • スタイル: トレーニング用音声の表現力を強めたい場合は、このスライダーを上げてください。ただし、値が高すぎると最終サンプルが歪むことがあります。

これらのスライダーの値を調整したら、もう一度Generate speechをクリックして、モデルの変化を確認してください。 

この5つの手順を終えれば、ElevenLabsのボイスクローンをすぐに使い始められます。

オリジナル
ボイスクローン
Lily
Lily
オリジナル
Lily
Lily
クローン
Chris
Chris
オリジナル
Chris
Chris
クローン
Laura
Laura
オリジナル
Laura
Laura
クローン
自分の声とそっくりなレプリカを作成します。

ElevenLabsでプロフェッショナルボイスクローンを作成する方法

ElevenLabsでプロフェッショナルに声をクローンするには、インスタント版より時間がかかりますが、声を非常に忠実に再現する高精度なモデルを作成できます。 

クリエイタープラン以上をご利用の場合は、次の手順でElevenLabsのプロフェッショナルボイスクローンを作成できます:

  1. Voicesにアクセスする
  2. 音声をアップロードする
  3. サンプルの長さに関するフィードバックを確認する
  4. 音声サンプルを処理して品質を向上させる
  5. セキュリティのために自分の声を認証する
  6. 声の微調整処理を待つ
  7. ボイスクローンを使う

それぞれの手順を詳しく見ていきましょう。

ステップ1:Voicesでプロフェッショナルボイスクローンのページを開く

ElevenLabsのダッシュボードにログインし、左側のサイドバーでVoicesを選択してから、Create Voiceをクリックします。ポップアップには、先ほどと同じ選択肢が表示されます。

今回は、Professional Voice Cloneを選択します。次のような幅広い推奨事項が表示されます:

  • ポップフィルターを使用する
  • ノイズのない状態で録音する
  • 音響処理された部屋で録音する
  • 音声を事前処理する
  • 録音全体で音量を一定に保つ
  • 最低30分、理想的には3時間に近い音声を用意する

ステップ2:音声をアップロードする

Upload samplesをクリックし、事前に録音した音声ファイルを追加します。自分で録音して、ソフトウェアに直接アップロードすることもできます。広告、ナレーション、会話モデルなど、用途別に使えるさまざまなスクリプトを用意しています。

Professional Voice Clone interface for uploading and describing audio samples.

これらの音声ファイルには、話し声のみを含めてください。現在、歌唱は入力・出力ともにサポートしていません。 

ステップ3:サンプルの長さに関するフィードバックを確認する

音声を正常にアップロードしたら、長さに関するフィードバックを必ず確認してください。インスタントボイスクローンには1~2分で十分ですが、このサービスでは1~3時間の音声をアップロードすることをおすすめします。

さまざまな感情が含まれた音声ファイルを用意してください。モデルが最大限に活用できる情報を得られるよう、スタジオ品質で多様なコンテンツを選ぶことが重要です。

Professional Voice Clone interface showing voice sample upload and configuration options.

ステップ4:音声サンプルを処理して品質を向上させる

プロフェッショナルボイスクローンプラットフォーム内で、音声サンプルの品質を直接向上させることができます。バックグラウンドノイズの除去から話者の分離まで、ElevenLabsが高品質な音声入力の作成を支援します。

必須ではありませんが、この段階で処理すると最終的なボイスクローンモデルの品質が向上します。

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

ステップ5:セキュリティのために自分の声を認証する

ElevenLabsでは、プロフェッショナルボイスクローンの作成時に認証が必要です。すべてをアップロードした後、インターフェースから短いクリップを直接録音するよう求められます。できる限りトレーニング用録音と同じマイクと部屋のセットアップを使い、声のトーンや話し方のスタイルも近づけてください。

認証に失敗した場合は、24時間後に再試行できます。それより早く始める必要がある場合は、ElevenLabsサポートに直接お問い合わせください。 

ステップ6:声の微調整処理を待つ

声の認証後、ElevenLabsがモデルの微調整を開始します。通常は3~6時間かかりますが、自分より先に多くのプロフェッショナルボイスクローンがキューに入っている場合は、さらに時間がかかることがあります。

クローンのステータスを確認するには、My Voicesに移動してください。声のモデルが使用可能になると、通知も届きます。

ステップ7:ボイスクローンを使う

これで、完全に機能するプロ仕様のボイスクローンが完成しました。完成したモデルはMy Voicesに表示され、テキスト読み上げ、Studio、吹き替え、API、ボイスエージェントなど、他のすべてのElevenLabsプロダクトで使用できます。

ボイスピッカーダッシュボードで、作成時に付けた名前の声を選択して始めてください。

ElevenLabsボイスクローンのベストプラクティス

インスタントボイスクローンとプロフェッショナルボイスクローンのどちらでも、上記の手順に従えばクローンを作成できます。ただし、事前に実践できる追加のポイントもあります。以下では、録音ツールや録音方法に少し工夫を加えて、ボイスクローンの品質を高める方法をご紹介します。

以下のAIボイスクローンのベストプラクティスは、インスタントとプロフェッショナルの両方に当てはまります:

  • 部屋の音響とバックグラウンドノイズ: 音声のクリアさは、最終的な品質に直接影響します。バックグラウンドノイズや反響のない場所で録音してください。プロの録音には録音ブースが適しています。スタジオを予約せずにその品質を求めるなら、近くのコワーキングスペースに防音ポッドがないか確認してみましょう。
  • マイクとの距離: 話す際は、マイクから握りこぶし約2つ分の距離を取るのが目安です。これは有用な基本ルールですが、詳しくはマイクの仕様も確認してください。
  • サンプルに含める感情の幅: AIモデルは、声に含まれる自然なプロソディや話し方の特徴を使用します。表現が平板だと、モデルも同じように抑揚の乏しい話し方になる可能性があります。さまざまな場面での自然な話し方が伝わる、幅広い感情のサンプルを含めてください。 
  • 文のバリエーションとスクリプトの読み上げ: スクリプトを声に出して読むことは、長めのサンプルを用意する出発点として有用ですが、リハーサルのように不自然に聞こえることがあります。特に初めて読む場合は、文に求められる感情のニュアンスを正確に表現できないかもしれません。バランスを取るには、さまざまなスクリプトを会話に近い話し方で録音してください。 

これらのベストプラクティスに従うことで、ElevenLabsにより高品質な入力を提供できます。その結果、声の個性をより正確に再現したボイスクローンを作成できます。 

ElevenLabsのボイスクローンはどう使える?

ElevenLabsでプロフェッショナルまたはインスタントのボイスクローンを作成すると、その声はMy Voicesに表示されます。そこから、他のすべてのElevenLabsプロダクトで利用できます。

ElevenLabsのボイスクローンを利用できる場所:

  • アプリのテキスト読み上げ: ElevenLabsのテキスト読み上げプレイグラウンドでは、声を選択して入力したテキストを読み上げられます。ボイスオーバーやポッドキャストのイントロなど、単発の音声生成に使用できます。リアルタイム設定でスタイル、類似性、安定性を調整し、できるだけ自然な声に仕上げてください。
  • API経由: List Voices APIエンドポイントを使用すると、API呼び出しで利用可能なすべての声のリストを取得できます。各声には固有のvoice IDがあり、ElevenAPIを接続する場所で使用できます。 
  • ボイスエージェント: ElevenLabsのボイスクローンをエージェントに接続すると、会話時に自分の声を使えます。特に、複数のプラットフォームで一貫した声の存在感を求める企業にとって、エージェントのブランドに沿った運用に役立ちます。 
  • 多言語での利用: ボイスクローンは32言語で利用でき、コンテンツを翻訳して自分の声で生成できます。その言語の音声サンプルがなくても、ElevenCreativeは言語をまたいで、話し方のプロソディや感情的な特性を忠実に再現します。 

すべてのプロダクトで活用すれば、声を生かしながら高品質なコンテンツを大規模に制作できます。

ElevenCreativeで声をクローンする

ビデオ制作を効率化したいコンテンツクリエイターにも、単に自分の声を残しておきたい方にも、ElevenLabsのボイスクローンはシンプルで迅速、効果的です。 

インスタントボイスクローンは無料プランで利用でき、わずか数分で作成できます。クリエイタープランでは、プロフェッショナルボイスクローンを始められます。ElevenLabsのボイスクローンについて詳しく確認するか、登録して、今すぐ声をクローンしましょう。

よくある質問

関連記事

最高品質のAIオーディオで創造する