ボイスチェンジャー

感情や話し方を保ちながら、声を変換する方法を解説します。

概要

ボイスチェンジャー(旧スピーチtoスピーチ)では、元の声のトーンや話し方を維持したまま、一つの声(元の声)を別の声(クローンされた声)に変換できます。

ボイスチェンジャーは、発音エラーを修正したり、表現したかった特別なパフォーマンスを加えたりすることで、テキスト読み上げ(TTS)を補完できます。ボイスチェンジャーは、より感情豊かで人間らしい印象を与える、声の微妙で個性的な特徴を再現する際に特に役立ちます。主な機能は次のとおりです。

  • ささやき声をより高精度に再現
  • 聞き取れるため息、笑い声、泣き声を作成可能
  • トーンと感情の検出を大幅に改善
  • 入力された話し方のリズムを正確に維持
  • 言語/アクセントの維持

ガイド

ボイスチェンジャーのデモ

オーディオは、オーディオファイルを直接アップロードするか、マイクを通じてライブで録音できます。オーディオファイルのサイズは50MB未満である必要があり、オーディオファイルまたはライブ録音の長さは5分以内である必要があります。

5分を超える素材がある場合は、小さなセクションに分割して個別に生成することをおすすめします。また、ファイルサイズが大きすぎる場合は、mp3に圧縮または変換する必要があることがあります。

既存のオーディオファイル

既存のオーディオファイルをアップロードするには、オーディオボックスをクリックするか、オーディオファイルを直接ドラッグ&ドロップします。

ライブ録音

オーディオボックスのRecord Audioボタンを押し、録音の準備ができたらMicrophoneボタンを押して開始します。録音が終わったら、Stopボタンを押します。

録音したオーディオファイルが表示され、再生して確認できます。パフォーマンスや録音に満足しているかを判断するのに役立ちます。文字数コストは左下隅に表示され、録音そのものにクォータは消費されません。クォータが消費されるのは「Generate」を押したときだけです。

ボイスチェンジャー生成の料金は、1分あたり1000文字で、長さのみに基づいて計算されます。

設定

ボイスチェンジャーの設定

さまざまな音声設定については、こちらをご覧ください。

ボイスチェンジャーには、録音からバックグラウンドノイズを自動的に除去する追加設定があります。

対応言語

eleven_english_sts_v2

Multilingual v2モデルは、29言語に対応しています。

英語(米国、英国、オーストラリア、カナダ)、日本語、中国語、ドイツ語、ヒンディー語、フランス語(フランス、カナダ)、韓国語、ポルトガル語(ブラジル、ポルトガル)、イタリア語、スペイン語(スペイン、メキシコ)、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語(サウジアラビア、アラブ首長国連邦)、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。

eleven_english_sts_v2モデルは英語のみに対応しています。

モデルの詳細

ベストプラクティス

ボイスチェンジャーは、さまざまな出力音声でアクセントと自然な発話のリズムを維持することに優れています。たとえば、ポルトガル語アクセントのオーディオサンプルをアップロードすると、出力でもその言語とアクセントが維持されます。入力サンプルは出力の特性を決定するため、非常に重要です。「George」のようなイギリス英語の声を選択しても、アメリカ英語アクセントで録音した場合、結果はアメリカ英語アクセントのGeorgeの声になります。

  • 表現:録音では表現豊かに話してください。叫び声、泣き声、笑い声なども、ボイスチェンジャーはパフォーマンスを正確に再現します。このツールはAIのリアリティを高め、創造的な表現を可能にするよう設計されています。
  • マイクゲイン:入力ゲインが適切であることを確認してください。録音が小さすぎるとAIの認識が妨げられる可能性があり、大きすぎるとオーディオクリッピングが発生する可能性があります。
  • バックグラウンドノイズ:Remove Background Noiseオプションをオンにすると、録音からバックグラウンドノイズを自動的に除去できます。

よくある質問

以前はスピーチtoスピーチと呼ばれていたボイスチェンジャーでは、元の声のトーンや話し方を保ちながら、ある声(ソース音声)を別の声(クローン音声)に変換できます。

可能性は無限です。発音を修正したり、求めていた特別な演技を加えたりして、テキスト読み上げを補完できます。また、幅広い声やトーンを利用できるため、ボイスアクターの表現の幅を広げることにも役立ちます。吹き替え向けのエンドツーエンドソリューションも提供していますが、従来の方法で吹き替えを行いたい場合でも、ボイスチェンジャーを活用して、プロジェクトに合った声を見つけられます。

変換できるオーディオの最大長は5分です。現在の料金については、ElevenCreativeとElevenAPIをご覧ください。

詳しくは、ガイドをご覧ください。

以前はスピーチtoスピーチと呼ばれていたボイスチェンジャーの料金は、Webサイト経由で生成するか、API経由で生成するかによって異なります。

現在の料金については、ElevenCreativeとElevenAPIをご覧ください。

以前はスピーチtoスピーチと呼ばれていたボイスチェンジャーの現在の最大入力長は、300秒、または5分間のオーディオです。これはすべてのサブスクリプションで共通です。

以下のファイル形式をボイスチェンジャーの入力オーディオとして使用できます。

オーディオ:

  • MP3
  • M4A
  • FLAC
  • OGA
  • OGG
  • WAV

ビデオ:

  • MKV
  • WEBM
  • MP4
  • MOV

生成したファイルは、次の2つの方法でダウンロードできます。

コンテンツの生成後、右下にあるダウンロードボタンをクリックすると、すぐに生成済みファイルをダウンロードできます。

以前に生成したファイルは、履歴からダウンロードできます。履歴にアクセスするには、アカウントにログインし、サイドバーでボイスチェンジャーを選択してから、画面右側のパネルにある履歴タブをクリックしてください。 

ダウンロードボタンをクリックすると、履歴内の任意のファイルをMP3またはWAV形式でダウンロードできます。追加のダウンロードオプションについては、詳細設定をクリックしてください。

No results