コンテンツへ移動

音声変換

公開日
最終更新日

聴くこの記事を聴く

音声変換とは?

音声変換では、ある人の声を別の人の声へと変換できます。「ボイスクローン」と呼ばれるプロセスで、変換先となるターゲット音声をエンコードします。そして、元のイントネーションを保ちながら、ターゲット話者らしさに合った話し方で同じメッセージを生成します。

用途

高品質な音声変換とボイスクローン技術は、多様な業界におけるコンテンツの制作、配信、利用のあり方を大きく変える可能性を秘めています。制作時間とコストを最適化するとともに、変換アルゴリズムの学習のために自分の声を提供する人々に、継続的な収益を得る手段を提供します。

  • 映画制作では、俳優が音声データベースをプロデューサーと共有することで、撮影現場やスタジオに出向かずに音声トラックを作成できます。
  • 言い間違えたセリフも、ポストプロダクションでより効果的に録り直せます。
  • この技術は、架空のシナリオで歴史上の人物の声を忠実に再現したり、故人となった俳優の声をよみがえらせたりすることにも使えます。
  • ビデオゲーム開発でも同様に役立ちます。セリフの修正や試行を、その場で、俳優が収録に立ち会わなくても行えます。
  • 医療では、たとえば喉頭がんの治療などで話す能力を失った患者が、自分の声でもう一度コミュニケーションを取れるようになる可能性があります。
  • バーチャルアシスタントはパーソナライズできるようになります。家庭のユーザーにとっては、見知らぬ仮想的な声よりも、たとえば愛する人の声とやり取りするほうが自然に感じられるかもしれません。
  • 一方、広告業界では、人間と変わらない自然さを持ちながら、権利所有やロイヤリティの問題を避けられる合成ボイスオーバーを導入するメリットがあります。また、認識できる特定の声が必要な場合も、広告制作者は長時間の収録に俳優本人を立ち会わせることなく、同意を得たうえで特定の俳優の声をクローンできます。
  • オーディオブックやポッドキャストも、ボイスクローンと音声変換技術を活用することで、没入感のあるコンテンツの制作・編集を最適化できる、成長中の業界の例です。

ElevenLabsの音声変換

Elevenでは、ツール群の一部として音声変換ソフトウェアを開発していますが、「ボイスクローン」と音声合成に関する研究は主に、来年初頭のリリースを予定している主力プロダクト、話者のアイデンティティを維持する自動吹き替えツールの開発につながっています。

目標は、あらゆる話し言葉のコンテンツを、ワンクリックで元の話者の声のまま言語を越えて利用できるようにすることです。英語の教育用YouTube動画を想像してください。スペイン語しか話せない人にとって、その言語が分かれば興味を持つテーマであっても、これは問題です。もちろん字幕は解決策になりますが、私たちが目指すのは、もっと没入感があり、楽しくコンテンツに触れられる方法です。実際にはスペイン語を話せない人でも、同じ人物が同じメッセージをネイティブレベルの自然なスペイン語で話しているように生成したいと考えています。

そのために、ボイスクローンを使って話者のアイデンティティ、つまり声の響きを保持します。別の言語で新たな発話を生成し、同じ人物が話しているように聞こえるようにします。

最大限の没入感を実現するために、話者の感情、意図、話し方のスタイルも保ちたいと考えています。そこで音声変換が活用されます。堅牢な多言語モデルを学習させ、元の言語の発話を解析し、適切なイントネーションでターゲット言語へマッピングします。

仕組み

ある人の声を別の人の声へ、つまりソース音声をターゲット音声へ変換するには、ソース音声の内容をターゲット音声の特性で表現するアルゴリズムが必要です。分かりやすい例として、顔交換アプリがあります。自分の顔と他人の顔を組み合わせ、両者が一つになった画像を作れます。

これを行うには、顔の画像を取り、その属性をマッピングします。下の例にある点は、まさにそのためのものです。もう一方の顔の特徴を描画する範囲を示しています。

音声変換では、アルゴリズムがターゲット音声の特性をエンコードする方法が必要です。アルゴリズムは、その音声の多数の例からなるデータセットで学習します。これらのサンプルを、いわば音声の「原子」ともいえる基本レベルまで分解します。音声は文で構成され、文は単語で構成されます。単語は音素から成り、音素がターゲット音声の特性を示します。これが、アルゴリズムが処理する基本レベルです。

音声変換の鍵は、ターゲット音声の音素を使ってソース音声の内容を再現することです。しかし、ここには顔交換の例と同じようにトレードオフがあります。ある顔の属性をマッピングするためのマーカーを多く使うほど、その内側にマッピングする顔への制約も増えます。マーカーが少なければ制約も少なくなります。音声変換でも同じです。ターゲット音声を優先するほど、ソース音声との同期がずれるリスクが高まります。しかし、優先度が低すぎると、その音声を特徴づける要素の多くを失うおそれがあります。たとえば、怒鳴っている人の録音をモーガン・フリーマンの声で再現しようとすると、難しい問題に直面します。ソース音声の感情を優先しすぎれば、本当にモーガン・フリーマンが話しているという印象が失われます。彼の話し方を強調しすぎれば、ソース音声の感情的な強さが失われます。

倫理

技術の悪用される可能性に不安を抱く人が増えているため、ボイスクローンに関する倫理的な懸念には向き合う必要があります。2020年には、詐欺師が電話でCEOになりすまし、3,500万ドルの銀行送金を承認させるために音声ディープフェイクを使用しました。誰かが実際には言っていないことを言ったように、もっともらしく見せられる技術は、偽情報の拡散、名誉毀損、詐欺に使われるという懸念を生むのは当然です。同様に、音声所有者の同意なしに生成されたコンテンツからユーザーが利益を得られる場合、音声変換は著作権侵害に関する重要な問題を提起します。

Elevenでは、技術が悪意ある目的に使われないよう可能な限りの対策を講じ、その危険から守るための安全策を実装する必要があると考えています。

  • 偽情報の拡散、名誉毀損、詐欺、または違法・有害と見なされうるその他の目的での悪意ある技術利用を禁じる利用規約を遵守するクライアントとのみ提携します。
  • Elevenが制作する合成ビデオコンテンツには、AI生成であることを明示する明確な透かしが含まれます。オーディオコンテンツには、明確なファイル説明が付与されます。認識できる声を使用する場合は、デモンストレーション目的かつ利益相反を生じさせない文脈に限ります。
  • 同時に、音声所有者とそのライセンサーが権利を主張できるよう支援します。
  • 私たちの方針を改善するアイデアがあれば、ethics@elevenlabs.io

強力な新技術に対する姿勢を決めるうえで、悪用への恐れが支配的な要因になるべきではないと考えています。むしろ、開発段階で適切な安全策を確実に導入し、害のリスクを最小限に抑えながら、その技術がより広いコミュニティにもたらす可能性を最大限に活かすべきです。

未来

音声変換とボイスクローン技術は、映画、テレビ、コンテンツ制作、ゲーム開発、ポッドキャスト、オーディオブック、そして広告業界に革命をもたらす可能性があります。しかし、その用途は商業分野にとどまらず、医療、教育、コミュニケーションでも活用が期待されています。

ボイスクローンは、あらゆるコンテンツをあらゆる言語と声で生成し、世界中の何百万人もの人々に届け、まったく新しい経済を生み出す未来への道を切り開いています。Elevenの目標は、この未来の実現を支援することです。

関連記事

最高品質のAIオーディオで創造する