ElevenLabsがベータ版を終了し、約30言語に対応した基盤AI音声モデルEleven Multilingual v2をリリース
- 公開日
聴くこの記事を聴く
- 音声AIプラットフォームElevenLabsは、コンテンツにおける言語の壁をなくす取り組みを大きく前進させました。28言語に対応する多言語機能を備えた新しい基盤ディープラーニングモデル、 Eleven Multilingual v2
- この進歩により、世界中のメディア企業、ゲームデベロッパー、出版社、個人クリエイターは、コンテンツのアクセシビリティを大幅に向上できます。
- 1月のプラットフォーム公開以降に実施された数多くの新機能リリースと改善に続くこれらの新機能は、正式なベータ版終了も意味します。
- ElevenLabsの使命は、あらゆるコンテンツを、どの言語でも、どの声でも、誰もが利用できるようにすることです。
ElevenLabsは、本日、新たな多言語音声生成モデルを発表しました。約30言語で、感情豊かなAIオーディオを正確に生成できます。
完全に社内研究に基づくこの進歩により、クリエイターは欧州、アジア、中東の国際市場向けにローカライズされたオーディオコンテンツを制作できます。ElevenLabsは過去18か月にわたり、人間の発話を特徴づける要素を分析し、文脈を理解して音声生成で感情を伝えるための新たな仕組みを構築するとともに、新しく個性豊かな音声を合成してきました。
Eleven Multilingual v2では、ElevenLabsのテキスト読み上げプラットフォームにテキストを入力すると、新モデルが約30の文字言語を自動で識別し、これまでにない自然さで音声を生成します。
同時に、合成音声かクローン音声かを問わず、元のアクセントを含む話者固有の声の特徴がすべての言語で維持されます。つまり、同じ声で28の異なる言語のコンテンツに命を吹き込めます。
今回の展開は、プラットフォーム上のすべてのクリエイターにプロフェッショナルボイスクローンを公開したことに続くものです。追加のセーフティ機能とセキュリティ機能とともに提供されたこのプロダクトアップデートにより、ユーザーは元の声とほぼ区別できない、自分の声の完璧なデジタルコピーを作成できます。本日のリリースにより、ご自身の声で多言語モデルが対応する約30言語を話せるようになります。
新たに対応する言語: 中国語、韓国語、オランダ語、トルコ語、スウェーデン語、インドネシア語、フィリピン語、日本語、ウクライナ語、ギリシャ語、チェコ語、フィンランド語、ルーマニア語、デンマーク語、ブルガリア語、マレー語、スロバキア語、クロアチア語、古典アラビア語、タミル語。
これらは、これまで対応していた言語に加わります】【:英語、ポーランド語、ドイツ語、スペイン語、フランス語、イタリア語、ヒンディー語、ポルトガル語。
最近の機能リリースとプラットフォームの継続的な改善を経て、ElevenLabsは本日、プラットフォームが正式にベータ版を終了することも発表しました。この移行は、世界で100万人を超えるユーザーに信頼性が高く最先端のツールを提供するという取り組みにおける重要な節目です。
今後、ElevenLabsは、ユーザーがプラットフォーム上で音声を共有し、新しいオーディオの開発からメリットを得られる仕組みを導入する予定です。人間とAIの協働の機会を育みます。
ElevenLabsのCEO兼共同創業者、Mati Staniszewskiのコメント:
ElevenLabsは、あらゆるコンテンツを、どの言語でも、どの声でも、誰もが利用できるようにするという夢から始まりました。Eleven Multilingual v2のリリースにより、この夢の実現、そして人間品質のAI音声をあらゆる方言で利用可能にすることへ、一歩近づきました。
「テキスト読み上げ生成ツールは、誰もが公平に利用できる環境を整え、あらゆるクリエイターに最高品質の音声オーディオ機能を提供します。こうしたメリットは現在、約30言語にわたる多言語アプリケーションにも広がっています。いずれはAIの力でさらに多くの言語と音声をカバーし、コンテンツにおける言語の壁をなくしたいと考えています。ElevenLabsは、アクセシビリティにおけるこの進歩が、最終的にはさらなる創造性、イノベーション、多様性を育むと信じています。
複数言語で高品質なオーディオコンテンツを制作するために必要なコストとリソースを抑えることで、ElevenLabsは企業やクリエイターが文化や言語を越えて心に響く、より想像力豊かで利用しやすいコンテンツを生み出せるようにしています。
インディーゲームデベロッパーや出版社にとって、多言語音声生成ツールは、国際的なオーディエンス向けにゲーム体験やオーディオコンテンツを翻訳する新たな機会を提供します。音声オーディオの品質や正確性を損なうことなく、プレイヤーやリスナーとそれぞれの言語でつながれます。
同様に、教育機関は現在、学習者に対象言語の正確なオーディオコンテンツを即座に提供できます。言語理解力や発音スキルを高めるとともに、留学生の多様な指導スタイルや学習ニーズにも対応できます。
あらゆる分野のクリエイターは、ElevenLabsのツールを活用してコンテンツのアクセシビリティを向上できます。視覚コンテンツを多言語対応の音声で補完することで、視覚障害のある方や追加の学習支援を必要とする方に役立ちます。
2023年1月に発表したAI音声ツールの初期ラインナップには、あらかじめ設計された合成音声から選んで任意のテキストを音声に変換する機能と、自分の声のクローンを作成する機能が含まれていました。多言語音声合成ツールは、あらゆるコンテンツを、どの言語でも、どの声でも、誰もが利用できるようにするというElevenLabsの使命に向けた、さらなる一歩です。
この技術はすでに複数のクリエイティブ分野や業界で採用されています。インディー作家によるオーディオブック制作、ビデオゲームの脇役キャラクターのボイス、視覚障害のある方によるオンライン文章コンテンツへのアクセス支援、世界初のAIラジオチャンネルの運営などに活用されています。ElevenLabsは、以下を含む多彩な主要コンテンツクリエイターやスタジオとも提携しています。AIビデオジェネレーターのD-ID、世界最大級のオーディオブック出版社Storytel、オープンアクセスの科学ビデオプラットフォームScienceCast、そのビデオ生成ツールは、arXivで公開された科学研究論文を要約します。世界有数のコンテンツクリエイタープラットフォームTheSoul Publishing、優れたゲームデベロッパーであるEmbark StudiosとParadox Interactive、そしてメディアプラットフォームのMNTN。
お問い合わせ
press@elevenlabs.io




