Eleven v4を発表これまでで最も感情豊かなモデル、Eleven v4をご紹介します。 10月12日まで、Creator+には3倍のクレジットが含まれます

コンテンツへ移動

ボイスチェンジャーのご紹介

公開日

聴くこの記事を聴く

Voice Changerは、もともとスピーチtoスピーチと呼ばれていました。AI音声エージェントの文脈では、「スピーチtoスピーチ」は、単一のモデルがオーディオ入力と出力を直接処理する融合型アーキテクチャも指します。ElevenAgentsでは、プラットフォームに高度なカスケード型アーキテクチャを採用しています。詳細はこちら:カスケード型モデルと融合型モデルの比較。

ボイスチェンジャー

ボイスチェンジャーを音声合成に追加しました。ボイスチェンジャーは、ある声の録音を別の声が話しているように変換するボイス変換ツールです。元の話し方はそのまま保持されます。つまり、録音に込めた感情、タイミング、話す速さ、発音が、出力される声にも引き継がれます。

これにより、テキスト読み上げのプロンプトだけでは常に実現できないレベルのコントロールが可能になります。主な使い方は2つあります。

声からより豊かな感情を引き出す。すべての声が、テキスト読み上げプロンプトによる感情表現の指示に同じように反応するわけではありません。ボイスチェンジャーなら、表現力豊かな話し声を録音またはアップロードし、その感情表現の幅を別の声で再現できます。プロのナレーターをより温かみのある声にしたい場合や、児童書のキャラクターをもっと遊び心のある声にしたい場合は、自分で演じた話し方をボイスチェンジャーで対象の声に反映できます。

話し方を細かく調整する。テキスト読み上げモデルは通常、特別な設定なしでもイントネーションを適切に処理します。しかし、特定のフレーズをどう話すかを正確にコントロールしたい場合――どこを強調するか、間をどう取るか、どんなリズムにするか――ボイスチェンジャーなら自分の声で実演し、その話し方を選んだ任意の声に適用できます。今後ボイスチェンジャーをStudioに直接統合すれば、さらに便利になりますが、目標は同じです。出力を細部までコントロールできるようにすることです。

コミュニティメンバーによる解説をご紹介します:

研究

元の音声を対象の音声へ変換するには、元の音声の内容を対象音声の特性で表現する必要があります。わかりやすい例は顔交換です。2つの顔を取り込み、片方の顔の構造にもう片方の人物の特徴を描画して融合するアプリのようなものです。

そのためには、顔の画像を取り、その属性をマッピングします。下の例にあるマーカーがまさにそれを行っています。マーカーは、もう一方の顔を描画する範囲を定める境界です。

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

ボイス変換の鍵は、対象音声の音素を使って元の音声の内容を描画することです。ただし、顔交換の例と同様にトレードオフがあります。ある顔の属性をマッピングするマーカーが多いほど、その内側にマッピングする顔への制約も増えます。マーカーが少なければ、制約も少なくなります。

ボイス変換でも同じです。対象音声を優先するほど、元の音声との同期がずれるリスクが高まります。一方で、対象音声を十分に優先しなければ、その音声らしさの多くが失われるおそれがあります。たとえば、怒鳴っている人の録音をささやくような声で再現しようとすると、問題が生じます。元の音声の感情を優先しすぎると、ささやくような声が話しているという印象が失われます。ささやく話し方を重視しすぎると、元の音声の感情的な力が失われます。

プロダクトと最近のアップデート

プリメイド音声の変更

音声合成で利用できるデフォルト音声を変更します。いくつかの音声を廃止して新しい音声に置き換え、今後数週間で20種類以上の追加を予定しています。

また、各音声がいつまで利用可能と見込まれるかをUIで表示するようにします。12月中は、音声の多様性を高めるため、音声共有と利用報酬の機能を刷新します。詳細は近日公開予定です。

Eleven Turbo v2&uLaw 8kHz形式

Turbo v2は、チームによる数か月にわたる研究の成果です。リアルタイムのインタラクション向けに設計されていますが、あらゆるユースケースで利用できます。また、IVRシステム向けの標準(m)uLaw 8kHz形式にも対応しています。

Studioでのノーマライゼーションとメタデータ

Studioは、ゲイン調整やダイナミック圧縮を含む業界標準のオーディオブック提出ガイドラインに対応しました。ISBN、著者、タイトルなどのメタデータをStudioプロジェクトに直接埋め込むこともできます。

発音辞書

これは特に要望の多かった機能の1つです。先月、英語モデルでIPAおよびCMU辞書を使って発音を指定できるSSMLタグに対応しました。今回、発音辞書のサポートをStudio UIに追加しました。IPA、CMU、または単語の置換(エイリアス)で発音を指定したファイルをアップロードできます。辞書ファイルには、業界標準のオープンな.PLSレキシコンファイル形式を使用します。

IPAとCMUは現在、Turbo v2 Englishでサポートされています。単語の置換は、すべてのモデルと言語でサポートされています。完全なドキュメントはこちら。

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

ご意見・ご感想があれば、ぜひDiscordでお知らせください!

ボイスチェンジャーを試す

思いどおりに話し、まったく異なる声で届けられる音声を体験してください。話し方を細部までコントロールしながら、ささやき声、笑い声、アクセント、繊細な感情のニュアンスまで捉えられます。

好きなように話して、まったく違う声で聞くことができます。パフォーマンスも細かく調整可能。ささやき声や笑い声、アクセント、微妙な感情表現までしっかり再現します。

関連記事

最高品質のAIオーディオで創造する