最も感情豊かなモデル、Eleven v4のご紹介
- 公開日
聴くこの記事を聴く
テキストの一文は、話し方によって大きく印象が変わります。「落ち着いていてほしい」という言葉も、おびえた患者に医師が優しく伝える場合と、ゲーム内のキャラクターが戦闘に飛び込む前に仲間へ叫ぶ場合とでは、違って聞こえるべきです。
本日、Eleven v4をリリースします。これは、これまでで最も感情表現豊かなテキスト読み上げモデルであり、低レイテンシー版のEleven v4 Turboも提供します。

Artificial Analysisで第1位を獲得1し、競合モデルとのブラインド比較テストでは約75%のリスナーに選ばれた2Eleven v4は、トーン、話すペース、感情、キャラクター、文脈を読み取れるよう設計されています。話者の個性を保ちながら、ドラマチック、優しさ、緊迫感、コメディ、会話調など、さまざまな表現の音声を生成します。より自然な複数話者のやり取りにより、会話は別々のセリフをつなぎ合わせたものではなく、応答し合う自然なものになります。話者は会話の文脈に反応し、より自然な対話とキャラクター同士のやり取りを生み出します。

パフォーマンスのために構築された新アーキテクチャ
まったく新しいアーキテクチャを基盤とするEleven v4は、最も感情表現豊かなテキスト読み上げモデルであり、Artificial Analysisで第1位に選ばれています1。Eleven v4 Turboは、エージェントのような低レイテンシー用途にも同じ技術を提供します。推論レイテンシーの中央値は約100msで、2人の会話における平均的な間よりも速く応答できます。
どちらのモデルも、機械的ではなく感情豊かに感じられる音声を生成できます。オーディオの忠実度も全体的に向上し、よりクリアで自然な出力を実現しています。
従来世代のテキスト読み上げモデルはテキストを読み上げられますが、Eleven v4ははるかに自然に感じられる感情の深みを音声にもたらします。意図されたトーン、話すペース、文章の特徴、テキストから得られる文脈を解釈し、感情に響く音声を届けます。
出力は細かくコントロールでき、セリフをどのように話すべきかを自然言語で記述できます。特定のフレーズの言い方、伝えるべき感情、さらにはサウンドエフェクトまで、[laughs]、[said angrily in French accent]、[light rain]、[phone buzzing]のようなインラインタグで指定できます。Eleven v4は、従来のモデルよりもこうしたオーディオタグや演出プロンプトに正確に従うため、指定したとおりの話し方が得られます。ナレーションの演出、キャラクターやそのセリフの肉付けなど、話し方が重要な場面で役立ちます。
ElevenLabsデベロッパードキュメントでは、タグの完全な構文と、APIを通じてこれらのタグを適用する方法を紹介しています。国際音声記号(IPA)の音素のサポートも大幅に改善され、カスタム発音がより安定して機能するようになりました。
Eleven v4では、一貫性と複数話者による動的な会話も改善されています。話者のアイデンティティを捉える新しい手法により、各音声の固有の特徴を維持します。エージェントとの会話、オーディオブック、広告でも、一貫した音声を保てます。シーン全体の文脈を理解するため、独立したセリフをつなぎ合わせるのではなく、直前の発言に話者が反応する自然な対話を生成します。
低レイテンシー用途向けTurboモデル
高品質な音声モデルは音声生成に時間がかかる傾向があり、ユーザーは高速な音声エージェントか、表現力豊かな音声エージェントかを選ぶ必要がありました。多くの場合、問い合わせを解決したいだけで焦っている顧客にはロボットのように感じられる、優秀ながらも単調なエージェントが選ばれてきました。
Eleven v4 Turboは、最初の音声が出るまでの時間の中央値約150msで、スピードと感情表現を両立します3。医療分野で専門用語を正確に発音できる、温かく安心感のあるエージェントから、ゲームでプレイヤーを楽しませる、早口でスラングを使いこなすエージェントまで、数え切れないほど多くの業界で強力なエージェントを導入できます。

Eleven v4 Turboは、ElevenLabsの会話型エージェントプラットフォームであるElevenAgentsと連携するよう構築されています。ほかのエージェント構築ツールでは、異なるベンダーのモデルやソフトウェアを組み合わせるため、ユーザーは個別の用途に合わせてモデル出力を調整・改善する手段を持てません。ElevenLabsの研究・エンジニアリングチームは、Eleven v4 TurboとElevenAgentsを一つのシステムとして最適化し、より表現力豊かで信頼性が高く、低レイテンシーなエージェントを実現しました。
一つの声、無数の言語
コミュニケーションのあり方は、文脈、場所、さらには時間帯によっても異なります。そうした違いを反映する表現力豊かな音声を、複数の言語で構築することは、AIオーディオにおける最も難しい課題の一つです。
Eleven v4は、これらすべての領域で進化しており、改善はフレーズの発音だけにとどまりません。言語を問わずリズム、感情、話し方をより適切に捉え、その言語と文脈に自然になじむ音声をクリエイターが作れるようにします。たとえば、日本で初対面の高齢者に話しかける方法と、イタリアで話しかける方法はかなり異なります。
Eleven v4とEleven v4 Turboは、どちらも90以上の言語に対応しています。ある言語で収録された音声は、元のアイデンティティを保ちながらネイティブのアクセントを取り入れ、ほかのどの言語も流暢に話せるようになりました。アクセントへの忠実度は以前より明らかに向上しており、生成中に元のアクセントへ戻ってしまうことがなくなります。
カタルーニャ語
スペイン語
吹き替えやローカライズにおいては、起用する著名な俳優の声でも、企業のスタイルに最も合うトーンでも、選んだブランドの声がEleven v4対応のあらゆる言語で優れた音声として再現されることを意味します。
より自然で、一貫性のあるボイスクローン
Eleven v4とEleven v4 Turboでは、元の音声との話者類似性が大幅に向上し、より自然で高性能かつ一貫性のあるボイスクローンを実現します。Instant Voice Cloneは、わずか10秒のオーディオで高忠実度に音声を捉えられるようになりました。
実際の音声
Eleven v4
Eleven v4は、生成、対話、ナレーション、再生成されたセリフの間でも、話者のアイデンティティをより確実に維持します。つまり長編プロジェクトでも、キャラクター、ナレーター、クローン音声が制作全体を通じて一貫します。最高忠実度のクローン用途に向けて、Professional Voice Clone(PVC)にも対応しました。
長尺コンテンツ向けに生成を連鎖させるリクエストスティッチングも、Eleven v4では大幅に信頼性が向上しました。これにより、ElevenLabs StudioおよびElevenLabs Reader Appでの作業体験が改善されます。
違いをぜひ体験してください
Eleven v4とEleven v4 Turboは、表現力豊かな音声生成に関する最新研究の集大成です。オーディオブック、キャラクター演技、ボイスオーバー、吹き替え、会話型エージェントのローカライズなど、言葉そのものと同じくらい話し方が重要なコンテンツのために設計されています。
両モデルは現在、ElevenAgents、ElevenCreative、ElevenAPIで利用できます。無料アカウントを作成して、今すぐEleven v4またはEleven v4 Turboで生成を始めましょう。
- Artificial Analysis、Provider Voice Arena Leaderboard、2026年9月
- 2026年9月に、Cartesia Sonic 3.6、Inworld TTS-2、Google Gemini 3.8 Flash-Lite TTS、Google Gemini 3.8 Flash TTSを対象として実施した、ブラインド形式の一対一ユーザー選好テストに基づきます。各ペアでは、評価者がEleven v4と競合製品の同一セリフを、どちらのものか分からない状態で聞き、より表現力豊かな方とより自然に聞こえる方を判定しました。同点は0.5票として集計しています。
- リクエストから音声が聞こえるまでの時間の中央値。2026年9月に、同一スクリプトとデフォルト設定でCartesia Sonic 3.6、xAI TTS、Google Gemini Flash-Lite TTS、OpenAI GPT-4o mini TTSと比較して測定しました。すべてのシステムでネットワークレイテンシーを測定し、除外しています。Eleven v4 TurboはWebSocketストリーミングで測定。




