これまでで最も表現力豊かなモデル
v4 Turboのご紹介
感情やオーディオイベント、臨場感あふれるサウンドスケープを重ねた、コントロール可能で表現力豊かな音声を作成できます。
Eleven v4
最速かつ最も感情豊かな音声モデル
Eleven v4は、ボイスアクターのように台本を読むまったく新しいアーキテクチャで構築されています。誰が話しているか、直前に何が起きたか、各セリフをどう届けるべきかを理解します。

John - 司会、演劇調
Sia - 会話調、イギリス英語
John - 司会、演劇調
John - 司会、演劇調幅広い感情表現とサウンド
90以上の言語で、豊かな感情表現を備えた音声を生成。複数話者とサウンドエフェクトを組み合わせ、シーンを演出できます。

新しいアーキテクチャで構築
台本に演出指示を書く
[laughs]、[whispers]、[door slams]のような演出指示を台本に直接書き込めます。Eleven v4は、サウンドエフェクトを含むタグの連続にもv3より確実に従います。
長尺オーディオも自然につなぐ
コンテキスト接続により、どんな長さの台本でもペースと話し方を安定して保ちます。オーディオブック全編も、最初から最後まで一度に収録したように聞こえます。
声質を変えずに再生成
一行を1回でも50回でもやり直しても、同じ人物が話しているように聞こえます。対話、ナレーション、その間のあらゆる場面で話者の安定性を維持します。
プロフェッショナルボイスクローンを起用
プロフェッショナルボイスクローンはv3ではサポートされていませんでした。Eleven v4では再び利用でき、話せるすべての言語でモデル本来の豊かな感情表現を発揮します。
Eleven v4 Turbo
Eleven v4 Turboのご紹介リアルタイムとエージェント向け
Eleven v4の表現力を備えた最速のリアルタイム音声モデル。APIとElevenAgentsで利用できます。Eleven v4 Turboの推論レイテンシー中央値は約150msで、長時間の対話でも一貫性を保ちます。
通話者が気づかない応答速度
発話開始までの時間は中央値150msで、遅延を感じさせず、会話がスムーズに進みます。
実際の通話で聞く
Eleven v4 Turbo搭載エージェントとの会話で、その詳細をご確認ください。
ライブ会話に最適化
入力も出力もストリーミング
LLMがテキストを生成するそばから送信すると、文が終わる前にオーディオが返ってきます。エージェントループ向けに設計された双方向ストリーミングです。
会話スピードの表現力
TurboはEleven v4の表現力をすべて備えています。確認、エスカレーション、保留は同じ読み上げではなく、それぞれに合った話し方になります。
すべてのターンで同じ声
プロフェッショナルボイスクローンは両モデルで同じように機能するため、通話の最初から最後まで一貫したブランドボイスを保てます。
ネイティブのように話す
日本語、スペイン語、ポルトガル語のテキストを指定すれば、ネイティブのアクセントで流暢に話します。





17,500以上の音声から選択



17,500以上の音声から選択



決定論的な制御を通じてAgentforce Voiceの導入を拡大してきました。お客様から一貫して聞かれるのは、エージェントのあらゆる行動が即興ではなく、根拠に基づき統制されているから信頼できるということです。この戦略では、決定論と、高品質でEQの高い音声モデルのバランスが重要です。Eleven v4 Turboはまさにその水準を引き上げています。より高速で自然な応答により、お客様が期待する基準を満たし、Agentforce Voiceをさらに多くのユースケースへ展開できるようにしています。
数百社の出版社とともにジャーナリズムをオーディオ化するなかで、音声品質がいかに重要かを身をもって実感しています。ElevenLabsとの提携以来、多くの出版社でエンゲージメントと視聴時間が向上しました。Eleven v4により、出版社は音声を魅力的で親しみやすく、独自性のあるものにする方法をさらに広げられます。
ElevenLabs v4は、音声会話に新たなレベルの自然さをもたらします。音声はより表現豊かになっただけでなく、より細かく制御できるため、より豊かで没入感のある音声体験を作れます。
初めてEleven v4を使ったとき、あまりにクリアで生き生きとしていて、まるでブースでタレントと収録セッションをしているようでした。
品質を犠牲にせず、本物の会話のように感じられるほど高速な音声モデルを探していました。Eleven v4 Turboは、その両方を初めて実現したモデルです。自動化された営業ワークフローでは、開発が実験ではなくなる転換点です。
話す前に、声を選ぶひとこと話す前に
すべての生成は声から始まります。すでに持っている声をクローンする、説明文からデザインする、IPA対応で特定の単語の発音を修正する、といったことができます。


ボイスクローン
10秒のオーディオから音声をクローンすることも、ほぼ完璧に一致するプロフェッショナルボイスクローンをトレーニングすることもできます。
ボイスデザイン
録音セッションやオーディションなしで、1文で声を説明して生成できます。
発音辞書
名前、略語、技術用語の発音を定義します。一度音素を設定すれば、すべての生成で使用されます。
無料で作成を始めるさらに必要になったらアップグレード
APIで利用可能Eleven v4をアプリに導入
リアルタイム体験や音声エージェントにはEleven v4 Turboを。すべてElevenAPIで構築できます。
Eleven v4とEleven v4 Turbo APIにアクセス
REST API、ストリーミングエンドポイント、TypeScriptおよびPython SDKを使用して、あらゆるプロダクトに表現豊かな音声を追加できます。
- 単一のmodel_idでモデルを切り替え
- テキストをストリーミング入力し、オーディオをリアルタイムで受信
- 長尺の生成でも一貫性を維持


