デモ
コード
古代のエルドリアの地、空が輝き、森が風に秘密をささやく場所に、ゼフィロスという名のドラゴンが住んでいました。[sarcastically] 「全部燃やし尽くす」タイプではなくて…[giggles] 彼は優しく、賢く、目はまるで古い星のようでした。[whispers] 彼が通ると鳥たちも静かになりました。
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio

v3 Conversational
リアルタイム音声に最も表現力を発揮するモデルです。
- 低レイテンシー(約280ms)
- 高品質で表現力豊かな話し方
- 70以上の言語に対応
- カスタムオーディオタグ
- 1分あたり約$0.05
本番環境対応の音声構築に必要なすべて
リアルタイム、長文、本番環境での利用を想定して設計されたモデルで、表現力豊かで制御可能な音声を生成できます。
感情と話し方を制御
感情、オーディオイベント、臨場感のあるサウンドスケープを重ねた、表現力豊かで制御可能な音声を作成できます。

11,000以上の音声にアクセス
あらゆるユースケースに対応する、表現力豊かで自然な音声のコレクションは増え続けています。

ボイスデザイン&ボイスクローン
自然な音声、表現力豊かなアクセント、対象ユーザーに合わせてローカライズされたオーディオを使い、30以上の言語で作成できます。

複数話者の会話
表現力豊かで制御可能な音声により、70以上の言語で自然な複数話者の会話を作成できます。

オーディオイベントと演出
音声に組み込まれたオーディオタグ、タイミングの指示、ナレーション演出で話し方を制御できます。

発音辞書
名前や専門用語を一貫して正確に読み上げるため、カスタムの発音を定義できます。

世界をリードする企業とブランドを支える
“ローカル言語でのReelsの吹き替えから、Horizonでの音楽やキャラクターボイスの生成まで、ElevenLabsプラットフォームは、世界中のクリエイター、企業、エンタープライズが音声、音楽、サウンドを大規模に活用した開発を可能にします。”
“毎日、何百万人もの人がYouTubeやTwitchで、Hikaru、Levy、Magnusのようなクリエイターからチェスを学んでいます。今ではChess.com内で、没入感があり、パーソナルで、個性豊かな形で彼らから学べます。私たちの使命は、適切なレベルで教え、あらゆるスキルレベルのプレイヤーを歓迎し、楽しさと個性を保ちながらチェスを身近なものにするチェスコーチを作ることです。ElevenLabsとこの素晴らしい新しい音声によって、そのビジョンを実現するための大きな一歩を踏み出しました。”
“ElevenLabsにより、強力なテキスト読み上げ機能をSDKへすばやく簡単に導入できました。これにより、エージェントはユーザーからの質問や、認識した内容へのフィードバックに対して、表現力豊かな音声でリアルタイムに応答できます。”

“TwilioはElevenLabsの生成AI音声技術をCPaaSに統合し、ConversationRelayを強化しました。このインテグレーションにより、企業やデベロッパーはTwilioのCPaaSプラットフォーム上で、人間らしく表現力豊かで、リアルタイムに応答する会話型AI音声インタラクションを直接作成できます。Twilioが、利用可能な中でも特に表現力豊かで人間らしい音声でConversationRelayを強化するためにElevenLabsを選んだことをうれしく思います。”
本番環境向けに構築されたAPI

データは転送中と保存時の両方で暗号化され、SOC2、HIPAA、GDPR準拠をサポートします。より厳格なデータ管理のために、EUデータレジデンシーとゼロリテンションモードも利用できます。
データは転送中と保存時の両方で暗号化され、SOC2、HIPAA、GDPR準拠をサポートします。より厳格なデータ管理のために、EUデータレジデンシーとゼロリテンションモードも利用できます。
型安全性、ストリーミング対応、わかりやすいサンプルを備えた公式PythonおよびTypeScript SDKです。
型安全性、ストリーミング対応、わかりやすいサンプルを備えた公式PythonおよびTypeScript SDKです。
スムーズな導入を支援し、安定したパフォーマンスと安心感を提供しながら、信頼性の高い運用を維持します。
スムーズな導入を支援し、安定したパフォーマンスと安心感を提供しながら、信頼性の高い運用を維持します。
よくある質問
- Flash v2.5:超低遅延(約75ms)で音声エージェントなどリアルタイム用途向け
- Turbo v2.5:品質と速度のバランス(約250~300ms)で対話型用途向け
- Multilingual v2:最大10,000文字の長文コンテンツに安定した品質
- Eleven v3:クリエイティブ用途向けに最大限の表現力と感情幅
Flash v2.5は約75msの遅延です。
Turbo v2.5は通常250~300msで応答します。
どちらもストリーミング出力に対応しており、生成が完了する前に再生を開始できます。
Eleven v3は70以上の言語に対応しています。
Flash v2.5とTurbo v2.5は32言語に対応しています。
Multilingual v2は29言語に対応しています。
Flash v2.5・Turbo v2.5:40,000文字
Multilingual v2:10,000文字
Eleven v3:3,000文字
オーディオタグ([laughs]、[whispers]、[sighs]、[door slam]など)で話し方や感情、強調、間、効果音をコントロールできます。Eleven v3が最も表現力豊かなコントロールを提供します。
ボイスライブラリには10,000以上の音声が含まれています。テキストプロンプトを使って音声をクローンしたり、カスタム音声をデザインすることも可能です。
はい。ストリーミングを使えば、音声の生成が完了する前に再生を開始でき、リアルタイム用途で体感遅延を減らせます。
はい。ライブラリ内の任意の音声IDを指定して利用できます。プロフェッショナルボイスクローンやインスタントボイスクローン、ご自身でデザインした音声も利用可能です。
APIはデフォルトでMP3を出力します。その他、PCMやμ-law形式にも対応しています。
ストリーミング対応のFlash v2.5を使用し、リクエストは1,000文字未満に抑えてください。リアルタイム用途ではWebSocket接続を有効にすると効果的です。
はい。発音記号や発音辞書を使って、特定の単語の読み方をコントロールできます。
Python、JavaScript/TypeScript用の公式SDKがあります。HTTP APIも利用可能です。
APIリファレンスやコード例、連携ガイドはelevenlabs.io/docs/api-referenceでご覧いただけます。
はい。エンタープライズプランにはSOC2準拠、HIPAA対応、GDPR対応、EUデータレジデンシー、ゼロリテンションモード、専用サポート、カスタムSLAが含まれます。



