ElevenLabsドキュメント
ElevenLabsドキュメント
ElevenLabsを統合するためのドキュメントとガイドを見る
ElevenLabsの仕組み
ElevenLabsは、テキスト読み上げ、スピーチtoテキスト、ボイスクローン、会話型エージェント、生成オーディオのためのAI音声インフラを提供しています。用途や対象に応じて、4つの方法で利用できます。
**ElevenCreative**は、クリエイター、プロデューサー、編集者がブラウザ上でボイスオーバー、音楽、吹き替え、スタジオプロジェクトを直接生成できるノーコードWebアプリケーションです。
**ElevenAgents**は、会話型音声エージェントを設計・運用するためのプラットフォームです。非技術者向けのビジュアルビルダーと、デベロッパー向けの完全なプログラム制御を提供します。
**ElevenAPI**は、すべての機能を公式のPythonおよびTypeScript SDKを備えたRESTインターフェースとして提供します。デベロッパーは独自のアプリケーションやワークフローに音声を組み込めます。
**Reception AI**は、中小企業向けにすぐ導入できるAI電話受付です。電話応対、予約受付、日常業務の管理を1つのダッシュボードで行えます。
基本概念
音声は、オーディオ生成で使用する話者ペルソナです。各音声には、たとえばJBFqnCBsd6RMkjVDRZzbのような一意のIDがあり、ダッシュボードで選択するか、APIリクエストで指定します。ElevenLabsは10,000種類以上の音声ライブラリを提供しています。オーディオ録音から音声をクローンしたり、テキストの説明から生成したりすることもできます。
モデルは、生成されるオーディオの品質、レイテンシー、対応言語を制御します。eleven_v3は70以上の言語で最も表現力豊かな出力を生成します。eleven_flash_v2_5は、約75msのレイテンシーでリアルタイム用途に対応します。スピーチtoテキスト、音楽、サウンドエフェクトなどの各機能には、それぞれ専用モデルがあります。
クレジットは、すべてのプロダクトで共通して使用する消費単位です。テキスト読み上げでは、入力テキスト1文字につき1クレジットがかかります。その他の操作は、処理したオーディオの秒数に応じて課金されます。クレジットは毎月リセットされ、未使用分は最大2か月繰り越されます。詳細は料金をご覧ください。


