レイテンシーの最適化
レイテンシーの最適化
このガイドでは、アプリケーションのテキスト読み上げレイテンシーを削減する方法を説明します。
このガイドでは、テキスト読み上げのレイテンシーを改善するための基本原則を説明します。レイテンシーとは何か、何が影響するのかについては、レイテンシーを理解するをご覧ください。
個別の手法は数多くありますが、ここでは4つの原則に分けて紹介します。
4つの原則
エンタープライズのお客様は、より高い同時実行数の上限とレンダリングキューへの優先アクセスをご利用いただけます。エンタープライズ プランの詳細は、営業にお問い合わせください。
Flashモデルを使用する
Flashモデルは約75msの推論速度を実現しており、リアルタイムアプリケーションに最適です。その代わり、Multilingual v2と比較すると、オーディオ品質はわずかに低下します。
75msはモデルの推論時間のみを指します。実際のエンドツーエンドのレイテンシーは、 場所や使用するエンドポイントの種類などの要因によって変わります。
ストリーミングを活用する
APIリファレンスでは、3種類のテキスト読み上げエンドポイントを利用できます。
- 通常エンドポイント:完全なオーディオファイルを1回のレスポンスで返します。
- ストリーミングエンドポイント:Server-sent eventsを使用して、オーディオチャンクを段階的に返します。
- WebSocketエンドポイント:リアルタイムのオーディオ生成向けに双方向ストリーミングを有効にします。
ストリーミング
ストリーミングエンドポイントは、オーディオの生成と同時にリアルタイムで段階的に返すため、最初のバイトを受信するまでの時間を短縮します。このエンドポイントは、入力テキストを事前に用意できるケースに推奨されます。
WebSocket
テキスト読み上げWebSocketエンドポイントは双方向ストリーミングに対応しており、リアルタイムでテキスト入力が行われるアプリケーション(例:LLMの出力)に最適です。
auto_modeをtrueに設定すると、生成のトリガーが自動的に処理されるため、
チャンク戦略を手動で管理する必要がなくなります。
auto_modeが無効の場合、モデルはチャンクスケジュールに一致する十分なテキストが届くまで、オーディオ生成を開始しません。
たとえば、チャンクスケジュールを125文字に設定しても50文字しか届かない場合、追加の文字が届くまでモデルは待機します。その結果、レイテンシーが増加する可能性があります。
実装の詳細については、テキスト読み上げWebSocketガイドをご覧ください。
適切な音声を選ぶ
場合によっては、音声の選択がレイテンシーに影響することがあります。高速な順に並べると、以下のとおりです。
- デフォルト音声(旧Premade)、Synthetic音声、インスタントボイスクローン(IVC)
- プロフェッショナルボイスクローン(PVC)
高音質の出力形式では、レイテンシーが増加する場合があります。レイテンシー要件と必要なオーディオ忠実度のバランスを取ってください。
地理的な近接性を考慮する
地理的な場所に応じてレイテンシーを最適化するため、複数のリージョンからモデルを提供しています。
たとえば、FlashモデルをWebSocketで使用する場合、場所に応じて以下のTTFBレイテンシーが見込まれます。
APIレスポンスのx-regionヘッダーを確認すると、リクエストを処理しているバックエンドリージョンを確認できます。
現在使用しているリージョンは、米国、オランダ、シンガポールです。
エンタープライズのお客様は、サーバー所在地の保証と低レイテンシーを実現する専用のEUおよびインドのデータレジデンシー環境を ご利用いただけます。データレジデンシーインフラストラクチャの利用開始については、営業担当者にお問い合わせください。
グローバルルーティングを無効にして常に米国のサーバーを使用するには、APIリクエストのベースURLにapi.us.elevenlabs.ioを使用します。
以前は、api-global-preview.elevenlabs.ioをベースURLとして使用することで、グローバルサーバーをオプトインする必要がありました。
現在はこれがデフォルトの動作となっているため、不要です。代わりに単にapi.elevenlabs.ioを使用するよう、
アプリケーションを更新してください。