テキスト読み上げとテキストtoダイアログのWebSocketの比較
テキスト読み上げとテキストtoダイアログのWebSocketの比較
このガイドでは、ストリーミング音声に適したWebSocketの選び方と、2つのプロトコルの違いを説明します。
ElevenLabsでは、合成音声をストリーミングするための2種類のWebSocketプロダクトを提供しています。それぞれ解決する課題、受け付けるメッセージ形式、対象モデルが異なります。
どのWebSocketを使うべきですか?
接続ごとに1つの音声(音声はURLで固定)でプレーンテキストをストリーミングし、FlashやMultilingual v2などのv3以外のモデル、任意のSSML、チャンクスケジュール、またはエージェント型の割り込み処理向けのマルチコンテキストバリアントを使いたい場合は、テキスト読み上げ(TTS)WebSocketを使用してください。
表現力豊かな出力、チャンクごとの**voice_id**、ターン境界(new_turn)、サーバー上のv3で使われるのと同じ対話向けバッファリングなど、Eleven v3の対話機能が必要な場合は、テキストtoダイアログ(TTD)WebSocketを使用してください。
バッチまたはHTTPストリーミングによる対話(1回の呼び出しでリクエスト全体を送信)には、WebSocketではなくダイアログを作成またはダイアログをストリーミングを使用してください。
比較
TTS WebSocketが適している場合
- レイテンシーまたは対応言語のために、すでにFlashまたはMultilingual v2を統合している。
- 接続ごとに1つのナレーター音声を使用し、フレームごとにテキストを送るシンプルなプロトコルが必要。
- 割り込みや並列発話のためにマルチコンテキストオーケストレーションが必要(マルチコンテキストガイド)。
TTS WebSocketの詳細な手順は、リアルタイムでオーディオを生成を参照してください。
TTD WebSocketが適している場合
- Eleven v3の対話(表現タグ、会話的なテンポ、複数話者のセリフ)を対象にしている。
- 新しい接続を開かずに、話す音声を行ごとに変更できる、スクリプト化またはLLM生成の対話をストリーミングする。
- サーバー上でv3専用の対話生成を行い、WebSocket形式で入力を段階的に送信したい。
実践的な手順については、リアルタイムテキストtoダイアログを参照してください。プロトコルの詳細はAPIリファレンスに記載されています。