タイムスタンプ付きテキストtoダイアログ
タイムスタンプ付きテキストtoダイアログ
オーディオとテキストの同期に使用する正確な文字レベルのタイミング情報とともに、テキストから会話を生成します。
ヘッダー
クエリパラメータ
リクエスト
テキストと、音声に変換する音声IDをそれぞれ含む対話入力のリストです。一意の音声IDは最大10件です。安定して生成するため、すべてのinputs[].text値の合計文字数は、リクエストあたり2,000文字以下にしてください。より長いリクエストでは、ストリーミングレスポンスが早期に終了するか、バリデーションエラーが返される場合があります。
使用するモデルの識別子。GET /v1/modelsで照会できます。モデルはテキスト読み上げをサポートしている必要があり、can_do_text_to_speechプロパティで確認できます。
モデルと言語正規化に適用する言語コード(ISO 639-1)です。モデルが指定された言語コードをサポートしていない場合は無視されます。このパラメータはmultilingual_v2モデルではサポートされません。
対話生成を制御する設定です。
テキストに適用する発音辞書ロケーター(id、version_id)の一覧です。指定した順序で適用されます。1リクエストにつき最大3つのロケーターを指定できます。
指定すると、同じシードとパラメータでリクエストを繰り返した場合に同じ結果が返るよう、システムは決定論的サンプリングを最大限試みます。決定性は保証されません。0から4294967295までの整数である必要があります。
このパラメーターは、‘auto’、‘on’、‘off’の3つのモードでテキスト正規化を制御します。‘auto’に設定すると、システムがテキスト正規化(例:数値の読み上げ)を適用するかどうかを自動的に判断します。‘on’では常にテキスト正規化が適用され、‘off’ではスキップされます。
この生成より前に行われた対話生成のrequest_idsのリストです。大きなタスクを複数のリクエストに分割する際、連続性を保つためにモデルを条件付ける用途で使用します。送信できるrequest_idsは最大3件です。最後のrequest_idは、現在のリクエストに最も近い音声です。すべてのモデルでサポートされているわけではありません。
この生成の後に行われる対話生成のrequest_idsのリストです。シーケンスの途中にあるクリップを再生成する際に、連続性を維持するのに役立ちます。送信できるrequest_idsは最大3件です。最初のrequest_idは、現在のリクエストに最も近い音声です。すべてのモデルでサポートされているわけではありません。
この生成の直前にあるテキスト。韻律の連続性を保つためにモデルを条件付けるために使用します。最大100文字を送信できます。すべてのモデルでサポートされているわけではありません。
この生成の直後に続くテキスト。韻律の連続性を保つためにモデルを条件付けるために使用します。最大100文字を送信できます。すべてのモデルでサポートされているわけではありません。
レスポンス
成功レスポンス。
Base64エンコードされたオーディオデータ
オーディオの音声セグメント
元のテキストの各文字のタイムスタンプ情報
正規化されたテキストの各文字のタイムスタンプ情報