タイミング情報付きで音声をストリーミング
タイミング情報付きで音声をストリーミング
選択した音声を使用してテキストを音声に変換し、base64エンコードされた文字列形式のオーディオと、どの文字がいつ発話されたかの情報を含むJSONのストリームを返します。
パスパラメータ
使用する音声のID。利用可能なすべての音声は、音声を取得エンドポイントで一覧表示できます。
ヘッダー
クエリパラメータ
リクエスト
音声に変換するテキストです。
使用するモデルの識別子。GET /v1/modelsで照会できます。モデルはテキスト読み上げをサポートしている必要があり、can_do_text_to_speechプロパティで確認できます。
モデルと言語正規化に適用する言語コード(ISO 639-1)です。モデルが指定された言語コードをサポートしていない場合は無視されます。このパラメータはmultilingual_v2モデルではサポートされません。
指定した音声について、保存済みの設定をオーバーライドする音声設定。指定したリクエストにのみ適用されます。
テキストに適用する発音辞書ロケーター(id、version_id)の一覧です。指定した順序で適用されます。1リクエストにつき最大3つのロケーターを指定できます。
指定すると、同じシードとパラメータでリクエストを繰り返した場合に同じ結果が返るよう、システムは決定論的サンプリングを最大限試みます。決定性は保証されません。0から4294967295までの整数である必要があります。
現在のリクエストのテキストより前にあるテキスト。複数の生成結果を連結する際の音声の連続性を改善したり、現在の生成における音声の連続性に影響を与えたりするために使用できます。
現在のリクエストのテキストより後にあるテキスト。複数の生成結果を連結する際の音声の連続性を改善したり、現在の生成における音声の連続性に影響を与えたりするために使用できます。
この生成より前に生成されたサンプルのrequest_idのリストです。大きなタスクを複数のリクエストに分割する際に、音声の連続性を向上させるために使用できます。すべての生成で同じモデルを使用すると、より良い結果が得られます。previous_textとprevious_request_idsの両方が送信された場合、previous_textは無視されます。送信できるrequest_idsは最大3件です。
この生成の後に続くサンプルのrequest_idのリストです。next_request_idsは、音声品質に問題があるサンプルを再生成する際に、音声の連続性を維持するのに特に役立ちます。たとえば、3つの音声クリップを生成し、クリップ2を改善したい場合、クリップ3のリクエストIDをnext_request_idとして(クリップ1のIDをprevious_request_idとして)渡すことで、結合後の音声でも自然な流れを維持できます。すべての生成で同じモデルを使用すると、より良い結果が得られます。next_textとnext_request_idsの両方が送信された場合、next_textは無視されます。送信できるrequest_idsは最大3件です。
このパラメーターは、‘auto’、‘on’、‘off’の3つのモードでテキスト正規化を制御します。‘auto’に設定すると、システムがテキスト正規化(例:数値の読み上げ)を適用するかどうかを自動的に判断します。‘on’では常にテキスト正規化が適用され、‘off’ではスキップされます。
このパラメーターは言語テキストの正規化を制御します。一部の対応言語でテキストを適切に発音するのに役立ちます。警告:このパラメーターはリクエストのレイテンシーを大幅に増加させる可能性があります。現在は日本語でのみ対応しています。
レスポンス
文字起こしチャンクのストリーム。
Base64エンコードされたオーディオデータ
元のテキストの各文字のタイムスタンプ情報
正規化されたテキストの各文字のタイムスタンプ情報