ボイスチェンジャーのストリーミング

ある音声から別の音声へオーディオをストリーミングします。感情、タイミング、話し方を完全にコントロールできます。

パスパラメータ

voice_idstring必須

使用する音声のID。利用可能なすべての音声は、音声を取得エンドポイントで一覧表示できます。

ヘッダー

xi-api-keystringオプション

クエリパラメータ

enable_loggingbooleanオプションデフォルト値 true
enable_loggingがfalseに設定されている場合、このリクエストにはゼロ保持モードが使用されます。この場合、リクエスト結合を含む履歴機能はこのリクエストでは利用できません。ゼロ保持モードを使用できるのはエンタープライズのお客様のみです。
optimize_streaming_latencyinteger or nullオプションDeprecated
品質を多少犠牲にして、レイテンシー最適化を有効にできます。達成可能な最終レイテンシーはモデルによって異なります。指定可能な値: 0 - デフォルトモード(レイテンシー最適化なし) 1 - 通常のレイテンシー最適化(オプション3で可能なレイテンシー改善量の約50%) 2 - 強力なレイテンシー最適化(オプション3で可能なレイテンシー改善量の約75%) 3 - 最大レイテンシー最適化 4 - 最大レイテンシー最適化に加え、さらなるレイテンシー削減のためテキストノーマライザーも無効化(最良のレイテンシーですが、数字や日付などを誤って発音する可能性があります)。 デフォルトはNoneです。
output_formatenumオプションデフォルト値 mp3_44100_128
生成されたオーディオの出力形式。codec_sample_rate_bitrate形式で指定します。たとえば、サンプルレート22.05kHz、32kbpsのmp3はmp3_22050_32で表します。ビットレート192kbpsのMP3を使用するには、クリエイター以上への加入が必要です。サンプルレート44.1kHzのPCM形式を使用するには、プロ以上への加入が必要です。μ-law形式(mu-lawとも表記され、u-lawと近似表記されることもあります)は、Twilioのオーディオ入力で一般的に使用されます。

リクエスト

This endpoint expects a multipart form containing a file.
audiofile必須

生成される音声を制御するコンテンツと感情を含むオーディオファイル。

model_idstringオプションデフォルト値 eleven_english_sts_v2

使用するモデルの識別子。GET /v1/modelsで照会できます。モデルはスピーチtoスピーチをサポートしている必要があり、can_do_voice_conversionプロパティで確認できます。

voice_settingsstring or nullオプション

指定した音声について、保存済みの設定をオーバーライドする音声設定。指定したリクエストにのみ適用されます。JSONエンコード文字列として送信する必要があります。

seedinteger or nullオプション

指定すると、同じシードとパラメータでリクエストを繰り返した場合に同じ結果が返るよう、システムは決定論的サンプリングを最大限試みます。決定性は保証されません。0から4294967295までの整数である必要があります。

remove_background_noisebooleanオプションデフォルト値 false

設定すると、オーディオアイソレーションモデルを使用してオーディオ入力からバックグラウンドノイズを除去します。ボイスチェンジャーにのみ適用されます。

file_formatenum or nullオプションデフォルト値 other
入力オーディオの形式。'pcm_s16le_16'または'other'を指定できます。`pcm_s16le_16`の場合、入力オーディオは16kHzサンプルレート、シングルチャンネル(モノラル)、リトルエンディアンの16ビットPCMである必要があります。エンコード済み波形を渡す場合よりレイテンシーが低くなります。
許可された値:

レスポンス

ストリーミングオーディオデータ。

エラー

422
Unprocessable Entity Error