音声をリミックス。

プロンプトを使用して既存の音声をリミックスします。このメソッドは音声プレビューのリストを返します。各プレビューにはgenerated_voice_idと、base64エンコードされたmp3オーディオ形式の音声サンプルが含まれます。音声を作成するには、好みのプレビューのgenerated_voice_idを/v1/text-to-voiceエンドポイントで使用してください。

パスパラメータ

voice_idstring必須
使用する音声IDです。https://api.elevenlabs.io/v1/voices を使用すると、利用可能なすべての音声を一覧表示できます。

ヘッダー

xi-api-keystringオプション

クエリパラメータ

output_formatenumオプション
生成されたオーディオの出力形式。codec_sample_rate_bitrate形式で指定します。たとえば、サンプルレート22.05kHz、32kbpsのmp3はmp3_22050_32で表します。ビットレート192kbpsのMP3を使用するには、クリエイター以上への加入が必要です。サンプルレート44.1kHzのPCM形式を使用するには、プロ以上への加入が必要です。μ-law形式(mu-lawとも表記され、u-lawと近似表記されることもあります)は、Twilioのオーディオ入力で一般的に使用されます。

リクエスト

This endpoint expects an object.
voice_descriptionstring必須5-1000 characters

音声に加える変更の説明。

textstring or nullオプション100-1000 characters

生成するテキスト。テキストの長さは100~1000文字である必要があります。

auto_generate_textbooleanオプションデフォルト値 false

音声説明に適したテキストを自動生成するかどうか。

loudnessdoubleオプション-1-1デフォルト値 0.5

生成される音声の音量レベルを制御します。-1が最も小さく、1が最も大きく、0はおよそ-24 LUFSに相当します。

seedinteger or nullオプション0-2147483647

音声生成を制御する乱数。同じ入力で同じシードを使用すると、同じ音声が生成されます。

guidance_scaledoubleオプション0-100デフォルト値 2

AIがプロンプトにどの程度厳密に従うかを制御します。値が低いほどAIはより自由に創造性を発揮でき、値が高いほどプロンプトに厳密に従います。値が高いと、音声が不自然またはロボットのように聞こえることがあります。Guidance Scaleが低い場合は、より長く詳細なプロンプトを使用することをおすすめします。

stream_previewsbooleanオプションデフォルト値 false

レスポンスにText to Voiceのプレビューを含めるかどうかを決定します。trueの場合、生成されたIDのみが返され、/v1/text-to-voice/:generated_voice_id/streamエンドポイントでストリーミングできます。

remixing_session_idstring or nullオプション

リミックスセッションID。

remixing_session_iteration_idstring or nullオプション

これらの生成結果を紐付けるリミックスセッションのイテレーションID。指定しない場合、新しいイテレーションが作成されます。

prompt_strengthdouble or nullオプション0-1

音声サンプル生成時のプロンプトと参照オーディオのバランスを制御します。0はプロンプトの影響がほとんどないことを、1は参照オーディオの影響がほとんどないことを意味します。eleven_ttv_v3モデル使用時のみサポートされます。

レスポンス

成功レスポンス。

previewslist of objects

生成された音声のプレビュー。

textstring

音声のプレビューに使用するテキストです。

エラー

409
Conflict Error
422
Unprocessable Entity Error