重混音色。

通过提示词混音现有音色。此方法会返回音色预览列表。每个预览都包含 generated_voice_id 和一段采用 base64 编码的 mp3 音频音色样本。要创建音色,请在 /v1/text-to-voice 端点中使用首选预览的 generated_voice_id。

路径参数

voice_idstring必需
要使用的音色 ID。可通过 https://api.elevenlabs.io/v1/voices 列出所有可用音色。

请求头

xi-api-keystring可选

查询参数

output_formatenum可选
生成音频的输出格式。格式为 codec_sample_rate_bitrate。因此,采样率为 22.05kHz、比特率为 32kbs 的 mp3 表示为 mp3_22050_32。使用 192kbps 比特率的 MP3 需要订阅 Creator 或更高版本。采样率为 44.1kHz 的 PCM 格式需要订阅 Pro 或更高版本。请注意,μ-law 格式(有时写作 mu-law,通常近似写作 u-law)常用于 Twilio 音频输入。

请求

This endpoint expects an object.
voice_descriptionstring必需5-1000 characters

对音色进行更改的说明。

textstring or null可选100-1000 characters

要生成的文本,长度必须在 100 到 1000 之间。

auto_generate_textboolean可选默认为 false

是否自动生成适合音色描述的文本。

loudnessdouble可选-1-1默认为 0.5

控制生成语音的音量级别。-1 最安静,1 最响,0 大致对应 -24 LUFS。

seedinteger or null可选0-2147483647

控制语音生成的随机数。相同种子和相同输入会生成相同的语音。

guidance_scaledouble可选0-100默认为 2
Controls how closely the AI follows the prompt. Lower numbers give the AI more freedom to be creative, while higher numbers force it to stick more to the prompt. High numbers can cause voice to sound artificial or robotic. We recommend to use longer, more detailed prompts at lower Guidance Scale.
stream_previewsboolean可选默认为 false

决定响应中是否包含文本转语音预览。如果为 true,则仅返回生成的 ID,之后可通过 /v1/text-to-voice/:generated_voice_id/stream 端点进行流式传输。

remixing_session_idstring or null可选

混音会话 ID。

remixing_session_iteration_idstring or null可选

这些生成内容要附加到的混音会话迭代 ID。未提供时,将创建新的迭代。

prompt_strengthdouble or null可选0-1

控制生成音频样本时提示词与参考音频的权重。0 表示提示词几乎没有影响,1 表示参考音频几乎没有影响。仅在使用 eleven_ttv_v3 模型时支持。

响应

成功响应

previewslist of objects

生成音色的预览。

textstring

用于预览音色的文本。

错误

409
Conflict Error
422
Unprocessable Entity Error