设计音色。

通过提示词设计音色。此方法会返回音色预览列表。每个预览都包含 generated_voice_id,以及以 base64 编码的 mp3 音频形式提供的音色样本。要创建音色,请通过 /v1/text-to-voice 端点使用所选预览的 generated_voice_id。

请求头

xi-api-keystring可选

查询参数

output_formatenum可选
生成音频的输出格式。格式为 codec_sample_rate_bitrate。因此,采样率为 22.05kHz、比特率为 32kbs 的 mp3 表示为 mp3_22050_32。使用 192kbps 比特率的 MP3 需要订阅 Creator 或更高版本。采样率为 44.1kHz 的 PCM 格式需要订阅 Pro 或更高版本。请注意,μ-law 格式(有时写作 mu-law,通常近似写作 u-law)常用于 Twilio 音频输入。

请求

This endpoint expects an object.
voice_descriptionstring必需20-1000 characters

用于创建音色的说明。

model_idenum可选默认为 eleven_multilingual_ttv_v2

用于语音生成的模型。可选值:eleven_multilingual_ttv_v2、eleven_ttv_v3。

允许的值:
textstring or null可选100-1000 characters

要生成的文本,长度必须在 100 到 1000 之间。

auto_generate_textboolean可选默认为 false

是否自动生成适合音色描述的文本。

loudnessdouble可选-1-1默认为 0.5

控制生成语音的音量级别。-1 最安静,1 最响,0 大致对应 -24 LUFS。

seedinteger or null可选0-2147483647

控制语音生成的随机数。相同种子和相同输入会生成相同的语音。

guidance_scaledouble可选0-100默认为 5
Controls how closely the AI follows the prompt. Lower numbers give the AI more freedom to be creative, while higher numbers force it to stick more to the prompt. High numbers can cause voice to sound artificial or robotic. We recommend to use longer, more detailed prompts at lower Guidance Scale.
stream_previewsboolean可选默认为 false

决定响应中是否包含文本转语音预览。如果为 true,则仅返回生成的 ID,之后可通过 /v1/text-to-voice/:generated_voice_id/stream 端点进行流式传输。

should_enhanceboolean可选默认为 false

是否使用 AI 增强声音描述,以补充更多细节并提升语音生成质量。启用后,系统会自动将简单提示词扩展为更详细的声音描述。默认为 False。

remixing_session_idstring or null可选

混音会话 ID。

remixing_session_iteration_idstring or null可选

这些生成内容要附加到的混音会话迭代 ID。未提供时,将创建新的迭代。

qualitydouble or null可选-1-1

更高质量可带来更好的语音输出,但多样性较低。

reference_audio_base64string or null可选

用于语音生成的参考音频。音频应采用 base64 编码。仅使用 eleven_ttv_v3 模型时支持。

prompt_strengthdouble or null可选0-1

控制生成音频样本时提示词与参考音频的权重。0 表示提示词几乎没有影响,1 表示参考音频几乎没有影响。仅在使用 eleven_ttv_v3 模型时支持。

响应

成功响应

previewslist of objects

生成音色的预览。

textstring

用于预览音色的文本。

错误

409
Conflict Error
422
Unprocessable Entity Error