设计音色。
设计音色。
通过提示词设计音色。此方法会返回音色预览列表。每个预览都包含 generated_voice_id,以及以 base64 编码的 mp3 音频形式提供的音色样本。要创建音色,请通过 /v1/text-to-voice 端点使用所选预览的 generated_voice_id。
请求头
查询参数
请求
用于创建音色的说明。
用于语音生成的模型。可选值:eleven_multilingual_ttv_v2、eleven_ttv_v3。
要生成的文本,长度必须在 100 到 1000 之间。
是否自动生成适合音色描述的文本。
控制生成语音的音量级别。-1 最安静,1 最响,0 大致对应 -24 LUFS。
控制语音生成的随机数。相同种子和相同输入会生成相同的语音。
决定响应中是否包含文本转语音预览。如果为 true,则仅返回生成的 ID,之后可通过 /v1/text-to-voice/:generated_voice_id/stream 端点进行流式传输。
是否使用 AI 增强声音描述,以补充更多细节并提升语音生成质量。启用后,系统会自动将简单提示词扩展为更详细的声音描述。默认为 False。
混音会话 ID。
这些生成内容要附加到的混音会话迭代 ID。未提供时,将创建新的迭代。
更高质量可带来更好的语音输出,但多样性较低。
用于语音生成的参考音频。音频应采用 base64 编码。仅使用 eleven_ttv_v3 模型时支持。
控制生成音频样本时提示词与参考音频的权重。0 表示提示词几乎没有影响,1 表示参考音频几乎没有影响。仅在使用 eleven_ttv_v3 模型时支持。
响应
成功响应
生成音色的预览。
用于预览音色的文本。