变声器流式传输

将音频从一种音色流式转换为另一种音色。完全控制情感、时机和表达方式。

路径参数

voice_idstring必需

要使用的音色 ID。使用 获取音色 端点列出所有可用音色。

请求头

xi-api-keystring可选

查询参数

enable_loggingboolean可选默认为 true

当 enable_logging 设为 false 时,此请求将使用零留存模式。这意味着该请求无法使用历史记录功能,包括请求拼接。零留存模式仅限企业版客户使用。

optimize_streaming_latencyinteger or null可选Deprecated
可启用延迟优化,但会牺牲部分质量。可达到的最低最终延迟因模型而异。可选值: 0 - 默认模式(不进行延迟优化) 1 - 常规延迟优化(约为选项 3 可实现延迟改善的 50%) 2 - 强延迟优化(约为选项 3 可实现延迟改善的 75%) 3 - 最大延迟优化 4 - 最大延迟优化,同时关闭文本规范化以进一步降低延迟(延迟最低,但可能会错误朗读数字、日期等)。 默认值为 None。
output_formatenum可选默认为 mp3_44100_128
生成音频的输出格式。格式为 codec_sample_rate_bitrate。因此,采样率为 22.05kHz、比特率为 32kbs 的 mp3 表示为 mp3_22050_32。使用 192kbps 比特率的 MP3 需要订阅 Creator 或更高版本。采样率为 44.1kHz 的 PCM 格式需要订阅 Pro 或更高版本。请注意,μ-law 格式(有时写作 mu-law,通常近似写作 u-law)常用于 Twilio 音频输入。

请求

This endpoint expects a multipart form containing a file.
audiofile必需

包含内容和情绪、用于控制生成语音的音频文件。

model_idstring可选默认为 eleven_english_sts_v2

要使用的模型标识符,可通过 GET /v1/models 查询。模型必须支持语音转语音,可通过 can_do_voice_conversion 属性确认。

voice_settingsstring or null可选

覆盖指定音色已存储设置的音色设置,仅应用于当前请求。需以 JSON 编码字符串发送。

seedinteger or null可选

指定后,系统会尽力进行确定性采样,使使用相同种子和参数的重复请求返回相同结果。但不保证完全确定。必须是介于 0 和 4294967295 之间的整数。

remove_background_noiseboolean可选默认为 false

设定后,将使用我们的人声分离模型去除音频输入中的背景噪音。仅适用于变声器。

file_formatenum or null可选默认为 other

输入音频的格式。可选值为 ‘pcm_s16le_16’ 或 ‘other’。对于 pcm_s16le_16,输入音频必须是采样率为 16kHz、单声道、采用小端字节序的 16 位 PCM。延迟将低于传入编码波形。

允许的值:

响应

流式音频数据

错误

422
Unprocessable Entity Error