创建带时间戳的语音

根据文本生成语音,并提供精确的字符级时间信息以实现音文同步。

路径参数

voice_idstring必需
要使用的音色 ID。可通过 https://api.elevenlabs.io/v1/voices 列出所有可用音色。

请求头

xi-api-keystring可选

查询参数

enable_loggingboolean可选默认为 true

当 enable_logging 设为 false 时,此请求将使用零留存模式。这意味着该请求无法使用历史记录功能,包括请求拼接。零留存模式仅限企业版客户使用。

optimize_streaming_latencyinteger or null可选Deprecated
可启用延迟优化,但会牺牲部分质量。可达到的最低最终延迟因模型而异。可选值: 0 - 默认模式(不进行延迟优化) 1 - 常规延迟优化(约为选项 3 可实现延迟改善的 50%) 2 - 强延迟优化(约为选项 3 可实现延迟改善的 75%) 3 - 最大延迟优化 4 - 最大延迟优化,同时关闭文本规范化以进一步降低延迟(延迟最低,但可能会错误朗读数字、日期等)。 默认值为 None。
output_formatenum可选默认为 mp3_44100_128
生成音频的输出格式。格式为 codec_sample_rate_bitrate。因此,采样率为 22.05kHz、比特率为 32kbs 的 mp3 表示为 mp3_22050_32。使用 192kbps 比特率的 MP3 需要订阅 Creator 或更高版本。采样率为 44.1kHz 的 PCM 和 WAV 格式需要订阅 Pro 或更高版本。请注意,μ-law 格式(有时写作 mu-law,通常近似写作 u-law)常用于 Twilio 音频输入。

请求

This endpoint expects an object.
textstring必需

将转换为语音的文本。

model_idstring可选默认为 eleven_multilingual_v2

要使用的模型标识符,可通过 GET /v1/models 查询。模型必须支持文本转语音,可通过 can_do_text_to_speech 属性确认。

language_codestring or null可选

用于为模型和文本规范化强制指定语言的语言代码(ISO 639-1)。如果模型不支持提供的语言代码,将忽略该代码。multilingual_v2 模型不支持此参数。

voice_settingsobject or null可选

覆盖指定音色已存储设置的音色设置,仅应用于当前请求。

pronunciation_dictionary_locatorslist of objects可选

要应用于文本的发音词典定位符(id、version_id)列表。将按顺序应用。每次请求最多可包含 3 个定位符。

seedinteger or null可选

指定后,系统会尽力进行确定性采样,使使用相同种子和参数的重复请求返回相同结果。但不保证完全确定。必须是介于 0 和 4294967295 之间的整数。

previous_textstring or null可选

当前请求文本之前的文本。可用于提升拼接多个生成结果时的语音连贯性,或影响当前生成的语音连贯性。

next_textstring or null可选

当前请求文本之后的文本。可用于提升拼接多个生成结果时的语音连贯性,或影响当前生成的语音连贯性。

previous_request_idslist of strings可选

本次生成之前样本的 request_id 列表。将大型任务拆分为多个请求时,可用于提升语音连贯性。所有生成使用同一模型时效果最佳。如果同时发送 previous_text 和 previous_request_ids,将忽略 previous_text。最多可发送 3 个 request_ids。

next_request_idslist of strings可选

本次生成后续样本的 request_id 列表。重新生成存在音频质量问题的样本时,next_request_ids 对保持语音连贯性尤其有用。例如,已生成 3 个语音片段且想改善第 2 段时,将第 3 段的请求 ID 作为 next_request_id(第 1 段的请求 ID 作为 previous_request_id)传入,有助于保持合并后语音的自然流畅。所有生成使用同一模型时效果最佳。如果同时发送 next_text 和 next_request_ids,将忽略 next_text。最多可发送 3 个 request_ids。

use_pvc_as_ivcboolean可选默认为 false

是否使用专业音色的 IVC 版本。这可能提升表现力并降低延迟。

apply_text_normalizationenum可选默认为 auto

此参数通过 3 种模式控制文本规范化:‘auto’、‘on’ 和 ‘off’。设为 ‘auto’ 时,系统会自动决定是否应用文本规范化(如将数字读出)。设为 ‘on’ 时始终应用;设为 ‘off’ 时跳过。

允许的值:
apply_language_text_normalizationboolean可选默认为 false

此参数控制语言文本规范化,有助于部分支持语言中的文本正确发音。警告:此参数可能大幅增加请求延迟。目前仅支持日语。

响应

成功响应

audio_base64string
Base64 encoded audio data
alignmentobject or null可选

原始文本中每个字符的时间戳信息。

normalized_alignmentobject or null可选

规范化文本中每个字符的时间戳信息。

错误

422
Unprocessable Entity Error