创建带时间戳的语音
创建带时间戳的语音
根据文本生成语音,并提供精确的字符级时间信息以实现音文同步。
路径参数
请求头
查询参数
当 enable_logging 设为 false 时,此请求将使用零留存模式。这意味着该请求无法使用历史记录功能,包括请求拼接。零留存模式仅限企业版客户使用。
请求
将转换为语音的文本。
要使用的模型标识符,可通过 GET /v1/models 查询。模型必须支持文本转语音,可通过 can_do_text_to_speech 属性确认。
用于为模型和文本规范化强制指定语言的语言代码(ISO 639-1)。如果模型不支持提供的语言代码,将忽略该代码。multilingual_v2 模型不支持此参数。
覆盖指定音色已存储设置的音色设置,仅应用于当前请求。
要应用于文本的发音词典定位符(id、version_id)列表。将按顺序应用。每次请求最多可包含 3 个定位符。
指定后,系统会尽力进行确定性采样,使使用相同种子和参数的重复请求返回相同结果。但不保证完全确定。必须是介于 0 和 4294967295 之间的整数。
当前请求文本之前的文本。可用于提升拼接多个生成结果时的语音连贯性,或影响当前生成的语音连贯性。
当前请求文本之后的文本。可用于提升拼接多个生成结果时的语音连贯性,或影响当前生成的语音连贯性。
本次生成之前样本的 request_id 列表。将大型任务拆分为多个请求时,可用于提升语音连贯性。所有生成使用同一模型时效果最佳。如果同时发送 previous_text 和 previous_request_ids,将忽略 previous_text。最多可发送 3 个 request_ids。
本次生成后续样本的 request_id 列表。重新生成存在音频质量问题的样本时,next_request_ids 对保持语音连贯性尤其有用。例如,已生成 3 个语音片段且想改善第 2 段时,将第 3 段的请求 ID 作为 next_request_id(第 1 段的请求 ID 作为 previous_request_id)传入,有助于保持合并后语音的自然流畅。所有生成使用同一模型时效果最佳。如果同时发送 next_text 和 next_request_ids,将忽略 next_text。最多可发送 3 个 request_ids。
是否使用专业音色的 IVC 版本。这可能提升表现力并降低延迟。
此参数通过 3 种模式控制文本规范化:‘auto’、‘on’ 和 ‘off’。设为 ‘auto’ 时,系统会自动决定是否应用文本规范化(如将数字读出)。设为 ‘on’ 时始终应用;设为 ‘off’ 时跳过。
此参数控制语言文本规范化,有助于部分支持语言中的文本正确发音。警告:此参数可能大幅增加请求延迟。目前仅支持日语。
响应
成功响应
原始文本中每个字符的时间戳信息。
规范化文本中每个字符的时间戳信息。