带时间戳的文本转对话
带时间戳的文本转对话
根据文本生成对话,并提供精确的字符级时间信息以实现音文同步。
请求头
查询参数
当 enable_logging 设为 false 时,此请求将使用零留存模式。这意味着该请求无法使用历史记录功能,包括请求拼接。零留存模式仅限企业版客户使用。
请求
对话输入列表,每项包含将转换为语音的文本和音色 ID。唯一音色 ID 最多为 10 个。为确保生成稳定,每次请求中所有 inputs[].text 值的总字符数应不超过 2,000 个字符。较长的请求可能在流式响应中提前终止,或返回验证错误。
要使用的模型标识符,可通过 GET /v1/models 查询。模型必须支持文本转语音,可通过 can_do_text_to_speech 属性确认。
用于为模型和文本规范化强制指定语言的语言代码(ISO 639-1)。如果模型不支持提供的语言代码,将忽略该代码。multilingual_v2 模型不支持此参数。
控制对话生成的设置。
要应用于文本的发音词典定位符(id、version_id)列表。将按顺序应用。每次请求最多可包含 3 个定位符。
指定后,系统会尽力进行确定性采样,使使用相同种子和参数的重复请求返回相同结果。但不保证完全确定。必须是介于 0 和 4294967295 之间的整数。
此参数通过 3 种模式控制文本规范化:‘auto’、‘on’ 和 ‘off’。设为 ‘auto’ 时,系统会自动决定是否应用文本规范化(如将数字读出)。设为 ‘on’ 时始终应用;设为 ‘off’ 时跳过。
是否使用专业音色的 IVC 版本。这可能提升表现力并降低延迟。
本次对话生成之前的 request_ids 列表。将大型任务拆分为多个请求时,用于让模型保持连贯性。最多可发送 3 个 request_ids。最后一个 request_id 对应的音频最接近当前请求。并非所有模型都支持此功能。
本次对话生成之后的 request_ids 列表。重新生成序列中间的片段时,可用于保持连贯性。最多可发送 3 个 request_ids。第一个 request_id 对应的音频最接近当前请求。并非所有模型都支持此功能。
紧接在此次生成之前的文本,用于让模型保持韵律连贯性。最多可发送 100 个字符。并非所有模型均支持。
紧接在此次生成之后的文本,用于让模型保持韵律连贯性。最多可发送 100 个字符。并非所有模型均支持。
响应
成功响应
音频的音色片段
原始文本中每个字符的时间戳信息。
规范化文本中每个字符的时间戳信息。