为视频或音频文件配音
为视频或音频文件配音
将提供的音频或视频文件配音为指定语言。
请求头
xi-api-key
请求
This endpoint expects a multipart form with multiple files.
file
用于语音克隆的音频录音文件路径列表。
csv_file
包含转录/翻译元数据的 CSV 文件
foreground_audio_file
仅适用于 csv 输入
background_audio_file
仅适用于 csv 输入
name
配音项目名称。
source_url
源视频/音频文件的 URL。
source_lang
源语言。应为有效的 iso639-1 或 iso639-3 语言代码。
target_lang
要配音到的目标语言。应提供有效的 iso639-1 或 iso639-3 语言代码。
target_accent
[Experimental] 从声音库选择音色时应用的口音,也用于指定翻译时优先使用的方言。
num_speakers
配音使用的说话人数量。设为 0 可自动检测说话人数量。
watermark
是否为输出视频添加水印。
start_time
源视频/音频文件的开始时间。
end_time
源视频/音频文件的结束时间。
highest_resolution
是否使用可用的最高分辨率。
drop_background_audio
高级设置。是否从最终配音中移除背景音频。已知音频不应包含背景音轨时,例如演讲或独白,这可以提升配音质量。
use_profanity_filter
[BETA] 是否将转录文本中的不雅用语替换为 “[censored]”。
dubbing_studio
是否为在配音工作室中编辑,或作为配音资源编辑而准备配音。
disable_voice_cloning
配音时,可使用 ElevenLabs 声音库中的相似音色代替语音克隆。使用声音库中的音色会计入工作区的自定义音色上限;如果没有足够可用名额,配音将失败。使用此功能要求调用方在工作区中拥有 ‘add_voice_from_voice_library’ 权限,以访问新音色。
mode
运行此配音任务的模式。默认为 automatic;如果指定提供要使用的 CSV 转录文本,请使用 manual。请注意,manual 模式处于实验阶段,强烈不建议用于生产环境。
允许的值:
csv_fps
解析用于配音的 CSV 文件时使用的每秒帧数。未提供时,将根据时间码推断 FPS。
响应
成功响应
dubbing_id
配音项目 ID。
expected_duration_sec
配音项目的预计时长,单位为秒。
错误
422
Unprocessable Entity Error