配音工作室
配音工作室
精细控制配音。
配音工作室现处于维护模式,仅继续接收关键错误修复,暂无新功能开发计划。现有配音工作室客户可继续不间断使用。
创建配音工作室项目
- 选择 Dubbing v1 作为模型,然后选择 配音项目。
- 点击 创建配音。创建配音工作室项目后,即可打开项目。
核心概念
说话人卡片
说话人卡片

说话人卡片会显示源视频中对话的原始转录文本及翻译(如已添加)。你可以点击“转录音频”重新转录原始语音,或点击箭头重新翻译现有转录文本。
编辑转录文本和翻译
转录文本和翻译均可自由编辑——只需点击说话人卡片内,然后输入即可编辑文本。
说话人识别
你可以在说话人卡片左上角看到每位说话人的名称。要更改说话人名称,或将片段重新分配给其他说话人,需要使用时间线。
时间线
时间线
时间线包含配音工作室的许多重要元素,以下不同部分会进一步说明:
基本导航
浏览时间线主要有 3 种方式:
- 点击并拖动光标
- 水平滚动
- 在时间线右侧输入特定时间码
调整片段并重新生成音频
- 拖动片段左侧或右侧的控制柄以调整长度。
- 点击刷新图标,重新生成该片段的音频。

动态生成与固定生成
注意:默认情况下,配音工作室中的所有重新生成均为 固定生成。这意味着无论片段包含多少文本,系统都会保持片段时长固定。如果在不更改文本的情况下调整片段长度,或在片段中添加或删除大量文字,语速可能会明显加快或变慢。
例如,一个片段包含“我很好。”这句话。如果该片段设为持续 10 秒,并使用固定生成创建音频,语音听起来会缓慢而拖沓。
或者,你可以右键点击一个片段,然后从选项中选择 动态生成。系统会尝试将片段长度调整为适合文本长度,让音频听起来更自然。
但请注意——动态生成可能影响视频的同步和时序。例如,如果为包含大量文字的片段选择动态生成,而下一个片段前没有足够空间让它正常延长,音频可能无法正确生成。

过期音频
过期音频是指因各种原因需要重新生成的音频,例如片段长度、设置、转录文本或翻译发生更改等。你可以单独重新生成过期片段,也可以点击“生成过期音频”批量生成所有过期音频片段。
片段历史记录
你可以右键点击片段并选择“片段历史记录”,查看之前生成的版本并选择效果最佳的版本。
拆分和合并片段
- 要拆分片段,请将光标移动到特定时间码,然后点击“拆分”。
- 要合并两个片段,请将片段末端拖到一起,然后点击“合并”。

拆分和合并片段时,时间线上方的说话人卡片会相应更新。
将片段重新分配给其他说话人
要将片段重新分配给其他说话人,请点击该片段并将其拖到另一条轨道。

添加更多音轨
使用时间线底部的操作按钮添加新音轨。

音色设置
音色设置
选择音色
要选择用于生成特定说话人轨道音频的音色,请点击时间线左侧、说话人名称旁的设置齿轮图标。
配音工作室提供 3 种主要音色类型:
- 片段克隆——基于该片段的源音频,为每个片段创建独特的声音克隆
- 轨道克隆——基于指定说话人的所有源音频,为整条轨道创建一个声音克隆
- 其他音色——你还可以从声音库中数千种可用音色中选择,每种音色都有详细元数据和标签,帮助你选择合适的音色
你也可以右键点击片段并选择“从所选内容创建声音”,从特定片段创建、保存并重复使用音色。
设置轨道级与片段级设置
可以在两个级别设置音色:
-
轨道级——更改将应用于轨道中的所有片段,有助于提高稳定性和一致性。
-
片段级——更改仅应用于特定片段。要设置片段级设置,请使用时间线右侧的面板。 关闭“继承轨道设置”开关,然后配置所需设置。

导出
导出
点击配音工作室右下角的“导出”,打开导出菜单。
配音工作室目前支持以下导出格式:
- AAC(音频)
- MP3(音频)
- WAV(音频)
- 音轨 .zip
- 音频片段 .zip
- AAF(时间线数据)
- SRT(字幕/说明文字)
- CSV(speaker、start_time、end_time、transcription、translation)
导出时,务必选择正确的语言。
其他功能
- 旁白轨道: 旁白轨道可创建新的说话人。你可以在时间线任意位置点击并添加片段。创建片段后,在上方的说话人卡片中输入所需文本。首先需要翻译文本,然后即可点击“生成”。还可以点击屏幕右侧的麦克风图标,使用变声器工具录入自己的声音,再将其转换为所选音色。
- SFX 轨道: 添加 SFX 轨道后,点击轨道任意位置即可创建 SFX 片段。与独立 SFX 功能类似,只需在上方说话人卡片中输入提示词,然后点击“生成”,即可创建新的 SFX 音频。你可以延长或缩短 SFX 片段,并在时间线上自由移动以适配项目——调整后务必按下“过期”按钮。
- 上传音频: 此选项可让你上传无语音的轨道,例如音效、音乐或背景音轨。请注意,如果轨道中存在语音,系统不会检测到,因此无法翻译或修正这些语音。
手动配音
如果你已准备好准确的配音脚本,并希望配音工作室项目严格遵循指定的片段和说话人分配,可在创建时选择 手动模式。
要创建手动配音,你需要:
- 视频文件
- 背景音频文件
- 前景音频文件
- CSV 文件,其中每行包含 speaker、start_time、end_time、transcription 和 translation 字段
CSV 文件必须严格遵循预定义格式才能正确处理。以下是 3 种支持时间码格式的示例:
- 秒
- 小时:分钟:秒:帧
- 小时:分钟:秒,毫秒
