即时语音克隆
即时语音克隆
了解如何使用我们一流的模型即时克隆语音。
创建即时语音克隆
克隆语音时,需考虑 AI 的训练内容:涵盖哪些语言,以及使用了什么类型的数据集。有关各个模型及其优势的更多信息,请参阅模型页面。
指南
最佳实践
录制至少 1 分钟音频
录制至少 1 分钟音频
避免录制超过 3 分钟,因为改善效果很小,某些情况下甚至可能损害克隆效果。
音频的录制方式比样本总时长更重要。使用多少个样本并不重要,关键是合计总时长。
建议使用约 1-2 分钟清晰、无混响、无伪影且无任何背景噪音的音频。我们所说的“音频或录音质量”,不是指 MP3 或 WAV 等编解码器,而是指音频的采集方式。不过,就音频编解码器而言,建议使用 128 kbps 及以上的 MP3。更高的比特率不会显著提升克隆质量。
保持音频一致性
保持音频一致性
AI 会尝试模仿音频中听到的一切,包括说话速度、语调变化、口音、音色、呼吸模式和强度,以及噪音和嘴部咔嗒声。可能使其混淆的噪音和伪影也会被纳入考量。
确保整段语音保持一致的音调和演绎风格。同时,确保所有样本中的语音音质一致。即使只使用一个样本,也应确保整个样本保持一致。向 AI 提供动态范围很大的音频,即音高和音量波动明显的音频,结果会更难预测。
复现你的演绎方式
复现你的演绎方式
另一个需要注意的重要事项是,AI 会尝试复现你提供语音的演绎方式。如果你说话缓慢、单调且情感不多,AI 也会模仿这种风格。相反,如果你说话很快且情感丰富,AI 也会尝试复现这种风格。
所有样本中的语音保持一致至关重要,不仅是音调,演绎方式也要一致。如果差异过大,可能会使 AI 混淆,导致多次生成之间的输出变化更大。
保持合适的音量
保持合适的音量
保持合适的音量,避免音频过轻或过响。理想范围是 -23 dB 至 -18 dB RMS,真实峰值为 -3 dB。
常见问题
No results

