为什么克隆后声音或口音听起来不对?

ElevenLabs 提供两种克隆选项:

  • 即时语音克隆: 使用约 1–3 分钟音频即可快速生成结果。适用于大多数声音,但对少见口音或独特声音的效果可能有限。
  • 专业语音克隆: 保真度更高,需使用 30 分钟至约 3 小时的音频。微调通常需要 3–6 小时,如果排队的声音较多,可能需要更久。

如果即时语音克隆未能很好地捕捉声音或口音,请尝试专业语音克隆。

克隆创建后无法更改其口音或语调。若要改善效果,请更换所用音频样本。样本的细微调整也可能带来显著差异。