变声器

了解如何在保留情绪和表达方式的同时,在不同音色之间转换音频。

概述

变声器(原名语音转语音)可将一种声音(源声音)转换为另一种声音(克隆声音),同时保留原始声音的语调和表达方式。

变声器可配合文本转语音(TTS)使用,用于修正发音错误,或融入你希望呈现的独特表演效果。变声器尤其适合还原声音中细微而独特的特征,让效果更有情感、更自然。主要功能包括:

  • 更准确地处理耳语
  • 可生成可听见的叹息、笑声或哭声
  • 大幅提升语调和情绪检测效果
  • 准确遵循输入语音的节奏
  • 保留语言和口音

使用指南

变声器演示

你可以直接上传音频文件,也可以通过麦克风实时录音。音频文件必须小于 50 MB,上传的音频文件或实时录音长度均不得超过 5 分钟。

如果素材超过 5 分钟,建议将其拆分为较小片段后分别生成。如果文件过大,可能需要压缩或转换为 mp3。

现有音频文件

要上传现有音频文件,可点击音频框,或直接将音频文件拖放到其中。

实时录音

点击音频框中的 录制音频 按钮,准备开始录制时,点击 麦克风 按钮。完成录制后,点击 停止 按钮。

随后会显示此次录音的音频文件,你可以播放试听,以确认是否满意录制效果。左下角会显示字符消耗量;录音本身不消耗配额,只有点击“生成”时才会扣除。

变声器生成仅按时长计费,每分钟消耗 1000 个字符。

设置

变声器设置

在此处了解更多不同声音设置。

变声器新增了一项设置,可自动移除录音中的背景噪声。

支持的语言

eleven_english_sts_v2

多语言 v2 模型支持 29 种语言:

英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语和俄语。

eleven_english_sts_v2 模型仅支持英语。

了解更多模型

最佳实践

变声器擅长在不同输出声音间 保留口音 和 自然语音节奏。例如,上传带有葡萄牙语口音的音频样本时,输出会保留该语言和口音。输入样本至关重要,因为它决定了输出特征。如果选择了像“George”这样的英式声音,但录制时使用美式口音,结果会是带有美式口音的 George 声音。

  • 表现力:录音时尽量富有表现力。无论是喊叫、哭泣还是大笑,变声器都能准确复现你的表演。此工具旨在提升 AI 的真实感,并支持创意表达。
  • 麦克风增益:确保输入增益合适。录音声音过小可能影响 AI 识别,声音过大则可能导致音频削波。
  • 背景噪声:开启 移除背景噪声 选项,自动移除录音中的背景噪声。

常见问题

变声器此前称为语音转语音,可在保留原始音色和表达方式的同时,将一种声音(源音色)转换为另一种声音(克隆音色)。

它有无限可能。你可以配合文本转语音使用,修正发音,或加入你想要的独特演绎效果。它还能通过提供丰富的不同音色和语调,帮助配音演员拓展表现范围。我们提供端到端的配音解决方案;但如果你仍想采用传统方式配音,也可以借助变声器为项目找到合适的声音。

可转换音频的最大长度为 5 分钟。当前价格请查看 ElevenCreative 和 ElevenAPI。

更多信息请参阅我们的指南。

变声器此前名为语音转语音,其价格取决于通过网站还是 API 生成。

当前费率请参阅 ElevenCreative 和 ElevenAPI。

变声器此前称为语音转语音,目前最大输入长度为 300 秒或 5 分钟音频。所有订阅方案的限制相同。

以下文件格式可作为变声器的输入音频。

音频:

  • MP3
  • M4A
  • FLAC
  • OGA
  • OGG
  • WAV

视频:

  • MKV
  • WEBM
  • MP4
  • MOV

可以通过两种方式下载生成的文件:

生成内容后,点击右下角的下载按钮,即可立即下载生成的文件。

以前生成的文件可从历史记录中下载。要访问历史记录,请登录账户,在侧边栏选择变声器,然后点击屏幕右侧面板中的历史记录标签页。

点击下载按钮,可将历史记录中的任何文件下载为 MP3 或 WAV 文件。如需更多下载选项,请点击高级。

No results