变声器
变声器
了解如何在保留情绪和表达方式的同时,在不同音色之间转换音频。
概述
变声器(原名语音转语音)可将一种声音(源声音)转换为另一种声音(克隆声音),同时保留原始声音的语调和表达方式。
变声器可配合文本转语音(TTS)使用,用于修正发音错误,或融入你希望呈现的独特表演效果。变声器尤其适合还原声音中细微而独特的特征,让效果更有情感、更自然。主要功能包括:
- 更准确地处理耳语
- 可生成可听见的叹息、笑声或哭声
- 大幅提升语调和情绪检测效果
- 准确遵循输入语音的节奏
- 保留语言和口音
观看变声器实际效果视频
使用指南

你可以直接上传音频文件,也可以通过麦克风实时录音。音频文件必须小于 50 MB,上传的音频文件或实时录音长度均不得超过 5 分钟。
如果素材超过 5 分钟,建议将其拆分为较小片段后分别生成。如果文件过大,可能需要压缩或转换为 mp3。
现有音频文件
要上传现有音频文件,可点击音频框,或直接将音频文件拖放到其中。
实时录音
点击音频框中的 录制音频 按钮,准备开始录制时,点击 麦克风 按钮。完成录制后,点击 停止 按钮。
随后会显示此次录音的音频文件,你可以播放试听,以确认是否满意录制效果。左下角会显示字符消耗量;录音本身不消耗配额,只有点击“生成”时才会扣除。
变声器生成仅按时长计费,每分钟消耗 1000 个字符。
设置

在此处了解更多不同声音设置。
变声器新增了一项设置,可自动移除录音中的背景噪声。
支持的语言
eleven_english_sts_v2
多语言 v2 模型支持 29 种语言:
英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语和俄语。
eleven_english_sts_v2 模型仅支持英语。
最佳实践
变声器擅长在不同输出声音间 保留口音 和 自然语音节奏。例如,上传带有葡萄牙语口音的音频样本时,输出会保留该语言和口音。输入样本至关重要,因为它决定了输出特征。如果选择了像“George”这样的英式声音,但录制时使用美式口音,结果会是带有美式口音的 George 声音。
- 表现力:录音时尽量富有表现力。无论是喊叫、哭泣还是大笑,变声器都能准确复现你的表演。此工具旨在提升 AI 的真实感,并支持创意表达。
- 麦克风增益:确保输入增益合适。录音声音过小可能影响 AI 识别,声音过大则可能导致音频削波。
- 背景噪声:开启 移除背景噪声 选项,自动移除录音中的背景噪声。