声音设计
声音设计
了解如何通过文本提示词设计声音。
概述
当声音库中没有创作者所需的确切声音时,声音设计可以填补这一空缺。如果找不到适合项目的声音,可以自行创建。声音设计最适合快速探索和迭代,输出质量会因提示词和使用场景而异。如果需要最稳定、可直接用于制作的质量,专业语音克隆(PVC)目前是平台上质量最高的音色——因此,如果声音库中有符合需求的 PVC,建议优先使用。
可在 ElevenLabs 应用中依次进入“音色”->“我的音色”->“添加新音色”->“声音设计”,或通过 API 使用声音设计。
点击生成后,会生成 3 个声音选项。使用声音设计仅需支付生成预览文本所消耗的积分;虽然会生成 3 个样本,但只会收费一次。可在“预览文本”文本框中查看将扣除的字符数。
生成后,可以选择并保存其中一个生成结果,这会占用一个音色名额。
提示词指南
提示词是声音的基础。它告诉模型你想创建什么样的声音——从口音和角色类型,到声音的性别和氛围。精心编写的提示词,决定了生成普通声音还是能真正符合构想的声音。通常,描述更具体、更细致的提示词能带来更准确、更有层次的结果。提供的细节越多——包括年龄、性别、语气、口音、语速、情感、风格等——模型就越能理解并生成有明确意图、贴合需求的声音。
不过,有时简短的提示词也很有效,尤其是想要更中性或用途广泛的声音时。例如,“沉静的男性旁白”可能无需详细描述,就能获得所需效果——特别是在不需要创建非常具体的角色或风格时。合适的细节程度取决于使用场景。是在创建奇幻角色?虚拟助手?一位 60 多岁、带着冷幽默的疲惫纽约女性?提示词定义得越清楚,输出就越接近你的想象。
推荐提示词格式
为获得稳定结果,请按以下格式编写提示词:
示例:
母语为西班牙语,欧洲西班牙语(无拉丁美洲西班牙语特征)。女性,35–40 岁。一般质量。角色:可靠的客服专员。情感:令人安心、专注、自信。音色柔和自然,带有轻柔的语调,近讲效果明显,信号无噪声。以舒缓的节奏传达更新内容,清晰强调有帮助的信息,展现同理心和专业感。
应避免的常见问题
- 不要在想表达语调时使用“口音” —— 这可能导致不需要的方言偏移。请改为描述语调、重音或表达模式。
- 避免使用效果词 —— “混响”“回声”“电话”或“磁带”等词可能降低输出质量。
- 明确说明语言和方言 —— 请始终在第一句话中指定语言和地区变体,以防声音特征偏移。
音频质量
音频质量指生成声音的清晰度、纯净度和整体保真度。默认情况下,ElevenLabs 会尽力生成干净、自然的音频;但如果项目需要特定质量水平,最好在提示词中明确说明。
如需高质量结果,可在声音描述中加入“完美音频质量”或“录音棚级录音”等短语。这有助于确保声音以最高的清晰度、最低的失真和精致的效果呈现。
也可以使用以下能带来稳定结果的质量描述:
- 一般质量
- 良好质量
- 很好质量
- 卓越质量
- 录音棚质量
- 广播质量
在提示词中加入这些描述,有助于获得最高音频质量。
如果声音非常具体或小众,加入这类短语有时会降低提示词整体的准确性。
在一些创意场景中,较低的音频质量也可能是有意为之,例如模拟电话通话、旧式电台广播或拾得影像。在这些情况下,可以完全不添加质量描述,或明确加入以下短语:
- “低保真音频”
- “音频质量差”
- “听起来像语音留言”
- “闷且遥远,像旧磁带录音机里的声音”
这类短语在提示词中的位置很灵活——可以放在开头或结尾,我们发现两种位置都很有效。
年龄、音色和性别
这 3 项特征是声音设计的基础,塑造声音的整体特质和情感共鸣。提供的细节越多,AI 就越容易生成符合创作构想的声音——无论是打造可信的角色、制作引人入胜的旁白,还是设计虚拟助手。
年龄
描述声音给人的年龄感,有助于确定其成熟度、嗓音质感和活力。使用具体的词语,引导 AI 生成合适的声音特质。
实用描述词:
- “青春期男声” / “青春期女声”
- “年轻成年人” / “20 多岁” / “30 岁出头”
- “中年男性” / “40 多岁女性”
- “老年男性” / “年长女性” / “80 多岁男性”
音色
指由音高、共鸣和嗓音质感塑造的声音物理特质。它不同于情感表达或态度。
常用音色描述词:
- “低沉” / “低音”
- “顺滑” / “浑厚”
- “沙哑粗粝” / “沙哑”
- “鼻音重” / “尖锐”
- “空灵” / “气声”
- “洪亮” / “有共鸣”
- “轻柔” / “单薄”
- “温暖” / “柔和”
- “单薄刺耳” / “金属感”
性别
性别通常会影响音高、声音厚度和音色存在感——但也可以不局限于简单分类,通过描述声音本身而非身份来拓展可能性。
示例:
- “低音、略带沙哑的女声”
- “阳刚的男声,低沉且富有共鸣”
- “中性声音——柔和,中音”
口音
口音对于定义声音的地域、文化和情感特征至关重要。如果项目需要真实的声音效果——无论是基于现实,还是为角色进行风格化设计——清晰且明确地描述所需口音都很重要。
措辞很关键——某些词语通常能带来更稳定的结果。例如,描述口音的明显程度时,“浓重”通常比“强烈”效果更好。可以多加尝试,也建议尝试不同措辞,尽可能发挥创意并提供丰富描述。
使用“口音”一词时请注意——如果想表达的是语调或重音模式,而非 地域方言,请使用相应词语。想表达语调时使用“口音”,可能会导致 不需要的方言变化。
- 清晰口音提示词示例:
- “带有浓重法国口音的中年男性”
- “带有轻微美国南方腔的年轻女性”
- “带有浓重东欧口音的老人”
- “说着清晰英式口音的开朗女性”
- “带有轻柔爱尔兰腔的年轻男性”
- “带有中性美式口音的权威声音”
- “带有澳大利亚地区口音、慵懒且鼻音较重的男性”
避免使用“外国”或“异域”等过于模糊的描述词——它们不够准确,可能导致结果不一致。
结合音色、年龄或语速等其他特质描述口音,可获得更精确的控制。例如:“带着浓重纽约口音、语速缓慢又讽刺的老妇人。”
对于奇幻或虚构声音,可以将现实中的口音作为灵感:
- “一位带着标准浓重英式口音的精灵。他高贵而富有诗意。”
- “一只带着沙哑东欧口音的哥布林。”
语速
语速是指声音说话时的速度和节奏。它是塑造声音个性、情感基调和清晰度的关键要素。尤其是在为叙事、广告、角色对白或教学内容等特定用途设计声音时,明确语速至关重要。
使用清晰的语言描述声音应有多快或多慢。也可以描述语速给人的感觉——是平稳、断续、从容还是轻快。如果语速会变化,请说明变化的位置和原因。
语速描述词示例:
- “说得很快” / “语速很快”
- “正常语速” / “正常说话”
- “说得很慢” / “节奏缓慢”
- “从容而有分寸的语速”
- “拖长语调,仿佛在品味每个词”
- “节奏急促,像是赶时间”
- “轻松自然的对话语速”
- “节奏富有韵律和音乐感”
- “断续的语速,伴随突兀的停顿和爆发”
- “均匀的语速,词与词之间间隔一致”
- “断奏式表达”
预览文本
写好声音提示词后,用于预览该声音的文本对最终听感至关重要。预览文本就像表演脚本——它设定了声音将尝试匹配的基调、语速和情感表达。
为获得最佳效果,预览文本应与声音描述相辅相成,而非相互矛盾。例如,如果提示词描述的是“带有轻微日式口音、平静而善于反思的年轻女声”,却使用“嘿!我受不了你把这破地方弄成这样!!!”这样的句子,就会与预期冲突。模型会尝试协调这种不匹配,往往导致不自然或不一致的结果。
应使用能反映声音预期个性和情感基调的示例文本。对于上述示例,“最近一直很安静……我有时间思考,也许这正是我最需要的。”这样的文本能支持提示词,帮助生成更自然、连贯的声音。
此外,我们发现较长的预览文本往往能产生更稳定、更有表现力的结果。短语有时听起来会很突兀或不一致,尤其是在测试音色或语速等细微特质时。为模型提供更多上下文——完整句子甚至短段落——可使其更流畅、更准确地呈现声音。
参数
音量
控制“预览文本”生成的音量,以及最终保存后声音的音量。
引导强度
决定对提示词的遵循程度。较高的值会更严格遵循提示词,但如果提示词非常小众,可能导致音频质量较差;较低的值则让模型有更多创作空间,但会降低提示词准确度。如果整体表现和音频质量比精确匹配提示词更重要,请使用较低的值。当口音或音色准确度极为重要时,建议使用较高的值。
属性和示例
尝试不同的描述词写法。例如,“完美的音频质量”也可以写成“音频质量很完美”。 有时会产生不同的结果!