声音设计

了解如何通过文本提示词设计声音。

声音设计

概述

当声音库中没有创作者所需的确切声音时,声音设计可以填补这一空缺。如果找不到适合项目的声音,可以自行创建。声音设计最适合快速探索和迭代,输出质量会因提示词和使用场景而异。如果需要最稳定、可直接用于制作的质量,专业语音克隆(PVC)目前是平台上质量最高的音色——因此,如果声音库中有符合需求的 PVC,建议优先使用。

可在 ElevenLabs 应用中依次进入“音色”->“我的音色”->“添加新音色”->“声音设计”,或通过 API 使用声音设计。

点击生成后,会生成 3 个声音选项。使用声音设计仅需支付生成预览文本所消耗的积分;虽然会生成 3 个样本,但只会收费一次。可在“预览文本”文本框中查看将扣除的字符数。

生成后,可以选择并保存其中一个生成结果,这会占用一个音色名额。

提示词指南

提示词是声音的基础。它告诉模型你想创建什么样的声音——从口音和角色类型,到声音的性别和氛围。精心编写的提示词,决定了生成普通声音还是能真正符合构想的声音。通常,描述更具体、更细致的提示词能带来更准确、更有层次的结果。提供的细节越多——包括年龄、性别、语气、口音、语速、情感、风格等——模型就越能理解并生成有明确意图、贴合需求的声音。

不过,有时简短的提示词也很有效,尤其是想要更中性或用途广泛的声音时。例如,“沉静的男性旁白”可能无需详细描述,就能获得所需效果——特别是在不需要创建非常具体的角色或风格时。合适的细节程度取决于使用场景。是在创建奇幻角色?虚拟助手?一位 60 多岁、带着冷幽默的疲惫纽约女性?提示词定义得越清楚,输出就越接近你的想象。

推荐提示词格式

为获得稳定结果,请按以下格式编写提示词:

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

示例:

母语为西班牙语,欧洲西班牙语(无拉丁美洲西班牙语特征)。女性,35–40 岁。一般质量。角色:可靠的客服专员。情感:令人安心、专注、自信。音色柔和自然,带有轻柔的语调,近讲效果明显,信号无噪声。以舒缓的节奏传达更新内容,清晰强调有帮助的信息,展现同理心和专业感。

应避免的常见问题

  • 不要在想表达语调时使用“口音” —— 这可能导致不需要的方言偏移。请改为描述语调、重音或表达模式。
  • 避免使用效果词 —— “混响”“回声”“电话”或“磁带”等词可能降低输出质量。
  • 明确说明语言和方言 —— 请始终在第一句话中指定语言和地区变体,以防声音特征偏移。

音频质量

音频质量指生成声音的清晰度、纯净度和整体保真度。默认情况下,ElevenLabs 会尽力生成干净、自然的音频;但如果项目需要特定质量水平,最好在提示词中明确说明。

如需高质量结果,可在声音描述中加入“完美音频质量”或“录音棚级录音”等短语。这有助于确保声音以最高的清晰度、最低的失真和精致的效果呈现。

也可以使用以下能带来稳定结果的质量描述:

  • 一般质量
  • 良好质量
  • 很好质量
  • 卓越质量
  • 录音棚质量
  • 广播质量

在提示词中加入这些描述,有助于获得最高音频质量。

如果声音非常具体或小众,加入这类短语有时会降低提示词整体的准确性。

在一些创意场景中,较低的音频质量也可能是有意为之,例如模拟电话通话、旧式电台广播或拾得影像。在这些情况下,可以完全不添加质量描述,或明确加入以下短语:

  • “低保真音频”
  • “音频质量差”
  • “听起来像语音留言”
  • “闷且遥远,像旧磁带录音机里的声音”

这类短语在提示词中的位置很灵活——可以放在开头或结尾,我们发现两种位置都很有效。

年龄、音色和性别

这 3 项特征是声音设计的基础,塑造声音的整体特质和情感共鸣。提供的细节越多,AI 就越容易生成符合创作构想的声音——无论是打造可信的角色、制作引人入胜的旁白,还是设计虚拟助手。

年龄

描述声音给人的年龄感,有助于确定其成熟度、嗓音质感和活力。使用具体的词语,引导 AI 生成合适的声音特质。

实用描述词:

  • “青春期男声” / “青春期女声”
  • “年轻成年人” / “20 多岁” / “30 岁出头”
  • “中年男性” / “40 多岁女性”
  • “老年男性” / “年长女性” / “80 多岁男性”

音色

指由音高、共鸣和嗓音质感塑造的声音物理特质。它不同于情感表达或态度。

常用音色描述词:

  • “低沉” / “低音”
  • “顺滑” / “浑厚”
  • “沙哑粗粝” / “沙哑”
  • “鼻音重” / “尖锐”
  • “空灵” / “气声”
  • “洪亮” / “有共鸣”
  • “轻柔” / “单薄”
  • “温暖” / “柔和”
  • “单薄刺耳” / “金属感”

性别

性别通常会影响音高、声音厚度和音色存在感——但也可以不局限于简单分类,通过描述声音本身而非身份来拓展可能性。

示例:

  • “低音、略带沙哑的女声”
  • “阳刚的男声,低沉且富有共鸣”
  • “中性声音——柔和,中音”

口音

口音对于定义声音的地域、文化和情感特征至关重要。如果项目需要真实的声音效果——无论是基于现实,还是为角色进行风格化设计——清晰且明确地描述所需口音都很重要。

措辞很关键——某些词语通常能带来更稳定的结果。例如,描述口音的明显程度时,“浓重”通常比“强烈”效果更好。可以多加尝试,也建议尝试不同措辞,尽可能发挥创意并提供丰富描述。

使用“口音”一词时请注意——如果想表达的是语调或重音模式,而非 地域方言,请使用相应词语。想表达语调时使用“口音”,可能会导致 不需要的方言变化。

  • 清晰口音提示词示例:
    • “带有浓重法国口音的中年男性”
    • “带有轻微美国南方腔的年轻女性”
    • “带有浓重东欧口音的老人”
    • “说着清晰英式口音的开朗女性”
    • “带有轻柔爱尔兰腔的年轻男性”
    • “带有中性美式口音的权威声音”
    • “带有澳大利亚地区口音、慵懒且鼻音较重的男性”

避免使用“外国”或“异域”等过于模糊的描述词——它们不够准确,可能导致结果不一致。

结合音色、年龄或语速等其他特质描述口音,可获得更精确的控制。例如:“带着浓重纽约口音、语速缓慢又讽刺的老妇人。”

对于奇幻或虚构声音,可以将现实中的口音作为灵感:

  • “一位带着标准浓重英式口音的精灵。他高贵而富有诗意。”
  • “一只带着沙哑东欧口音的哥布林。”

语速

语速是指声音说话时的速度和节奏。它是塑造声音个性、情感基调和清晰度的关键要素。尤其是在为叙事、广告、角色对白或教学内容等特定用途设计声音时,明确语速至关重要。

使用清晰的语言描述声音应有多快或多慢。也可以描述语速给人的感觉——是平稳、断续、从容还是轻快。如果语速会变化,请说明变化的位置和原因。

语速描述词示例:

  • “说得很快” / “语速很快”
  • “正常语速” / “正常说话”
  • “说得很慢” / “节奏缓慢”
  • “从容而有分寸的语速”
  • “拖长语调,仿佛在品味每个词”
  • “节奏急促,像是赶时间”
  • “轻松自然的对话语速”
  • “节奏富有韵律和音乐感”
  • “断续的语速,伴随突兀的停顿和爆发”
  • “均匀的语速,词与词之间间隔一致”
  • “断奏式表达”

预览文本

写好声音提示词后,用于预览该声音的文本对最终听感至关重要。预览文本就像表演脚本——它设定了声音将尝试匹配的基调、语速和情感表达。

为获得最佳效果,预览文本应与声音描述相辅相成,而非相互矛盾。例如,如果提示词描述的是“带有轻微日式口音、平静而善于反思的年轻女声”,却使用“嘿!我受不了你把这破地方弄成这样!!!”这样的句子,就会与预期冲突。模型会尝试协调这种不匹配,往往导致不自然或不一致的结果。

应使用能反映声音预期个性和情感基调的示例文本。对于上述示例,“最近一直很安静……我有时间思考,也许这正是我最需要的。”这样的文本能支持提示词,帮助生成更自然、连贯的声音。

此外,我们发现较长的预览文本往往能产生更稳定、更有表现力的结果。短语有时听起来会很突兀或不一致,尤其是在测试音色或语速等细微特质时。为模型提供更多上下文——完整句子甚至短段落——可使其更流畅、更准确地呈现声音。

参数

音量

控制“预览文本”生成的音量,以及最终保存后声音的音量。

引导强度

决定对提示词的遵循程度。较高的值会更严格遵循提示词,但如果提示词非常小众,可能导致音频质量较差;较低的值则让模型有更多创作空间,但会降低提示词准确度。如果整体表现和音频质量比精确匹配提示词更重要,请使用较低的值。当口音或音色准确度极为重要时,建议使用较高的值。

属性和示例

尝试不同的描述词写法。例如,“完美的音频质量”也可以写成“音频质量很完美”。 有时会产生不同的结果!

属性示例
年龄年轻、较年轻、成年人、年老、老年、他/她 40 多岁
口音“浓重”的苏格兰口音、“轻微”的亚裔美国人口音、美国南方口音
性别男性、女性、中性、性别模糊
音色/音质/音高低沉、温暖、粗粝、顺滑、尖锐、醇厚、沙哑、鼻音重、喉音重、刺耳、机械、空灵
语速正常节奏、快节奏、快速、缓慢、拖长、平静的节奏、自然/对话式节奏
音频质量完美的音频质量、音频质量“还行”、较差的音频质量
角色 / 职业海盗、商人、农民、政治家、治疗师、食人魔、神一般的存在、电视播音员
情绪活力充沛、兴奋、悲伤、情绪化、讽刺、冷淡
音高低音、高音、正常音高

提示词示例和文本预览

声音类型提示词/描述文本预览引导强度
女体育解说员一位充满活力的女体育解说员,带着浓重的英式口音,以极快的语速激情解说一场足球比赛。她的声音生动热情,完全沉浸在比赛中。天哪——这球太精彩了!她在中场刚过的位置拿到球,像面前根本没人一样晃过两名后卫,然后一脚猛轰,球直挂死角!守门员毫无机会!这位年轻前锋的表现堪称世界级,观众全都站起来了!这场比赛彻底活过来了,你能感觉到势头正在转变!25%
军队教官一名陆军教官正对一队士兵大喊。他听起来很愤怒,语速很快。都给我听好了,你们这帮没用的家伙!我来这儿不是当保姆的——我是来培养士兵的!我说动你们就动,我说呼吸你们才呼吸!给你们 10 秒钟列队,不然有你们后悔的!!25%
邪恶食人魔一个巨大的邪恶食人魔,语速很快。他的语气滑稽又浑厚。“你们的武器对我来说不过是牙签。[laughs] 现在投降,我或许会让你们死得痛快些。我推翻过王国,吞噬过军队。你们凭什么对抗我?“30%
亲切的英国企业家出色的音频质量。一名 30 多岁到 40 岁出头的男性,带着浓重的英式口音,以自然的语速说话,像在和朋友聊天。[laughs] 你看,问题就在这儿。你看到的是一家公司,而我看到的是……[lip smacks] 我看到的是一份承诺,懂我意思吧?[exhales] 我们创业不只是为了盈利,我们是为了……为了提升大家的生活!如果我们的技术不能让世界变得比我们发现它时更友善、更聪明、联系更紧密……[sighs] 那我们到底在做什么?40%
南方女性一名带着浓重美国南方口音的年长女性。她甜美又讽刺。“哎呀,亲爱的,如果我们整天只顾着追逐头衔和奖杯,那就会错过真正重要的事。[light chuckle] 我宁愿做些让大家生活更轻松的事——要是还能穿着高跟鞋、面带微笑,再加点小俏皮,那就更好了。“35%
电影预告片旁白戏剧化的声音,用于营造电影预告片的期待感,通常与动作片或惊悚片相关”在一个濒临混乱的世界里,一位英雄即将崛起。准备迎接这个史诗级故事,即将登陆大银幕。“20%
吱吱叫的小鼠一只可爱、吱吱叫的小老鼠”我虽然小,脾气可一点都不小![giggles] 小心点,大脚丫,不然我会咬你脚趾一口,让你永远忘不了!“20%
愤怒的海盗一名愤怒的老海盗,声音洪亮、粗犷豪放”我见过能让你头发变白的风暴,也见过能让你双腿发抖的海怪。你以为招惹黑心船长后,还能活着讲述这段故事吗?“30%
纽约人深沉、沙哑、浓重的纽约口音,坚韧而饱经沧桑,常带愤世嫉俗的语气”小子,我在这些街头混的时间比你想象的还久。你说什么、做什么,都再也惊不到我了。“40%
西班牙语客服专员母语为西班牙语,欧洲西班牙语(无拉丁美洲西班牙语特征)。女性,35–40 岁。音质良好。人设:可靠的客服专员。情绪:令人安心、专注、自信。音色顺滑自然,语调柔和,近讲感明显,信号无噪声。以轻松的节奏传达更新内容,清晰强调有帮助的信息,展现同理心和专业性。30%
阿拉伯语客服母语为阿拉伯语,略带柔和的海湾地区(阿联酋)口音。女性,30–40 岁。音质出色。人设:专业客服专员。情绪:温暖、自信、礼貌。音色丝滑,语气平静,节奏从容,语调柔和,并保持近距离麦克风收音,以获得高保真、无瑕疵的信号。声音清晰,轻柔强调对客户友好的措辞,确保易于理解。35%
波兰语创意叙述者母语为波兰语。男性,48–58 岁。音质出色。人设:富有创意的梦想家。情绪:好奇、温和、引人入胜。声音顺滑无瑕疵,质感温暖迷人,节奏稳定,带来自然的近讲感。明亮的语调和精准的强调引导听众进入叙事。32%
疯狂科学家一位古怪科学天才的声音,语速急促且变化无常,兴奋时会越来越快。他略带德式的口音在激动时更明显。音高变化幅度很大,从沉思般的低语到狂热的惊呼,还会频繁爆发出疯狂的大笑。“我是海因里希博士,被思想狭隘的科学界拒绝的革命天才!呸!他们说我的理论不可能,我的方法不道德——但现在到底是谁在笑?(疯狂大笑)20 年来,我在这座山间实验室里完善我的造物,驾驭凡人无法理解的能量!等我的量子不稳定器揭示多重宇宙时,学院里的那些蠢货会为他们的嘲笑后悔。又或者是新的生命形态……实验中有些不可预测的变量……而且是迷人的变量!“38%

常见问题

声音设计可让你通过文本提示词创建独特音色。

当你无法在声音库中找到所需的确切音色时,它能提供帮助。无需从现有选项中选择,只需用自己的话描述,即可生成自定义音色。

只需输入描述所需音色的提示词即可开始。你可以添加口音、性别、语速、语调和说话风格等细节。提示词越具体,生成的音色就越贴合你的需求。如果不确定,也可以使用“平静的男性旁白”这类简单提示词。

使用声音设计创建的音色可用于最新模型 Eleven v4,也可用于包括 Eleven v3 在内的早期模型。它们支持音频标签。在 Eleven v4 上,其表现力可能不如早期模型。

有关编写有效提示词的更多技巧,请参阅声音设计指南。

注意:声音设计仍处于实验阶段。专业语音克隆可提供 最高的质量和一致性。如果找到符合需求的 PVC,建议使用它。 专业语音克隆在 Eleven v4 上获得完全支持,但尚未针对 Eleven v3 完全优化。

声音设计可以生成各种音色,从逼真的人声到更具创意的角色风格声音。

如果不确定从何开始,可以尝试“中年女性新闻播报员”这样的简单提示词。不过,更详细的提示词通常能生成更准确、更细腻的结果。

提示词中可以包含多种特征,例如:

  • 年龄
  • 性别
  • 口音
  • 语调
  • 语速
  • 情绪
  • 说话风格
  • 音频质量

另外两个控件可帮助调整输出:

  • 响度 调整预览和已保存音色的音量。
  • 引导强度 决定生成的音色与提示词的贴合程度。

有关编写提示词的更多帮助,请参阅声音设计指南。

声音设计仅在生成音色时消耗积分。

每次点击 生成音色 时,都会根据提示词创建 3 个音色选项。费用按预览文本的字符数计算。

你可以输入自己的预览文本,也可以使用 自动生成 按钮自动创建。自动生成的预览包含相关音频标签。

详情请参阅声音设计指南。

No results