最佳实践

掌握 ElevenCreative 中 Music 的提示词编写方法,实现最佳音乐性和控制力。

本指南总结了在 ElevenCreative 中为音乐编写提示词的高效技巧,涵盖模型如何理解提示词、制作术语、音乐控制、编曲、人声、循环、声音设计,以及结构时序和歌词。

模型旨在理解你的意图,并根据目标生成完整且契合上下文的音频。像 “运动鞋品牌广告” 或 “带旁白的平静冥想” 这样的高层级提示词,通常足以引导模型生成符合使用场景的音色、结构和内容。

模型如何理解提示词

无论你是否有意为之,提示词都会回答 5 个问题:流派、情绪、乐器、速度和制作年代。任何留白的问题,模型都会选择统计上最可能的答案——也就是最普通的答案。

未回答这 5 个问题的提示词:

upbeat electronic track

回答全部 5 个问题的相同请求:

French house, 122 BPM, filtered disco sample chops, sidechained bass, tight
four-on-the-floor kick, rooftop-at-sunset mood, warm analog glue

第二个提示词没有使用特殊技巧——输出中的每一项决定都由人作出。在模型替你决定之前,先确定流派、情绪、乐器、速度和年代。

流派与创意

模型能很好地遵循流派惯例和情感基调,能够有效响应:

  • 抽象的情绪描述(例如 “诡异”、“不祥”)
  • 详细的音乐语言(例如 “脉冲式次低音上方的不协和小提琴尖啸”)

提示词的长度和细节并不总是与更高质量的输出相关。想要更有创意、更出人意料的结果,可尝试使用简洁且富有感染力的关键词,让模型自由诠释和创作。

制作术语

模型理解录音室中讨论音乐的方式。录音室语言能真正改变效果:侧链压缩、近距离收音、极干、磁带饱和、板式混响,都会明显改变混音。

同一首民谣在 3 个不同空间中——仅改变制作相关词汇:

slow soul ballad, 68 BPM, female vocal — bone-dry drums, close-mic'd vocal, dead room
slow soul ballad, 68 BPM, female vocal — cavernous plate reverb, tape echo throws, gospel room
slow soul ballad, 68 BPM, female vocal — tape saturation, wow and flutter, dusty vinyl crackle

如果没有相关词汇,可以描述空间:“听起来像是在楼梯间录制的”,就能得到楼梯间的效果。

制作年代和速度一样,是一个可调参数,模型还能在歌曲中途调整它。指定年代(“带短回声的 1950 年代摇滚乐”、“1990 年代 jungle”)会设定整体制作风格;按时间描述年代变化,则能在一首曲目中产生连贯的过渡。

音乐控制

模型能准确遵循 BPM,并且通常能捕捉预期的调性。为了更好地控制节奏与和声,请在提示词中加入 “130 BPM” 等速度提示,以及 “A 小调” 等调号。模型能足够精确地保持指定的 BPM 和调性,因此可以将输出与其他素材叠加——人声录音、采样或第二次生成。

要影响人声演绎和音色,可使用 “原始”、“现场感”、“故障感”、“气声” 或 “激进” 等富有表现力的描述。演绎说明同样有效:低语、强力演唱、对话式、平淡、叠加和声。同一句歌词搭配相反指令:

whispered indie folk, close and intimate, fingerpicked acoustic guitar
stadium rock, belted powerhouse vocal, huge drums, wall of guitars

模型能有效呈现多个歌手——使用 “两位歌手以 C 调和声” 等提示词来引导人声编排。

总体而言,更详细的提示词能让输出更具可控性和表现力。

编曲

模型会遵循时间相关指令。按顺序描述编曲,就像向乐队交代一样:

UK garage, 132 BPM — start with just a shuffled drum loop, add a warm sub bassline
after four bars, then bring in chopped vocal stabs for the drop

关键的承重词很短:以……开始、只、然后、加入。没有 只,模型会填补空白——请明确标记静音部分。

循环

循环提示词是一种排除练习。说明小节数、BPM、调性——也要说明禁止什么:

boom bap drum break, 90 BPM, dusty and swung, four bars, no melody — just drums
dreamy guitar loop, 140 BPM, F sharp minor, emo trap, four bars, instrumental

“不要旋律,只要鼓” 正是让鼓点片段保持为鼓点片段的关键。对于循环,留白本身就是提示词。

结构时序与歌词

可以指定歌曲时长(例如 “60 秒”),或使用自动模式让模型决定时长。如果未提供歌词,模型会生成与所选或自动检测时长相匹配的结构化歌词。

默认情况下,大多数音乐提示词都会包含歌词。要生成无人声音乐,请在提示词中加入 “仅器乐”。还可以自己创作歌词,以获得更多创意控制。模型会结合歌词和提示词时长,确定人声结构和位置。

要控制人声何时开始或结束,请加入明确的时间提示,例如:

  • “歌词在 15 秒时开始”
  • “1:45 后仅器乐”

模型支持多语言歌词生成。要在我们的 UI 中更改生成歌曲的语言,可使用 “改成日语” 或 “翻译成西班牙语” 等后续指令。

乐器与人声分离

要更好地控制创建的分轨,请使用有针对性的提示词和结构:

  • 在乐器前使用 “solo” 一词(例如 “solo 电吉他”、“C 小调 solo 钢琴”)。
  • 对于人声,在人声描述前使用 “a cappella”(例如 “a cappella 女声”、“a cappella 男声合唱”)。

要提升分轨质量和控制能力:

  • 包含调性、速度(BPM)和音乐情绪(例如 “A 大调 a cappella 人声,90 BPM,深情且原始”)。
  • 尽可能使用丰富的音乐描述来引导模型输出。

声音设计

模型直接渲染声音本身,并不在意你描述的声音是否能在现实中实际发生。非音乐音频——音效、环境音、纹理——可直接通过提示词生成,或融入曲目中:

a thunderstorm in 6/8 — thunder lands on the downbeat, rain fills the offbeats,
distant lightning as crash cymbals
one enormous cathedral bell that, as it decays, slowly turns out to have been
a choir all along
an orchestra tuning up that accidentally becomes techno — the A gets a kick drum,
chaos becomes a groove

方法是:选取一种已有的声音,赋予它一个本不该具备的属性,再一本正经地描述结果。本指南中的所有技巧——调性、BPM、侧链压缩、叙述式编曲——都能将这些声音作为原始素材使用。

音频参考

有些想法难以描述——你对着手机哼出的旋律、某条特定贝斯线的律动,或只能指给别人看的纹理。上传一段曲目(语音备忘录也可以)作为音频参考,模型会匹配其感觉、律动和音色调色板,而不会复制音符。

提示词仍可引导参考音频未明确的一切。有效的搭配是:参考音频承载感觉,提示词说明需要改变什么——“相同能量,半拍鼓点,女声。”

上传内容时长可约为 30 秒。每段参考曲目都会在生成前通过版权检查——音频参考专为你自己创作的音乐设计。

示例提示词

模型让你不止于描述歌曲,还能表达意图,以获得最大的创作空间。

Track for a high-end mascara commercial. Upbeat and polished. Voiceover only.
The script begins: "We bring you the most volumizing mascara yet." Mention the brand
name "X" at the end.

总结

掌握以下 3 个习惯,就覆盖了本指南的大部分内容:

  1. 具体明确。 流派、情绪、乐器、速度、年代——确定这 5 项,否则模型会替你决定。
  2. 使用制作术语。 录音室词汇能真正改变效果,模型也能精确遵循数值。
  3. 约束重要内容,其余留出空间。 叙述式编曲、明确排除项、人声方向。

高级功能:创作方案

如需精确控制段落结构、歌词位置和多歌手编排,请使用创作方案,而非简单的文本提示词。