音色设计(Sound Design)
这个 skill 的立场:音色是编曲决策,不是后期的事。
选错音色,后面所有的配器、分层、混音都在补救。而"选音色"这个动作在多数人手里 实际是"翻预设直到有一个不难听"——那正是 AI 味最稳定的来源, 因为生成模型也在做同一件事:取那个类别里最典型的音色。
本 skill 的核心方法来自野崎貴朗:先把构想说清楚,再动参数。
按任务读哪几节
| 症状/任务 | 读 |
|---|---|
| 不知道从哪开始设计一个音色 | §1 四问清单 → §3 映射 |
| 翻了半天预设都不对 | §2 回零点 |
| 音色"像预设"、没个性 | §2 + §4 |
| 明明音色对,放进编曲就不对 | §3 的②音域 |
| 贝斯在手机/笔记本上消失了 | §6 差音 |
| Pad 很厚但没质感 | §4 雕刻四步 |
| 填 ARR-SPEC 的 roster 音色描述 | §7 |
边界:什么不归这个 skill 管
| 不归这里 | 归哪 |
|---|---|
| 真实乐器的选择与混合音色 | mc-orchestration |
| 这个音色占哪个频段、和谁打架 | mc-texture-layering |
| EQ 频点、压缩比、总线处理 | mc-mix-intent(意图)/出库混音库(实操) |
| 影视音效、Foley、环境声 | 出库 → 声音设计与混音库(同名不同事,别混) |
| 具体风格的音色配方(Detroit techno 贝斯怎么调) | reference.md 的配方表 |
| 采样的选择与切片 | mc-style-hiphop §6.3–6.5 与其 reference §1–2(选材、切片、loop 搭建);采样库产品选型出库 |
★ 命名提醒:本库的
mc-sound-design指的是乐音音色的合成与设计; 影视意义上的"声音设计"(音效、拟音、空间)是另一个库。
1. 动笔前必填:四问清单
在着手设计之前,先判断音色的角色个性,并回答这 4 项 (p0091):
| # | 问题 |
|---|---|
| ① | 属于打击乐器类型(音调不明确)还是乐音(有音调、可奏旋律或和弦)? |
| ② | 大致上的音域范围是? |
| ③ | 该音色的振幅波封呈现哪种曲线? |
| ④ | 明亮(泛音多)还是沉闷(泛音少)? |
作者的要求是养成习惯:"在从事音色设计时,首先要养成将自己的构想去和①~④比对的习惯" (p0091)。
为什么这四问就够:它们正好各自对应合成器的一个模块(§3), 所以答完四问,参数怎么设已经定了一大半——剩下的才是品味。
自检动作:四问里只要有一问答不出来,就别动旋钮。 答不出来时你在做的不是设计,是试错。
2. 回零点:从"未经修饰的声音"开始
问题:合成器不像电吉他或钢琴那样有一个简单明了的"原音"。 你一打开就在某个人的预设里,你的每个决定都是相对别人的决定做的。
做法:建立一个"未经修饰的声音"初始设定 (p0088):
| 模块 | 设定 |
|---|---|
| 振荡器 | 只用一组锯齿波 |
| 滤波器 | CUTOFF 右旋到底、RESONANCE 0、FILTER EG 0(全面开通) |
| AMP EG | ATTACK 0、DECAY 0、SUSTAIN 全开、RELEASE 0(风琴状波封) |
| LFO 等调变 | 完全不用 |
| 效果器 | 不开 |
"非得要调到这般『原始波形的鸣放状态』才会形成吉他或钢琴那般『未经修饰的声音』" (p0088)。
建议:把它存成"初始状态 1 号",每次音色设计都从这里出发 (p0089)。
这一条对抗 AI 味的机理:预设是别人对某个类别的平均判断, 从预设出发,你只能在那个平均值附近微调。从零点出发,你的音色是自己长出来的。
失效条件:时间极度紧张、或需要一个明确的经典音色(如 TB-303 酸味贝斯)时, 从最接近的预设改起是合理的 (p0090 的做法②)——但要说得出你改了哪四处, 说不出就是没改。
3. 四问 → 参数的映射
| 构想 | 参数 | 怎么定 |
|---|---|---|
| ① 打击 or 乐音 | 振荡器波形 | 打击类 → NOISE;乐音类 → SAW 或 SQUARE (p0092) |
| ② 音域 | TUNE / TRANSPOSE | 见下方 ★ |
| ③ 波封曲线 | AMP EG | 见下方三组 |
| ④ 明亮 or 沉闷 | FILTER | 先设 −24 dB/oct 低通,再用 CUTOFF 调 (p0092) |
★ ②音域是最容易被忽略、代价最大的一项
"不论多么努力去尝试接近理想中的音色,只要音域不同,声音就绝对永远无法跟想像的一样" (p0092)。
这解释了一个常见现象:音色单独听很对,放进编曲就不对。
多半不是音色的问题,是它在错误的音区。
——所以这条直接连到 mc-texture-layering §4.2 的"错开音区"。
③ 波封的三组决定 (p0092)
| 要什么 | 怎么设 | |
|---|---|---|
| 起音 | 迅速俐落 / 从容渐进 | ATTACK 调短 / 调长 |
| 延音 | 自然消逝 / 持续延伸 | SUSTAIN=0 并调 DECAY / 用 SUSTAIN 定音量 |
| 释音 | 立即消失 / 保留余音 | RELEASE=0 / 调长 RELEASE |
总原则:"最重要的就是先从『已确立的部分』开始着手设定" (p0093)。 四问里你最确定的那一问,就是第一个该动的模块。
技巧:乐句已经写好的话,一边反复播放一边设计音色,效果颇佳 (p0093)。 ——音色是在上下文里判断的,不是独奏试听判断的。
3.5 ★ 起振是音色的身份证(Howard & Angus)
四问清单问的是频谱与包络,但辨识度几乎全在头几十毫秒:去掉起振与衰减之后,小提琴和小号很难区分(p0222–0223)。 合成音色"假",多半不是频谱错,是起振里该有的线索没有。书里点名六条(p0223): 弓弦摩擦、铜管辅音式的起振、吹管的呼吸噪声、簧片起振的拍打、琴锤的击打、琴弦回落。
做音色时的三条:
- 模仿真乐器,先问它的起振里有什么噪声或非谐波成分,再问稳态频谱。采样"假"多半因为循环段取自稳态、起振被切平(p0217)
- 起振不受房间染色,第一次反射通常在起振结束之后才到(p0217)。混响救不回一个被削平的起振
- 各族起振长短差很多:铜管基频先行、极短;长笛基频之前有约 70 ms 呼吸噪声;小提琴起振约 160 ms、颤音要到 250 ms 后才出现(p0220–0221)。 做一个"快断奏用"的音色,起振必须短;做一个"长音用"的音色,起振长一点反而像
各族起振的对照表在 mc-texture-layering reference §5a.2。
3.6 ★ 音响动态的强调:给慢起音的层叠一个快起音(杨立青)
"音响动态"指一个音的起振、稳态、衰减的时间过渡特性。用不同音色叠置去强化、夸大、甚至改造某个因素原有的音响动态, 就叫音响动态的强调(杨立青下册 p0287)。
最常见的用法:pad 或弦乐长音没有音头,叠一层起音快的东西(pluck、钢琴、拨奏、mallet)给它一个音头, 听感上 pad 自己有了棱角,其实音头来自另一件。反过来,一个太硬的音头可以叠一层慢起音把它"化开"。
这是"为什么两层叠起来比各自好听"最常见的机理之一。写进规格单时把它当一个明确的决定:
roster[].note 写清"这一层是给谁补音头的"。
同一体系里还有一条与音色有关的:心理力度的高点不一定是物理响度的高点(p0283–0284)。 旋律的顶音或骨架音,即使力度在往下走,也常用另一件音色叠上去强调它。柏辽兹在 ppp 处给顶音叠圆号就是这个意思。 做音色层时,给"要被听见的那个点"预留一件能叠上去的音色,比整体推力度有效。
4. 雕刻模型:减法合成在干什么
作者把音色设计比作雕刻(p0037):
| 雕刻 | 合成器 |
|---|---|
| ① 挑选素材(木材、石材) | 选择波形 |
| ② 选用复合素材 | 使用多组振荡器 |
| ③ 从庞大原型中削去想舍弃的区块 | 以滤波器截除不要的泛音 |
| ④ 需要的部分修补强化 | RESONANCE 凸显指定频段,或用 FM / OSC SYNC / RING MOD 制造新泛音 |
而 EG 和 LFO 制造时间上的变化,近似逐格拍摄的黏土动画 (p0037)。
这个模型的用处:它把"加效果器"从流程里排除了。 ④ 的四种手段全都在合成器内部——先在音源里把音色做对,再考虑效果器。
5. 滤波器选型
| 类型 | 做什么 (p0037–0038) |
|---|---|
| 低通 LPF | 从声音顶端(高频泛音)开始截除 |
| 高通 HPF | 从最下方的根基(低频)开始截除 |
| 带通 BPF | 只保留想要的部分,上下皆截除 |
| 凹口 Notch | 只截除指定部分,上下皆保留 |
| 梳状 Comb | 像梳子刷过,留下条纹状结果 |
合成器音色设计中九成以上用低通——因为合成器预设波形的泛音含量通常比普通乐器多, 需要削去高频泛音 (p0038)。
所以:不确定用哪个就用低通。用到 Notch 或 Comb 时,要说得出为什么。
6. ★ 差音:为什么纯正弦贝斯会消失
这是一条心理声学的硬约束,不是品味问题。
差音(difference tone):即使听不见基音,大脑也会从泛音推断出基音。 例如同时听见 300 Hz 和 400 Hz,大脑会自动补上最大公约数 100 Hz, 让人误以为听见了 100 Hz 的声音 (p0127)。
但——"正弦波完全不含可当做判断依据的泛音,因此自然就不会产生听觉错误" (p0127)。
后果:一个纯正弦贝斯在监听音箱上很好,在手机、笔记本、蓝牙音箱上直接不存在。 因为那些设备放不出基音,而正弦波没留下任何让大脑推断基音的线索。
两条路 (p0127):
- 补足泛音,制造可产生听觉错误的声音 ← 几乎总是选这条
- 以大型舞厅/音乐厅等能播超低音的环境为前提,放弃一般的视听环境
补足泛音的两种做法
其一:移调叠加 (p0127) 复制同样的演奏到另一轨,TRANSPOSE 到高八度、或高八度再加完全五度,略微混合。
"补上多个泛音也颇具效果,不过要是补太多会失去『正弦波的质感』, 因此目标可放在听得到又听不太到的程度" (p0127)。
其二:破音(推荐初学者,效果较自然)(p0127) 插入破音效果器制造微妙的效果。
"若辨别得出破音就表示加过头了" (p0127)。
路由法:正弦贝斯经 Bus 送到 AUX 轨,在 AUX 上加破音再回送混合; 破音量太小的话,先在 AUX 上 low cut,这样不会干扰原音 (p0128)。
自检动作:任何以正弦波/极暗音色为低频主体的编曲, 必须在手机外放上验证一遍。这是本 skill 唯一一条要求实际听设备的检查。
7. 与 ARR-SPEC / 各后端的对应
音色在 ARR-SPEC 里落在 roster[].instrument(抽象选择)、roster[].timbre(给文本后端)
和 roster[].synth_params(给参数后端)上。
同一份描述要能被三类后端消费,所以写法有讲究:
| 后端 | 怎么消费 | 写法要求 |
|---|---|---|
| Suno / MiniMax(文本提示) | 只认自然语言 | 用可听感的形容:材质、年代、参照乐器。不要写 CUTOFF 数值 |
| YuE2(文本+条件) | 同上,可带段落级差异 | 同上,但可以逐段不同 |
| MIDI / MusicXML → DAW | 认参数 | roster[].synth_params 写四问的答案与关键旋钮 |
写法示例(同一个音色的两种投影):
- 文本后端:
warm analog saw bass, slightly detuned, short attack, filter opens over 2 bars - 参数后端:
{osc: saw×2 detune 8c, filter: LP24 cutoff 320Hz, FEG amount +40 decay 900ms, amp: A0 D200 S0.7 R120}
这两条必须同源——从四问的答案生成,而不是分别编。 不同源就会出现"文本后端和 MIDI 后端听起来是两首歌"。
8. 写完后必过
- 每个设计过的音色都答过四问,答案写下来了
- 从零点出发;若从预设改,说得出改了哪几处
- 音域是先定的,不是最后调的
- 用了非低通滤波器的地方,说得出为什么
- ④ 的泛音增强优先在音源内部做(FM/SYNC/RING/RESO),不是先挂效果器
- 低频主体若是正弦波/极暗音色,补了泛音,并在手机外放验证过
- roster 的音色描述同时给出了文本版和参数版,且两者同源
- 音色是在乐句上下文里试的,不是独奏试听定的
附:来源
野崎貴朗《圖解合成器音樂創作法》——§1–§6 全部主干 (24 音色設計的定理、25 從初始設定開始、09 濾波器①、36 正弦波貝斯/差音)。页码为该书页。
各风格的具体音色配方(电音放克粗犷贝斯、Detroit techno、IDM、Electro House、 嘻哈肥厚贝斯、R&B 抒情、鼓打贝斯等 10+ 种)整理在 reference.md。
竹内一弘《EDM 制作》的 EQ/压缩章节不在本 skill——归
mc-mix-intent与出库混音库。差音的声学原理另见 Howard & Angus《音乐声学与心理声学》(缺失基频 / missing fundamental)。