Skip to main content
QUICK REVIEW

[论文解读] Generating Black Metal and Math Rock: Beyond Bach, Beethoven, and Beatles

Zack Zukowski, Cameron Carr|arXiv (Cornell University)|Nov 16, 2018
Music and Audio Processing参考文献 5被引用 13
一句话总结

本文提出一种基于深层多层SampleRNN与LSTM单元的原始音频生成方法,用于合成黑金属和数学摇滚等复杂现代音乐流派。通过在16kHz采样率的原始FLAC音频全专辑上进行训练,该模型能够生成具有流派特异性特征的音乐——如突兀的段落转换、非对称拍号和复杂的音色质感,证明了神经音频合成能够捕捉当代音乐风格中超越传统符号化音乐建模的声学复杂性。

ABSTRACT

We use a modified SampleRNN architecture to generate music in modern genres such as black metal and math rock. Unlike MIDI and symbolic models, SampleRNN generates raw audio in the time domain. This requirement becomes increasingly important in modern music styles where timbre and space are used compositionally. Long developmental compositions with rapid transitions between sections are possible by increasing the depth of the network beyond the number used for speech datasets. We are delighted by the unique characteristic artifacts of neural synthesis.

研究动机与目标

  • 开发一种神经音频生成模型,能够合成依赖于音色与空间编排的现代复杂音乐流派,如黑金属与数学摇滚。
  • 超越符号化音乐建模(如MIDI)的局限,直接在时域生成原始音频,以保留细微的声学特征。
  • 探究深层分层SampleRNN架构是否能够学习并再现非功能调性体系的当代音乐流派在结构与音色上的复杂性。
  • 探索神经合成伪影(如幽灵般的 vocal 层次与超现实的音色混合)作为创意工具的美学潜力。

提出的方法

  • 将原始FLAC音频预处理为8秒片段,采样率为16kHz,进行随机打乱,并采用88/6/6的训练/验证/测试集划分。
  • 采用双层SampleRNN架构,嵌入维度为256,隐层维度为1024,网络深度为5–9层,使用256级线性量化进行原始音频生成。
  • 使用带有遗忘门偏置初始化为3的LSTM单元,并采用随机或可学习的初始隐藏状态(h0),以提升生成多样性。
  • 将argmax推理修改为从softmax输出分布中进行随机采样,以增强音频变化性并避免模式崩溃。
  • 在NVIDIA K80 GPU上训练3–5天,采用权重归一化与跳跃连接,每检查点生成10段30秒的音频片段。
  • 通过听觉检查评估模型质量,避免选择仅产生白噪声或陷入重复riff的检查点。

实验结果

研究问题

  • RQ1在全专辑原始音频上进行训练的原始音频生成模型,能否生成在音乐连贯性与风格准确性上均符合黑金属与数学摇滚特征的音乐?
  • RQ2将SampleRNN架构进一步加深(超过语音特定的深度)对生成具有突兀段落转换的复杂长时音乐结构有何影响?
  • RQ3训练数据中音色一致性与统一混音/母带处理在多大程度上提升了模型泛化与音乐创意组合的能力?
  • RQ4推理阶段的采样策略(如softmax采样与argmax)在避免模式崩溃与增强音乐多样性方面发挥何种作用?
  • RQ5神经合成固有的伪影如何为生成音乐带来新颖的美学特质?

主要发现

  • 在Krallice全专辑上训练的5层LSTM模型成功生成了与原始黑金属风格高度相似的音频,包括氛围化音效、颤音 picking 吉他与深沉嘶吼。
  • 在《Room For A Ghost》专辑上训练的7层LSTM模型生成了一段六分钟的音乐,包含突兀的段落转换、非对称拍号与长休止,成功将原曲转化为数学摇滚风格。
  • 基于GRU的模型未能学习音频模式,仅产生刺耳噪声,而LSTM模型表现成功,表明模型架构对流派复杂性的敏感性。
  • 通过随机化初始隐藏状态(h0)显著提升了生成多样性并减少了重复,表明其在避免模式崩溃中的关键作用。
  • 在检查点处间歇性生成音频显示,模型学习过程从泛化的音色纹理逐步发展为有结构的riff与段落转换,表明其具有渐进式学习能力。
  • 模型生成了独特的美学伪影,如幽灵般的vocal层次与超现实的音色混合,显著增强了超越真实模仿的创意潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。