Skip to main content
QUICK REVIEW

[论文解读] Generating Albums with SampleRNN to Imitate Metal, Rock, and Punk Bands

Cameron Carr, Zack Zukowski|arXiv (Cornell University)|Jun 25, 2018
Music and Audio Processing参考文献 11被引用 10
一句话总结

本文提出使用无条件 SampleRNN 通过单一专辑的原始音频进行训练,以生成金属、摇滚和朋克风格的完整专辑,实现自回归、时域音频生成。该方法可生成音乐连贯的曲目、专辑封面和标题,人工筛选显著提升了完全自动化生成的可听性与多样性。

ABSTRACT

This early example of neural synthesis is a proof-of-concept for how machine learning can drive new types of music software. Creating music can be as simple as specifying a set of music influences on which a model trains. We demonstrate a method for generating albums that imitate bands in experimental music genres previously unrealized by traditional synthesis techniques (e.g. additive, subtractive, FM, granular, concatenative). Raw audio is generated autoregressively in the time-domain using an unconditional SampleRNN. We create six albums this way. Artwork and song titles are also generated using materials from the original artists' back catalog as training data. We try a fully-automated method and a human-curated method. We discuss its potential for machine-assisted production.

研究动机与目标

  • 探索在黑金属、数学摇滚和滑板朋克等研究不足的现代音乐流派中,原始音频的神经合成。
  • 开发一种仅使用原始音频和极少监督信号,即可生成完整专辑(包括音乐、标题和封面)的方法。
  • 比较完全自动化与人工筛选生成工作流程在音乐质量与听众参与度方面的差异。
  • 探究神经合成在机器辅助音乐制作及新型数字音频工作站中的潜力。
  • 评估无条件自回归模型在捕捉长期音乐结构方面的能力局限,同时保持短期音色与节奏保真度。

提出的方法

  • 在单张专辑的原始音频上训练无条件 SampleRNN,以建模短时音频模式,如音色、演奏法和军鼓击打。
  • 将音频分割为8秒重叠的FLAC片段,其中88%用于训练,6%用于测试,6%用于验证。
  • 使用截断的时间反向传播训练模型进行样本级预测,聚焦于局部音频特征。
  • 通过自回归采样生成大量音频、标题和封面,随后从输出中选择或筛选内容。
  • 应用人工筛选流程,选择并编辑曲目,包括重复使用动机和对齐多层鼓组以实现立体声成像。
  • 使用基于原始艺术家元数据训练的马尔可夫链生成歌曲标题和封面,确保风格一致性。

实验结果

研究问题

  • RQ1无条件 SampleRNN 是否能在无符号表示的情况下,生成在朋克和金属等现代子流派中具有音乐连贯性的专辑?
  • RQ2对模型生成内容进行人工筛选,如何影响生成专辑的可听性与结构连贯性?
  • RQ3像 SampleRNN 这类原始音频模型在多大程度上能捕捉现代音乐制作的频谱与动态特征?
  • RQ4自回归、无条件生成在建模长期音乐结构(如吉他段落和歌曲段落)方面存在哪些局限?
  • RQ5如何将神经合成整合到实际音乐制作工作流中,以支持艺术家实现人机协作?

主要发现

  • 该模型仅使用单个源专辑的原始音频,成功生成了六张涵盖金属、朋克和实验摇滚等多种流派的完整专辑。
  • 人工筛选的专辑在可听性与音乐多样性方面显著优于完全自动化生成的版本,后者往往重复且难以吸引听众。
  • 该模型捕捉到了流派特异的音色与节奏特征,如 Battles 的复节奏织体和 NOFX 的旋律唱腔,尽管未对流派或结构进行显式条件控制。
  • 后期训练周期生成了更准确的源乐队音色再现,但伴有别扭的节奏过渡,产生幽默却具有美学吸引力的效果。
  • 模型生成的无意义歌词激发了粉丝制作的“误听歌词”视频,表明其在技术保真度之外具有文化与美学共鸣。
  • 本研究凸显了神经合成在推动新型数字音乐乐器与协作工作流方面的潜力,尤其在结合人工筛选时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。