Skip to main content
QUICK REVIEW

[论文解读] Can GAN originate new electronic dance music genres? -- Generating novel rhythm patterns using GAN with Genre Ambiguity Loss

Nao Tokui|arXiv (Cornell University)|Nov 25, 2020
Music and Audio Processing参考文献 16被引用 5
一句话总结

本文提出 Creative-GAN,一种扩展的 GAN 框架,可生成训练数据中不存在任何流派的新型电子舞曲节奏模式。通过引入通过次级判别器实现的流派模糊性损失,生成器被激励产生在风格上截然不同但音乐上连贯的节奏模式,展示了 GAN 在超越模仿之外创造全新音乐流派方面的潜力。

ABSTRACT

Since the introduction of deep learning, researchers have proposed content generation systems using deep learning and proved that they are competent to generate convincing content and artistic output, including music. However, one can argue that these deep learning-based systems imitate and reproduce the patterns inherent within what humans have created, instead of generating something new and creative. This paper focuses on music generation, especially rhythm patterns of electronic dance music, and discusses if we can use deep learning to generate novel rhythms, interesting patterns not found in the training dataset. We extend the framework of Generative Adversarial Networks(GAN) and encourage it to diverge from the dataset's inherent distributions by adding additional classifiers to the framework. The paper shows that our proposed GAN can generate rhythm patterns that sound like music rhythms but do not belong to any genres in the training dataset. The source code, generated rhythm patterns, and a supplementary plugin software for a popular Digital Audio Workstation software are available on our website.

研究动机与目标

  • 探究 GAN 是否能够生成不仅逼真且风格新颖、且不属于训练数据中任何已知电子舞曲流派的节奏模式。
  • 通过修改训练目标以鼓励与现有流派分布的差异,解决标准 GAN 在生成真正原创内容方面的局限性。
  • 通过将训练好的模型集成到 DAW 插件中,为音乐制作人开发实用工具,实现实时节奏生成。
  • 探索微节拍在增强生成节奏的表现力和“律动感”方面的作用,为模型未来扩展提供方向。

提出的方法

  • 通过引入第二个判别器 $D_{\text{genre}}$ 扩展标准 GAN 框架,用于分类生成节奏模式的流派。
  • 引入流派模糊性损失项,惩罚高置信度的流派预测,当流派分类输出呈均匀分布(即模糊)时最小化该损失。
  • 使用包含对抗性损失和流派模糊性损失的联合损失函数,对抗性地训练生成器,使其同时欺骗真实/虚假判别器 ($D_r$) 和流派分类器 ($D_{\text{genre}}$)。
  • 将独热编码的流派标签作为输入提供给生成器,以实现具有特定流派特征的条件节奏模式生成。
  • 将节奏模式表示为 16 分音符分辨率的二值触发矩阵,并在涵盖多种流派的多样化电子舞曲节奏数据集上训练模型。
  • 使用 TensorFlow.js 实现 Max for Live 插件,以部署预训练的生成器,实现在 Ableton Live 内部的实时节奏模式生成。

实验结果

研究问题

  • RQ1基于 GAN 的模型能否生成在音乐上连贯但不属于训练数据中已知电子舞曲流派的节奏模式?
  • RQ2通过次级判别器强制实现流派模糊性,是否能促使生成器在节奏空间中探索新颖、未被探索过的风格区域?
  • RQ3生成节奏的统计特性与真实训练数据相比如何,特别是在触发分布和节奏复杂度方面?
  • RQ4尽管未对新颖性施加显式监督,该方法能否生成被人类听者感知为新颖且富有创意的节奏模式?
  • RQ5微节拍信息在多大程度上能增强生成节奏的真实感和表现力?如何将其整合到 GAN 框架中?

主要发现

  • Creative-GAN 模型成功生成了在统计上与训练数据中所有流派均不同的节奏模式,经由与训练样本的平均距离度量得到验证。
  • 生成模式与训练数据之间的平均距离显著高于基线随机生成结果,表明该模型避免了简单的重复或插值。
  • 流派模糊性损失有效降低了流派分类的置信度,次级判别器输出接近均匀的概率分布,证实模型避免为生成样本分配明确的流派标签。
  • 生成模式的平均触发矩阵与训练数据在结构上存在差异,特别是在节奏密度和触发聚集方面,表明存在新颖的节奏组织方式。
  • 初步结果显示,引入微节拍信息可提升流派分类器的性能,表明微节拍增强了风格的表现力。
  • 成功实现了功能完整的 Ableton Live 插件,实现在专业 DAW 环境中实时生成新颖节奏模式,验证了该模型的实际适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。