Skip to main content
QUICK REVIEW

[论文解读] GANs & Reels: Creating Irish Music using a Generative Adversarial Network.

Antonina Kolokolova, Mitchell Billard|arXiv (Cornell University)|Oct 29, 2020
Music Technology and Sound Studies参考文献 20被引用 7
一句话总结

本论文提出一种非循环、卷积神经网络生成对抗网络(DCGAN),结合空洞卷积与多尺度分支结构,用于生成固定长度的爱尔兰传统舞曲,且不使用循环组件。通过将旋律转换为二维空间表征,模型能够捕捉长程音乐依赖关系与全局结构,生成的样本在乐句相似性、音符分布及t-SNE聚类方面均优于RNN基线模型,与训练数据更为接近。

ABSTRACT

In this paper we present a method for algorithmic melody generation using a generative adversarial network without recurrent components. Music generation has been successfully done using recurrent neural networks, where the model learns sequence information that can help create authentic sounding melodies. Here, we use DC-GAN architecture with dilated convolutions and towers to capture sequential information as spatial image information, and learn long-range dependencies in fixed-length melody forms such as Irish traditional reel.

研究动机与目标

  • 开发一种非循环深度学习模型,用于生成如爱尔兰舞曲般具有结构化的固定长度旋律。
  • 用空间化的二维音乐表征替代循环组件,以更好地捕捉长程依赖关系。
  • 评估是否一种结合空洞卷积与多尺度分支结构的DCGAN能够达到或超越基于RNN的旋律生成模型在结构连贯性与音乐真实性方面的表现。
  • 评估模型学习并再现全局音乐结构(如乐句重复、变体形式与以主音为中心的音符分布)的能力。

提出的方法

  • 将单音旋律转化为二维空间表征,其中横轴表示序列,纵轴表示乐句的时间对齐。
  • 采用深度卷积生成对抗网络(DCGAN)架构,并引入空洞卷积,以在多个语义尺度(如小节与乐句长度)上捕捉长程依赖关系。
  • 在判别器中引入多尺度分支结构与空洞卷积,以同时建模局部音符模式与全局结构关系。
  • 对乐句嵌入之间的弗雷chet距离进行归一化,以定量比较生成样本、训练数据与基线模型样本之间的结构相似性。
  • 使用困惑度=50的t-SNE可视化方法,比较生成曲目的分布相似性与训练数据及RNN基线模型的差异。
  • 分析MIDI音高值的音符频率分布,以评估对主音中心的遵循程度与调式符合度。

实验结果

研究问题

  • RQ1基于CNN的非循环GAN是否能有效生成如爱尔兰舞曲般具有结构化的固定长度旋律,且无需使用循环组件?
  • RQ2与RNN相比,判别器中使用空洞卷积与多尺度分支结构在捕捉长程音乐依赖关系方面表现如何?
  • RQ3生成的旋律在多大程度上保留了全局结构特征,如乐句重复(AABB格式)、主音强调与以主音为中心的音符分布?
  • RQ4基于弗雷chet距离与t-SNE可视化,生成样本在分布相似性上与训练数据及RNN基线模型相比如何?

主要发现

  • 所提出的DCGAN模型生成的旋律,其乐句间归一化弗雷chet距离与训练数据及Folk-RNN基线模型高度一致,表明具有出色的结构保真度。
  • t-SNE可视化显示,超过75%的DCGAN生成曲目位于训练数据的分布范围内,表明其具有极高的分布相似性。
  • 该模型成功再现了以主音为中心的音符分布,其中主音(D大调中的D)及三度与五度音程最为常见,与音乐理论及训练数据一致。
  • 与Magenta模型相比,后者表现出更均匀的音符频率分布,而DCGAN与Folk-RNN模型则生成了与D大调中预期音高层级相符的音符分布。
  • 该模型表现出更强的AABB乐句结构倾向(即重复部分),表现为乐句3–4之间弗雷chet距离较低,而乐句1–3之间距离较高,证实了结构的一致性。
  • 即使模型参数更小,DCGAN在捕捉局部音符模式与全局结构关系方面,仍达到或优于RNN基线模型的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。