Skip to main content
QUICK REVIEW

[论文解读] Polyphonic Music Generation with Sequence Generative Adversarial Networks

Sang-gil Lee, Uiwon Hwang|arXiv (Cornell University)|Oct 31, 2017
Music Technology and Sound Studies被引用 8
一句话总结

本文提出了一种基于SeqGAN的方法,通过将MIDI序列编码为紧凑的词向量表示,以捕捉持续时间、音高、八度和和弦信息,实现对多音音乐的生成。该方法利用RNN生成连贯的音乐序列,通过对抗性训练提升了音乐性和BLEU分数,表明精心设计的强化学习信号优化对性能至关重要。

ABSTRACT

We propose an application of sequence generative adversarial networks (SeqGAN), which are generative adversarial networks for discrete sequence generation, for creating polyphonic musical sequences. Instead of a monophonic melody generation suggested in the original work, we present an efficient representation of a polyphony MIDI file that simultaneously captures chords and melodies with dynamic timings. The proposed method condenses duration, octaves, and keys of both melodies and chords into a single word vector representation, and recurrent neural networks learn to predict distributions of sequences from the embedded musical word space. We experiment with the original method and the least squares method to the discriminator, which is known to stabilize the training of GANs. The network can create sequences that are musically coherent and shows an improved quantitative and qualitative measures. We also report that careful optimization of reinforcement learning signals of the model is crucial for general application of the model.

研究动机与目标

  • 通过同时建模旋律和和弦,将SeqGAN从单音音乐生成扩展到多音音乐生成。
  • 设计一种高效、低预处理的多音MIDI词向量表示,编码持续时间、音高类、八度和和弦信息。
  • 通过对抗性训练使用GAN提升生成序列的音乐连贯性和真实感。
  • 研究强化学习信号优化对离散序列生成中序列质量的影响。
  • 使用定量(BLEU)和定性(MOS)指标评估模型,以评估感知质量。

提出的方法

  • 将多音MIDI序列表示为词向量,将音符持续时间、音高类、八度和和弦信息编码为单一嵌入。
  • 使用基于RNN的生成器从嵌入的音乐词空间中预测序列,通过策略梯度强化学习进行训练。
  • 使用CNN实现判别器,以区分真实与生成的序列,为生成器提供对抗性奖励。
  • 应用标准GAN和最小二乘GAN(LSGAN)损失函数,以稳定训练并改善收敛性。
  • 使用蒙特卡洛滚动预测(rollout)与滚动策略估计奖励信号,用于策略梯度更新,减少暴露偏差。
  • 在对抗性微调前,使用负对数似然(NLL)损失对生成器进行预训练,以提升初始策略质量。

实验结果

研究问题

  • RQ1SeqGAN能否有效适应生成包含旋律和和弦的音乐连贯的多音序列?
  • RQ2所提出的MIDI序列词向量表示如何影响模型学习动态节拍和和声结构的能力?
  • RQ3与NLL预训练相比,使用GAN的对抗性训练是否能提升生成音乐的感知质量和多样性?
  • RQ4强化学习信号优化在离散序列生成成功中的作用是什么?
  • RQ5BLEU等定量指标在多大程度上与人类感知(MOS)相关,可用于评估音乐生成模型?

主要发现

  • 与NLL预训练模型相比,使用SeqGAN的对抗性训练显著提升了定量(BLEU分数)和定性(MOS)性能。
  • 对抗性训练模型生成的序列表现出更长距离的和声一致性以及更连贯的和弦进行,而NLL预训练模型则产生重复性高、聚焦于短期模式的输出。
  • 通过对抗性训练,模型实现了更高的BLEU分数,但部分情况下分数仍低于0.2,表明仍有改进空间。
  • 使用最小二乘GAN(LSGAN)损失有助于稳定训练并减少模式崩溃,相比标准GAN更具优势。
  • 强化学习信号表现出高方差,需要多次训练才能获得可重现的性能提升。
  • 人工评估(MOS)证实,对抗性训练生成的样本在感知上更真实、音乐性更强,优于NLL预训练样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。