Skip to main content
QUICK REVIEW

[论文解读] Lead Sheet Generation and Arrangement by Conditional Generative Adversarial Network

Hao-Min Liu, Yi‐Hsuan Yang|arXiv (Cornell University)|Jul 30, 2018
Music and Audio Processing参考文献 21被引用 4
一句话总结

本文提出一种条件生成对抗网络(cGAN)用于伴奏谱编配,通过使用未配对的数据集,从伴奏谱生成音乐上连贯的多乐器编曲。通过引入三种符号领域和声特征——音高钢琴卷帘、音高节拍和和弦钢琴卷帘,模型表现出优越性能,其中和弦钢琴卷帘在用户研究中取得最佳感知效果(整体感觉平均意见分MOS为3.5675)。

ABSTRACT

Research on automatic music generation has seen great progress due to the development of deep neural networks. However, the generation of multi-instrument music of arbitrary genres still remains a challenge. Existing research either works on lead sheets or multi-track piano-rolls found in MIDIs, but both musical notations have their limits. In this work, we propose a new task called lead sheet arrangement to avoid such limits. A new recurrent convolutional generative model for the task is proposed, along with three new symbolic-domain harmonic features to facilitate learning from unpaired lead sheets and MIDIs. Our model can generate lead sheets and their arrangements of eight-bar long. Audio samples of the generated result can be found at https://drive.google.com/open?id=1c0FfODTpudmLvuKBbc23VBCgQizY6-Rk

研究动机与目标

  • 通过将伴奏谱编配作为介于伴奏谱与完整MIDI之间的新任务,填补自动音乐生成中的空白。
  • 通过实现基于未配对数据的条件生成,克服缺乏伴奏谱与MIDI配对数据集的问题。
  • 设计并实现一种循环卷积cGAN架构,用于同时生成伴奏谱及其多乐器编曲。
  • 设计并评估三种符号领域和声特征,以在条件生成中连接伴奏谱与MIDI。
  • 通过在时间生成器中用循环层替代卷积层,改进伴奏谱生成中的时序建模。

提出的方法

  • 提出三阶段cGAN模型:伴奏谱生成、特征提取与编曲生成,均采用条件监督。
  • 使用条件GAN生成五轨钢琴卷帘(旋律、钢琴、吉他、弦乐、低音),条件为伴奏谱。
  • 引入三种和声特征——音高钢琴卷帘、音高节拍和和弦钢琴卷帘,分别从伴奏谱与MIDI中计算,用于跨模态条件控制。
  • 在时间生成器中,用循环层替代标准卷积层,以更好地建模伴奏谱中的重复性模式。
  • 将Dong等人提出的卷积GAN模型适配用于多轨钢琴卷帘生成,分别应用于伴奏谱与编曲生成。
  • 采用对抗损失与感知度量进行端到端训练,并通过客观度量与用户研究进行评估。

实验结果

研究问题

  • RQ1条件生成对抗网络能否有效从未配对的伴奏谱与MIDI数据集中生成音乐上连贯的多乐器编曲?
  • RQ2在符号领域和声表示中,音高钢琴卷帘、音高节拍与和弦钢琴卷帘中哪一种最能保持伴奏谱编配中的和声与节奏结构?
  • RQ3在时间生成器中使用循环层与纯卷积设计相比,如何提升伴奏谱生成质量?
  • RQ4生成的编曲在和声性、节奏性与整体音乐性方面,与人类感知的匹配程度如何?
  • RQ5伴奏谱编配能否作为单音旋律生成与完整多轨MIDI合成之间有意义的中间任务?

主要发现

  • 模型成功生成8小节伴奏谱及其编曲,无空拍,训练稳定,输出质量高。
  • 和弦钢琴卷帘特征在所有感知度量中表现最优,用户研究中整体感觉的平均意见分(MOS)达到3.5675。
  • 音高节拍表示表现欠佳,尽管和声性表现良好,但因时间分辨率损失,尤其在节奏性方面表现较差。
  • 模型在5,000次迭代时达到音高距离(TD)6.69与合格音符比例(QN)0.84,表明与真实伴奏谱统计特征高度一致。
  • 在时间生成器中使用循环层可有效提升对伴奏谱中重复性模式的建模能力,从而增强生成质量。
  • 用户研究结果表明,和声性对整体音乐感觉的影响强于节奏性,这从和弦卷帘与其他特征之间显著的MOS差异中得到证实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。