Skip to main content
QUICK REVIEW

[论文解读] A Hierarchical Recurrent Neural Network for Symbolic Melody Generation

Jian Wu, Changran Hu|arXiv (Cornell University)|Dec 14, 2017
Music and Audio Processing参考文献 21被引用 10
一句话总结

该论文提出了一种分层循环神经网络(HRNN)用于符号旋律生成,采用三层堆叠的长短期记忆网络(LSTM)——小节层、拍子层和音符层——以粗到细的方式生成音乐。在人类评估中,该模型在性能上优于单层LSTM以及当前最先进的模型(如MusicVAE和MidiNet),在与MusicVAE的对比中,72.6%的比较结果偏好HRNN-3L;在与MidiNet的对比中,77.9%的比较结果偏好HRNN-3L。

ABSTRACT

In recent years, neural networks have been used to generate symbolic melodies. However, the long-term structure in the melody has posed great difficulty for designing a good model. In this paper, we present a hierarchical recurrent neural network for melody generation, which consists of three Long-Short-Term-Memory (LSTM) subnetworks working in a coarse-to-fine manner along time. Specifically, the three subnetworks generate bar profiles, beat profiles and notes in turn, and the output of the high-level subnetworks are fed into the low-level subnetworks, serving as guidance for generating the finer time-scale melody components in low-level subnetworks. Two human behavior experiments demonstrate the advantage of this structure over the single-layer LSTM which attempts to learn all hidden structures in melodies. Compared with the state-of-the-art models MidiNet and MusicVAE, the hierarchical recurrent neural network produces better melodies evaluated by humans.

研究动机与目标

  • 为解决在符号旋律生成中建模长期结构依赖性的挑战。
  • 通过在多个时间尺度(小节、拍子、音符)显式建模节奏结构,提升旋律生成质量。
  • 通过基于高层节奏轮廓进行条件控制,降低学习长期音符级依赖性的难度。
  • 评估分层建模是否能生成比单层RNN及当前最先进模型更具音乐连贯性且更受人类偏好的旋律。
  • 研究分层设计对生成具有真实长期结构旋律的影响。

提出的方法

  • 该模型采用三级分层LSTM架构:小节级、拍子级和音符级子网络。
  • 小节级LSTM生成小节轮廓,用以引导拍子级LSTM生成拍子轮廓。
  • 音符级LSTM在同时接收小节和拍子轮廓的条件下生成单个音符,确保结构连贯性。
  • 每一层更高层级的网络为下一层提供上下文条件,实现从粗到细的生成过程。
  • 模型在符号音乐数据上进行端到端训练,每小节设定为16个量化时间步,时间 signature 为4/4。
  • 通过2AFC(二选一强制选择)测试进行人类评估,将生成的旋律与基线模型进行对比。

实验结果

研究问题

  • RQ1分层RNN架构是否能比单层RNN更好地建模长期音乐结构?
  • RQ2在高层节奏轮廓(小节和拍子)条件下进行音符级生成,是否能提升旋律质量和连贯性?
  • RQ3HRNN与当前最先进模型(如MusicVAE和MidiNet)相比,在人类偏好研究中表现如何?
  • RQ4HRNN在音乐图灵测试中,能多大程度上生成出与人类创作作品难以区分的旋律?
  • RQ5数据限制(如时间签名、节奏编码)对模型性能和泛化能力有何影响?

主要发现

  • HRNN-3L在与同一数据集上训练的MusicVAE对比中,获得了72.6%的偏好率(p = 1.41×10⁻²¹),表明人类偏好具有统计显著性。
  • HRNN-3L在与微调后的MusicVAE对比中,获得了63.5%的偏好率(p = 5.82×10⁻⁹),显示出在人类评估中的一致优越性。
  • HRNN-3L在2AFC对比中,对MidiNet的偏好率达到77.9%(p = 1.85×10⁻²¹),表明其在与领先架构对比中表现强劲。
  • 人类评估和MusicVAE输出中观察到的杂乱音符模式减少,表明该模型生成的旋律具有更连贯的节奏和结构。
  • 在音乐图灵测试中,仅有33.69%的HRNN生成旋律被误认为是人类创作,表明尽管性能出色,仍存在改进空间。
  • 研究发现,数据质量显著影响模型性能,因为仅有74.95%的人类创作作品被正确分类为人类创作,限制了模型的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。