Skip to main content
QUICK REVIEW

[论文解读] PIANOTREE VAE: Structured Representation Learning for Polyphonic Music

Ziyu Wang, Yiyi Zhang|arXiv (Cornell University)|Aug 17, 2020
Music and Audio Processing参考文献 39被引用 21
一句话总结

PIANOTREE VAE 提出了一种分层树状结构变分自编码器,用于钢琴音乐的表征学习,通过乐谱、同时音符(simu_note)和单个音符的嵌套语法来建模音乐。与基于 MIDI 事件或标准 VAE 的基线模型相比,该方法实现了语义上更有意义的潜在编码、更优的重构效果以及更出色的下游音乐生成性能。

ABSTRACT

The dominant approach for music representation learning involves the deep unsupervised model family variational autoencoder (VAE). However, most, if not all, viable attempts on this problem have largely been limited to monophonic music. Normally composed of richer modality and more complex musical structures, the polyphonic counterpart has yet to be addressed in the context of music representation learning. In this work, we propose the PianoTree VAE, a novel tree-structure extension upon VAE aiming to fit the polyphonic music learning. The experiments prove the validity of the PianoTree VAE via (i)-semantically meaningful latent code for polyphonic segments; (ii)-more satisfiable reconstruction aside of decent geometry learned in the latent space; (iii)-this model's benefits to the variety of the downstream music generation.

研究动机与目标

  • 为解决钢琴音乐缺乏有效的无监督表征学习方法的问题,因其结构更复杂、维度更高,相较于单音音乐更具挑战性。
  • 设计一种深度生成模型,以整合钢琴音乐的分层语法,例如同时音符与其时间分组之间的关系。
  • 通过在 VAE 架构中嵌入归纳偏置(特别是稀疏性和分层结构),改进表征学习。
  • 证明结构化潜在表征能够带来更优的下游音乐生成性能,并在潜在空间中实现更具可解释性的插值。

提出的方法

  • 该模型采用树状结构,其中每个节点代表一个音乐元素:乐谱、simu_note(同时音符)或单个音符,节点间具有分层的父子关系。
  • 每个节点通过循环神经网络进行嵌入,实现子节点向父节点的编码或父节点向子节点的解码,从而支持双向信息传递。
  • 模型采用变分自编码器框架,结合分层先验与后验分布,学习能够捕捉音乐语义的结构化潜在空间。
  • 通过将钢琴音乐建模为稀疏事件序列,利用音乐输入中的稀疏性,减少冗余并提升训练效率。
  • 该架构支持分层的编码与解码,可在音乐抽象的不同层次上实现重构与生成。
  • 潜在编码由分层结构上后验分布的均值导出,用于下游的生成与插值任务。

实验结果

研究问题

  • RQ1在钢琴音乐结构复杂、维度高的前提下,分层 VAE 架构能否有效学习到有意义且解耦的表征?
  • RQ2与标准 VAE 或事件序列模型相比,引入稀疏性和分层语法等归纳偏置是否能提升音乐重构与生成的质量?
  • RQ3所学习的潜在表征在多大程度上支持潜在空间中平滑且语义上合理的插值过渡?
  • RQ4在下游音乐生成任务中,PianoTree VAE 的结构化表征与基于 MIDI 事件或 simu_note 嵌入的表征相比表现如何?
  • RQ5该模型能否在长期音乐生成中实现更好的连贯性与创造性?

主要发现

  • 主观评估验证了 PianoTree VAE 为钢琴音乐片段生成了语义上合理的潜在编码,尤其体现在插值质量方面。
  • 与基线模型相比,该模型在潜在空间中表现出更一致的几何结构,重构质量更优。
  • 主观评估显示,PianoTree VAE 生成的插值在音乐性和过渡平滑度方面显著优于基线模型。
  • 在下游音乐生成任务中,使用潜在向量(z)和 simu_note 嵌入的生成结果,在创造力、自然度和音乐性方面显著优于基于 MIDI 事件标记的生成(p < 0.005)。
  • 使用潜在向量 z 进行长时序生成时,产生的作品比使用 MIDI 事件或 simu_note 表征的版本更具多样性与连贯性,后者往往重复模式。
  • 该模型支持通过潜在向量表示实现 16 小节乐曲的迭代生成,且在结构连贯性方面表现更优,尤其当使用潜在向量时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。