Skip to main content
QUICK REVIEW

[论文解读] dMelodies: A Music Dataset for Disentanglement Learning

Ashis Pati, Siddharth Gururani|arXiv (Cornell University)|Jul 29, 2020
Music and Audio Processing参考文献 42被引用 4
一句话总结

本文提出 dMelodies,一个包含 130 万条两小节单音旋律的大型符号音乐数据集,包含九个解耦的潜在因子(序数、类别、二值)。该数据集可支持音乐领域解耦算法的基准测试,揭示出在图像数据集(如 dSprites)上表现良好的方法在音乐数据上表现欠佳,凸显了领域特异性挑战,并强调了开展音乐专属解耦研究的必要性。

ABSTRACT

Representation learning focused on disentangling the underlying factors of variation in given data has become an important area of research in machine learning. However, most of the studies in this area have relied on datasets from the computer vision domain and thus, have not been readily extended to music. In this paper, we present a new symbolic music dataset that will help researchers working on disentanglement problems demonstrate the efficacy of their algorithms on diverse domains. This will also provide a means for evaluating algorithms specifically designed for music. To this end, we create a dataset comprising of 2-bar monophonic melodies where each melody is the result of a unique combination of nine latent factors that span ordinal, categorical, and binary types. The dataset is large enough (approx. 1.3 million data points) to train and test deep networks for disentanglement learning. In addition, we present benchmarking experiments using popular unsupervised disentanglement algorithms on this dataset and compare the results with those obtained on an image-based dataset.

研究动机与目标

  • 解决音乐领域解耦学习中缺乏标准化、多样化数据集的问题,因为目前大多数研究依赖于基于图像的基准。
  • 提供一个系统构建的音乐数据集,其潜在变化因子定义清晰且相互独立,以支持音乐表征学习中的可复现研究。
  • 实现对音乐数据上解耦算法的评估,以检验其在计算机视觉领域之外的泛化能力。
  • 通过在 dMelodies 和 dSprites 上进行基准测试,探究基于图像与基于音乐的解耦方法之间的性能差距。
  • 促进未来针对音乐生成与分析任务的半监督及监督式解耦方法研究。

提出的方法

  • 使用算法规则生成符号音乐数据集,包含两小节的单音旋律,确保九个潜在因子(音高类、八度、时值、节奏、演奏法、力度、调性、拍号、分解和弦方向)之间相互独立。
  • 设计数据集以涵盖多种因子类型:序数(如时值)、类别(如调性)和二值(如分解和弦方向),以支持全面的解耦评估。
  • 构建包含约 130 万个唯一数据点的数据集,可扩展用于训练深度神经网络,以支持解耦学习。
  • 在 dMelodies 和 dSprites 上应用流行的无监督解耦模型——β-VAE、FactorVAE 和带残差连接的 β-VAE,进行对比基准测试。
  • 使用互信息差距(MIG)和重建损失等指标,评估两种数据集上解耦质量与模型保真度。
  • 进行逐因子的解耦性能分析,以识别哪些音乐属性(如节奏、音高)比其他属性(如分解和弦方向)更容易实现解耦。

实验结果

研究问题

  • RQ1在图像数据上训练的最先进无监督解耦算法在符号音乐数据上有多大的泛化能力?
  • RQ2在解耦性能与重建质量方面,解耦模型在基于图像的(dSprites)与基于音乐的(dMelodies)数据集上的表现有何差异?
  • RQ3使用当前深度生成模型,哪些音乐变化因子(如音高、节奏、力度)最易于实现解耦?
  • RQ4与图像领域相比,音乐领域中解耦性能与重建保真度对超参数调优的敏感性如何?
  • RQ5因子类型(类别、序数、二值)以及影响的稀疏性(如分解和弦方向仅影响旋律部分)在解耦性能中起到何种作用?

主要发现

  • 在图像数据集(如 dSprites)上表现良好的解耦方法在 dMelodies 音乐数据集上性能显著下降,表明其跨领域泛化能力差。
  • 在音乐(dMelodies)中,超参数调优对重建与解耦性能的影响远强于在图像(dSprites)中,后者的重建性能在不同超参数设置下保持稳定。
  • β-VAE 模型在 dMelodies 上实现了最高的重建准确率,其中节奏与八度因子的解耦效果最佳,而分解和弦方向表现最差,可能因其二值特性所致。
  • 逐因子 MIG 分析显示,连续且结构化的因子(如音高、时值)比二值或影响稀疏的因子(如分解和弦方向)更容易实现解耦。
  • dSprites 与 dMelodies 之间的性能差距并非仅由数据规模导致,因为两者均包含约 130 万个样本,表明两领域间存在架构或归纳偏置不匹配。
  • 结果强调了在音乐领域发展专用解耦方法的必要性,因为当前无监督方法无法直接从视觉领域迁移至音乐领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。