Skip to main content
QUICK REVIEW

[论文解读] Learning and Evaluating Musical Features with Deep Autoencoders

Mason Bretan, Sageev Oore|arXiv (Cornell University)|Jun 14, 2017
Music and Audio Processing参考文献 2被引用 5
一句话总结

本文提出使用深度自编码器,从符号化钢琴卷帘数据中学习四拍音乐片段的连续、低维嵌入表示。通过在去噪、上下文重建、前向预测和作曲家辨识等任务上进行训练,该模型在前向预测和作曲家分类任务中均达到当前最优性能,其中上下文重建和正则化模型表现最佳。

ABSTRACT

In this work we describe and evaluate methods to learn musical embeddings. Each embedding is a vector that represents four contiguous beats of music and is derived from a symbolic representation. We consider autoencoding-based methods including denoising autoencoders, and context reconstruction, and evaluate the resulting embeddings on a forward prediction and a classification task.

研究动机与目标

  • 开发一种可扩展的连续音乐表示方法,避免依赖于流派或作曲家等离散标签。
  • 评估所学习的嵌入表示是否能够支持音乐核心任务,如预测与分类。
  • 比较多种基于自编码器的训练目标,以学习具有音乐意义的表示。
  • 探究辅助任务(如作曲家辨识)是否能提升所学嵌入表示的质量。

提出的方法

  • 使用每拍ticks数实现时间精度,将音乐表示为60音高、四拍(四分音符)分辨率的钢琴卷帘。
  • 通过随机删除音符、删除拍点以及八度分裂等方法,使用去噪目标训练深层自编码器,以提升鲁棒性。
  • 通过从周围上下文预测中心四拍片段的方式实现上下文重建。
  • 训练前向预测网络,从先前七个四拍单位预测下一个四拍单位。
  • 训练作曲家辨识网络,将嵌入表示分类为27位作曲家,输出层采用Softmax。
  • 通过联合优化上下文预测与作曲家分类任务,对上下文重建网络施加正则化。

实验结果

研究问题

  • RQ1基于自编码器的方法是否能在不依赖离散标签的前提下,从符号化音乐中学习到有意义的低维嵌入表示?
  • RQ2去噪、上下文重建、前向预测和作曲家辨识等不同训练目标如何影响所学嵌入表示的质量?
  • RQ3将上下文重建与作曲家辨识相结合是否能提升下游任务中嵌入表示的性能?
  • RQ4所学嵌入表示在多大程度上支持音乐生成与分类任务?
  • RQ5在前向预测与作曲家分类任务中,嵌入表示的性能表现如何比较?

主要发现

  • 上下文重建自编码器在前向预测任务中表现最佳,中位排名为1000名中的第15名。
  • 通过作曲家辨识训练的模型在作曲家分类任务中取得最高Macro-F1分数0.76,显著优于其他方法。
  • 正则化后的上下文重建模型在预测任务中中位排名为30,Macro-F1分数为0.66,表现出任务间更好的平衡性。
  • 所有模型的排名分布均显著不同(Bonferroni校正后p < 0.00037),表明其性能特征各不相同。
  • 各模型的排名分布范围存在显著差异(Levene检验p < 0.001),表明预测一致性存在差异。
  • 前向预测模型的分布范围最小(47),偏度最高(4.0),表明其预测结果中存在更多极端异常值,相较于其他模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。