Skip to main content
QUICK REVIEW

[论文解读] A Deep Bag-of-Features Model for Music Auto-Tagging

Juhan Nam, Jorge Herrera|arXiv (Cornell University)|Aug 20, 2015
Music and Audio Processing参考文献 39被引用 11
一句话总结

该论文提出了一种用于音乐自动标记的两阶段深度词袋模型(Deep-BoF),首先通过无监督受限玻尔兹曼机(RBMs)学习局部频谱模式,然后将这些模式堆叠为分层深度神经网络(DNN),实现端到端的标签预测。该模型在Magnatagatune数据集上取得了最先进性能,所有指标均优于先前方法,包括AUC为0.888,P15为0.190。

ABSTRACT

Feature learning and deep learning have drawn great attention in recent years as a way of transforming input data into more effective representations using learning algorithms. Such interest has grown in the area of music information retrieval (MIR) as well, particularly in music audio classification tasks such as auto-tagging. In this paper, we present a two-stage learning model to effectively predict multiple labels from music audio. The first stage learns to project local spectral patterns of an audio track onto a high-dimensional sparse space in an unsupervised manner and summarizes the audio track as a bag-of-features. The second stage successively performs the unsupervised learning on the bag-of-features in a layer-by-layer manner to initialize a deep neural network and finally fine-tunes it with the tag labels. Through the experiment, we rigorously examine training choices and tuning parameters, and show that the model achieves high performance on Magnatagatune, a popularly used dataset in music auto-tagging.

研究动机与目标

  • 通过学习数据驱动的表示来解决手工设计音频特征在音乐自动标记中的局限性。
  • 通过分层特征学习和深度神经网络微调来提升多标签音乐标记性能。
  • 通过在堆叠的RBMs中识别最优权重-成本设置,减少超参数搜索的计算负担。
  • 在大规模真实世界音乐标记基准上验证深度词袋方法的有效性。

提出的方法

  • 模型使用基于起音的采样方法从音频轨道中提取局部频谱块,用于无监督特征学习。
  • 通过堆叠受限玻尔兹曼机(RBMs)以无监督方式学习局部音频特征的高维稀疏表示。
  • 通过最大池化和平均操作对学习到的特征进行汇总,形成每个音频轨道的词袋表示。
  • 使用逐层RBMs预训练初始化深度神经网络(DNN),然后通过标签进行微调,实现端到端分类。
  • 对权重-成本超参数进行调优,以平衡重构误差与稀疏性,并提出一种启发式设置以减少训练时间。
  • 在MIREX 2009版的Magnatagatune数据集上使用标准指标(包括AUC、P3、P6和P15)进行模型评估。

实验结果

研究问题

  • RQ1结合无监督特征学习与有监督微调的两阶段深度学习模型是否能在音乐自动标记中超越现有方法?
  • RQ2RBMs预训练中的不同权重-成本设置如何影响深度神经网络的最终性能?
  • RQ3所提出的词袋表示是否能有效总结音频内容以实现多标签音乐标记?
  • RQ4在堆叠的RBMs中采用结构化的权重-成本调度是否能减少训练时间而不损失性能?

主要发现

  • 所提出的Deep-BoF模型在Magnatagatune数据集上实现了AUC为0.888,P15为0.190,优于先前最先进方法。
  • 该模型在所有指标上均超越Hamel等人最佳表现的方法(Multi PMSCs),包括AUC-T(0.888 vs. 0.870)和P15(0.190 vs. 0.184)。
  • 第一层RBMs的权重-成本设置为0.001,上层则逐步增加(
  • 所提出的权重-成本启发式设置(
  • 该模型表明,使用RBMs进行无监督预训练能有效初始化深度网络用于音乐自动标记,从而在下游多标签分类任务中实现更优泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。