Skip to main content
QUICK REVIEW

[论文解读] End-to-end learning for music audio tagging at scale

Jordi Pons, Oriol Nieto|arXiv (Cornell University)|Nov 7, 2017
Music and Audio Processing参考文献 19被引用 82
一句话总结

本论文比较端到端的波形模型与基于领域知识的声谱图模型在音乐自动标签任务上的表现,横跨规模逐步增大的数据集,结果显示在大规模数据(100万首歌曲)训练时,波形模型优于声谱图模型。

ABSTRACT

The lack of data tends to limit the outcomes of deep learning research, particularly when dealing with end-to-end learning stacks processing raw data such as waveforms. In this study, 1.2M tracks annotated with musical labels are available to train our end-to-end models. This large amount of data allows us to unrestrictedly explore two different design paradigms for music auto-tagging: assumption-free models - using waveforms as input with very small convolutional filters; and models that rely on domain knowledge - log-mel spectrograms with a convolutional neural network designed to learn timbral and temporal features. Our work focuses on studying how these two types of deep architectures perform when datasets of variable size are available for training: the MagnaTagATune (25k songs), the Million Song Dataset (240k songs), and a private dataset of 1.2M songs. Our experiments suggest that music domain assumptions are relevant when not enough training data are available, thus showing how waveform-based models outperform spectrogram-based ones in large-scale data scenarios.

研究动机与目标

  • 通过学习原始音频或声谱表示,推动对大型音乐集合的自动标签化。
  • 比较两种设计范式:基于波形的假设-free模型 vs 基于对数-梅尔声谱图、领域知识驱动的模型。
  • 在多个公开/私有数据集上评估随着训练数据规模的增长的性能。
  • 评估在大数据情景下,领域知识约束是否会限制学习能力。

提出的方法

  • 定义两种前端:波形(逐样本、少量一维滤波器)和声谱图(对数梅尔、多个竖向/横向滤波器)前端。
  • 使用共享后端:三层1D-CNN、带残差连接、时序池化和一个密集输出;全局池化支持变长输入。
  • 在15秒片段上端到端训练;通过对整首歌的片段预测结果取平均来得到歌曲级预测。
  • 使用ROC-AUC和PR-AUC评价标签分类,以及RMSE评价回归型标签在不同数据集上的表现。
  • 对比一个特征提取+梯度提升树的基线,以评估端到端方法的提升。

实验结果

研究问题

  • RQ1波形端到端模型在音乐自动标签任务上与声谱图模型在不同数据情形下的表现相比如何?
  • RQ2在有大量训练数据的情况下,是否降低对领域知识约束的需求?
  • RQ3在不同数据规模(波形 vs 声谱图)下,训练数据规模对模型性能的影响如何?
  • RQ4当数据量充足时,波形模型是否能够接近或超越最先进的声谱图模型?

主要发现

  • 在120万首歌的数据集上,波形模型在ROC-AUC、PR-AUC和RMSE上均优于声谱图模型,并超越基线特征系统。
  • 在100万首训练数据下,波形模型达到最高的ROC-AUC(92.50%)和PR-AUC(61.20%),优于声谱图模型(ROC-AUC 92.17%、PR-AUC 59.92%)。
  • 在10万或50万首歌的训练情景下,声谱图模型表现相当甚至略优,表明数据有限时领域知识的优势。
  • 在1.2M、1M、50万和10万规模下,波形模型呈现更强的数据规模收益,表明数据越多时更少限制的解空间有利。
  • 当数据量较小时,声谱图模型与MSD的最先进结果接轨,但在大数据下波形模型达到更优表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。