Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised Music Tagging Transformer

Minz Won, Keunwoo Choi|arXiv (Cornell University)|Nov 26, 2021
Music and Audio Processing被引用 13
一句话总结

本文提出 Music Tagging Transformer,一种基于自注意力机制的模型,通过有效捕捉音频的局部与全局特征,超越了以往基于 CNN 的音乐标签模型。通过在完整 Million Song Dataset 上使用噪声学生蒸馏进行半监督训练,该模型利用了有标签和无标签数据,实现了最先进性能,显著提升了在长音频序列上的泛化能力和鲁棒性。

ABSTRACT

We present Music Tagging Transformer that is trained with a semi-supervised approach. The proposed model captures local acoustic characteristics in shallow convolutional layers, then temporally summarizes the sequence of the extracted features using stacked self-attention layers. Through a careful model assessment, we first show that the proposed architecture outperforms the previous state-of-the-art music tagging models that are based on convolutional neural networks under a supervised scheme. The Music Tagging Transformer is further improved by noisy student training, a semi-supervised approach that leverages both labeled and unlabeled data combined with data augmentation. To our best knowledge, this is the first attempt to utilize the entire audio of the million song dataset.

研究动机与目标

  • 开发一种深度学习模型,以捕捉音乐中的局部与全局声学模式,从而提升标签性能。
  • 通过利用 Million Song Dataset 中的无标签数据,采用半监督学习方法,解决音乐标签任务中标签数据量小的局限性。
  • 设计一种能够有效处理长音频序列的模型架构,克服以往基于 CNN 的模型在分段预测方面的局限性。
  • 提出 Million Song Dataset 的新数据划分方式,以解决先前划分中存在的已知问题。
  • 通过大规模真实世界数据集,证明噪声学生训练结合数据增强在音乐标签任务中的有效性。

提出的方法

  • 模型使用浅层卷积层从梅尔频谱图输入中提取局部声学特征。
  • 采用堆叠的多头自注意力层对特征序列进行时间汇总,并建模长程依赖关系。
  • 该架构首先在监督学习设置下进行训练,随后通过噪声学生训练进一步优化——这是一种结合知识蒸馏与数据增强的半监督方法。
  • 在学生模型训练过程中应用数据增强,以提升鲁棒性与泛化能力。
  • 在 Million Song Dataset 上使用标准指标(ROC-AUC 与 PR-AUC)对模型进行评估。
  • 引入新数据划分方式,以解决先前 MSD 划分中存在的数据泄露与不平衡问题。

实验结果

研究问题

  • RQ1基于 Transformer 的架构是否能在监督设置下超越现有的基于 CNN 的音乐标签模型?
  • RQ2在 Million Song Dataset 上,利用无标签数据进行半监督学习能在多大程度上提升音乐标签性能?
  • RQ3与基于分段的 CNN 模型相比,Music Tagging Transformer 如何处理长音频序列?
  • RQ4结合数据增强的知识蒸馏(即噪声学生训练)是否能在音乐标签任务中带来一致的性能提升?
  • RQ5统一的模型架构能否有效学习音乐标签任务中的局部与全局音频表征?

主要发现

  • Music Tagging Transformer 在完整 3 分钟音频输入上达到 ROC-AUC 0.9199 与 PR-AUC 0.3814,优于以往最先进基于 CNN 的模型。
  • 该模型在不同输入长度下表现一致,最优性能出现在 256×4 注意力配置(宽度×深度),表明其具备强大的长序列建模能力。
  • 结合数据增强的噪声学生训练在 Music Tagging Transformer 和短段 ResNet 上均带来一致的性能提升,证明了无标签数据的价值。
  • 参数更少的学生模型(DA + KD)优于更大的模型(DA + KE),表明在训练数据有限时,模型容量可能并非最优。
  • 当使用完整 3 分钟音频输入时,该模型达到最佳性能,与较短输入相比性能衰减极小,而基于分段的模型在长序列上则表现出性能下降。
  • 所提出的划分方式解决了先前 MSD 划分中存在的已知数据泄露与不平衡问题,使评估更加可靠且可复现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。