Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Self-Supervised Pre-Training for Music Classification

Ho-Hsiang Wu, Chieh-Chi Kao|arXiv (Cornell University)|Feb 5, 2021
Music and Audio Processing参考文献 29被引用 4
一句话总结

本文提出了一种用于音乐分类的多任务自监督预训练框架,利用多种手工设计的音频特征——MFCC、Chroma 和 Tempogram——作为掩蔽任务来训练共享的音乐编码器。通过结合这些多样化的音频表征并引入重加权机制,该方法在下游任务(如流派、乐器和节奏分类)中实现了显著的性能提升,尤其在标注数据稀缺的情况下表现更优。

ABSTRACT

Deep learning is very data hungry, and supervised learning especially requires massive labeled data to work well. Machine listening research often suffers from limited labeled data problem, as human annotations are costly to acquire, and annotations for audio are time consuming and less intuitive. Besides, models learned from labeled dataset often embed biases specific to that particular dataset. Therefore, unsupervised learning techniques become popular approaches in solving machine listening problems. Particularly, a self-supervised learning technique utilizing reconstructions of multiple hand-crafted audio features has shown promising results when it is applied to speech domain such as emotion recognition and automatic speech recognition (ASR). In this paper, we apply self-supervised and multi-task learning methods for pre-training music encoders, and explore various design choices including encoder architectures, weighting mechanisms to combine losses from multiple tasks, and worker selections of pretext tasks. We investigate how these design choices interact with various downstream music classification tasks. We find that using various music specific workers altogether with weighting mechanisms to balance the losses during pre-training helps improve and generalize to the downstream tasks.

研究动机与目标

  • 通过利用自监督预训练解决音乐分类中标签数据有限的问题。
  • 探究使用多样化音频掩蔽任务进行多任务学习如何提升音乐表征学习的泛化能力。
  • 评估编码器架构、损失加权机制以及工作者选择对下游性能的影响。
  • 确定结合多个音乐特定特征是否能比单任务预训练带来更好的泛化性能。
  • 比较微调与冻结特征提取策略在下游音乐分类任务中的表现。

提出的方法

  • 使用多个自监督掩蔽任务(波形重建、MFCC 重建、Chroma 重建和 Tempogram 重建)对共享编码器进行预训练。
  • 在预训练过程中采用重加权机制平衡不同掩蔽任务的损失,防止任一任务主导训练过程。
  • 应用两种编码器架构——PASE 和 PASE+——以评估架构对表征质量的影响。
  • 在三种下游场景下评估预训练编码器:监督训练、冻结特征提取和微调。
  • 在编码器特征之上使用线性或多层感知机(MLP)分类器进行下游音乐分类任务。
  • 在大规模无标签音频数据集上进行训练,并在小规模有标签数据集上进行微调,以模拟现实世界中的数据稀缺情况。

实验结果

研究问题

  • RQ1将 MFCC、Chroma 和 Tempogram 等多个音乐特定特征作为掩蔽任务联合使用,对下游音乐分类性能有何影响?
  • RQ2不同编码器架构(如 PASE 与 PASE+)对音乐表征学习有何影响?
  • RQ3损失加权机制如何影响多任务自监督预训练的平衡性与有效性?
  • RQ4微调预训练编码器是否比作为冻结特征提取器表现更优?
  • RQ5有标签样本数量如何影响冻结与微调策略的相对性能?

主要发现

  • 与 WLP 基线相比,同时使用 MFCC、Chroma 和 Tempogram 三个音乐特定工作者,分别在 OpenMIC、FMA 和 Extended Ballroom 上实现了 1.9%、4.5% 和 14% 的性能提升。
  • 引入 Tempogram 显著提升了对节奏上差异明显的舞种(如 Cha-cha 与 Jive,以及 Foxtrot 与 Quickstep)的判别能力。
  • MFCC 与 Chroma 联合使用增强了音色判别能力,有助于区分节奏相似但音色不同的流派,如 Foxtrot 与 Rumba。
  • 当有足够有标签数据时,微调在 Extended Ballroom 和 OpenMIC 上优于冻结特征提取,但在 FMA 上未见优势,表明存在数据效率的阈值。
  • 混淆矩阵显示,增加多个工作者减少了非对角线错误(误分类),且红色(正向)变化集中于对角线,表明分类准确率得到提升。
  • 重加权的多任务损失机制帮助模型从每个掩蔽任务中学习互补线索,从而获得更鲁棒且更具泛化能力的表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。