Skip to main content
QUICK REVIEW

[论文解读] Supervised and Unsupervised Learning of Audio Representations for Music Understanding

Matthew McCallum, Filip Korzeniowski|arXiv (Cornell University)|Oct 7, 2022
Music and Audio Processing被引用 7
一句话总结

本文比较了用于音乐理解的音频表征的有监督与无监督预训练方法,结果表明在大规模专家标注音乐数据集上进行有监督学习,可在参数量低于100M的模型上实现多种音乐标签任务的最先进性能。在音乐专用数据上进行的无监督学习也取得了优异结果,优于通用领域无监督模型,并在关键音高估计等任务上表现更优。

ABSTRACT

In this work, we provide a broad comparative analysis of strategies for pre-training audio understanding models for several tasks in the music domain, including labelling of genre, era, origin, mood, instrumentation, key, pitch, vocal characteristics, tempo and sonority. Specifically, we explore how the domain of pre-training datasets (music or generic audio) and the pre-training methodology (supervised or unsupervised) affects the adequacy of the resulting audio embeddings for downstream tasks. We show that models trained via supervised learning on large-scale expert-annotated music datasets achieve state-of-the-art performance in a wide range of music labelling tasks, each with novel content and vocabularies. This can be done in an efficient manner with models containing less than 100 million parameters that require no fine-tuning or reparameterization for downstream tasks, making this approach practical for industry-scale audio catalogs. Within the class of unsupervised learning strategies, we show that the domain of the training dataset can significantly impact the performance of representations learned by the model. We find that restricting the domain of the pre-training dataset to music allows for training with smaller batch sizes while achieving state-of-the-art in unsupervised learning -- and in some cases, supervised learning -- for music understanding. We also corroborate that, while achieving state-of-the-art performance on many tasks, supervised learning can cause models to specialize to the supervised information provided, somewhat compromising a model's generality.

研究动机与目标

  • 评估预训练数据领域(音乐 vs. 通用音频)和学习范式(有监督 vs. 无监督)对音乐理解任务中音频表征质量的影响。
  • 评估在大规模音乐数据集上训练的紧凑模型(参数量低于100M)在无微调情况下的可扩展性与性能表现。
  • 探究仅在音乐数据上进行无监督学习是否能在关键音高估计等任务上达到或超越有监督学习性能。
  • 分析性能与泛化能力之间的权衡,特别是有监督模型可能因训练标签分布而产生特化现象。
  • 确定小批量大小与数据领域对音乐表征学习中无监督对比学习的影响。

提出的方法

  • 使用来自Musicset数据集的幅度对数梅尔频谱图,通过有监督学习预训练音频模型。Musicset是一个大规模专家标注的音乐数据集。
  • 对相同音频数据应用无监督对比学习(SimCLR损失),排除标注信息,以实现无标签表征学习。
  • 在音乐专用数据集(Musicset)和通用音频数据集(Audioset)上分别训练模型,以比较领域特定与通用领域预训练的差异。
  • 采用不同小批量大小(1920 和 256)以评估训练动态对无监督表征质量的影响。
  • 通过在线性探测在广泛的下游音乐标签任务上评估学习到的嵌入表征,包括流派、情绪、关键音高、音高和乐器等。
  • 通过使用相同模型架构和推理协议,确保模型性能评估的公平性。

实验结果

研究问题

  • RQ1在专家标注的音乐数据上进行有监督预训练是否能在多样化的音乐标签任务中实现最先进性能?
  • RQ2仅在音乐数据上进行无监督学习是否能实现与通用领域无监督预训练相当或更优的性能?
  • RQ3将预训练数据集限制为音乐数据是否会影响模型性能,特别是在关键音高估计等任务上?
  • RQ4有监督模型在训练标签中未包含的任务(如音高和关键音高检测)上泛化能力如何?
  • RQ5小批量大小对无监督对比学习在音乐表征学习中的性能有何影响?

主要发现

  • Musicset-Sup 模型在所有多标签音乐标签任务中均达到最先进性能,包括流派、情绪和乐器识别,且模型参数量低于1亿。
  • 在仅音乐数据上进行无监督学习(Musicset-ULarge)在无监督学习任务中达到最先进结果,并在关键音高估计等任务上表现与或优于部分有监督模型。
  • 在音乐专用数据上预训练的模型(Musicset-USmall)在所有评估任务中均优于在通用音频数据上预训练的模型(Audioset-USmall),表明领域特异性可提升表征质量。
  • 有监督模型在音高和关键音高估计任务上出现性能下降,证实模型可能因训练标签分布而特化,从而损失泛化能力。
  • 在音乐数据上训练的无监督模型即使使用较小批量大小(256)也能取得优异性能,表明音乐中频谱同质性可能提升负样本采样效率。
  • 结果表明,使用音乐专用数据训练的紧凑模型(参数量低于100M)可达到或超越更大模型的性能,且训练成本和推理需求显著降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。