Skip to main content
QUICK REVIEW

[论文解读] Codified audio language modeling learns useful representations for music information retrieval

Rodrigo Castellon, Chris Donahue|arXiv (Cornell University)|Jul 12, 2021
Music and Audio Processing参考文献 61被引用 22
一句话总结

该论文表明,使用在100万首歌曲上预训练的Jukebox模型提取的表示进行编码音频语言建模(CALM),相较于传统的基于标签的预训练方法,能为音乐信息检索(MIR)任务生成显著更强的特征。在平均意义上,CALM特征在四项MIR任务——标签分类、流派分类、调性检测和情感识别——中性能提升了30%,尤其在调性检测任务中表现尤为突出,表明基于音频的预训练能捕捉到比基于标签的方法更丰富、更具迁移性的表征。

ABSTRACT

We demonstrate that language models pre-trained on codified (discretely-encoded) music audio learn representations that are useful for downstream MIR tasks. Specifically, we explore representations from Jukebox (Dhariwal et al. 2020): a music generation system containing a language model trained on codified audio from 1M songs. To determine if Jukebox's representations contain useful information for MIR, we use them as input features to train shallow models on several MIR tasks. Relative to representations from conventional MIR models which are pre-trained on tagging, we find that using representations from Jukebox as input features yields 30% stronger performance on average across four MIR tasks: tagging, genre classification, emotion recognition, and key detection. For key detection, we observe that representations from Jukebox are considerably stronger than those from models pre-trained on tagging, suggesting that pre-training via codified audio language modeling may address blind spots in conventional approaches. We interpret the strength of Jukebox's representations as evidence that modeling audio instead of tags provides richer representations for MIR.

研究动机与目标

  • 探究通过编码音频语言建模(CALM)方式在音乐生成模型上预训练得到的表征是否适用于判别性MIR任务。
  • 对比CALM提取的特征与基于人工标签、元数据或对比学习预训练的模型所提取特征的有效性。
  • 确定直接对原始音频进行建模而非依赖标签,是否能为MIR任务带来更丰富、更具泛化能力的表征。
  • 评估将原本专为生成任务设计的大规模NLP风格模型——经由重用以应用于下游判别性MIR任务的潜力。

提出的方法

  • 使用在100万首歌曲上预训练的Jukebox模型,通过其在离散音频码字上的Transformer语言模型提取音频表征。
  • 首先通过VQ-VAE将音频波形编码为离散标记,从而实现将NLP风格的语言建模应用于音频。
  • 使用浅层探测模型(如前馈神经网络)在下游MIR任务上进行训练,输入为Jukebox提取的特征。
  • 将这些探测模型的性能与基线模型进行比较,后者使用基于标签、元数据或对比学习预训练的模型所提取的特征。
  • 在四项MIR任务上开展实验:音乐标签分类、流派分类、调性检测和情感识别。
  • 所有实验均可通过Docker容器和CodaLab工作簿复现,代码和模型权重已公开,以确保透明性。

实验结果

研究问题

  • RQ1能否有效将通过编码音频语言建模预训练的音乐生成模型所得到的表征迁移到下游MIR任务?
  • RQ2与基于人工标签、元数据或对比学习预训练的模型相比,CALM提取的特征在性能上表现如何?
  • RQ3与基于标签的预训练相比,基于音频的预训练是否能产生更鲁棒、更具信息量的表征?
  • RQ4对于与标签相关性较低的任务(如调性检测),CALM是否具有特别优势?

主要发现

  • 与基于标签的预训练相比,Jukebox的CALM预训练表征在四项MIR任务上平均性能提升30%。
  • 在调性检测任务中,CALM特征显著优于基于标签的特征,表明音频建模能捕捉到标签中未能充分反映的结构特性。
  • 尽管推理仅使用单张12GB GPU,基于CALM的方法在多个MIR任务上仍达到与最先进模型相当的性能。
  • 结果表明,直接对原始音频进行建模可产生比基于标签的预训练更丰富、更具泛化能力的表征,尤其适用于与标签无直接关联的任务。
  • CALM的成功支持了更广泛的假设:受NLP启发的大规模音频建模,能够为MIR解锁新能力。
  • 作者公开了代码、Docker容器和CodaLab工作簿,以确保完全可复现性,并鼓励基于CALM的MIR进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。