Skip to main content
QUICK REVIEW

[论文解读] Composer Style Classification of Piano Sheet Music Images Using Language Model Pretraining

T. J. Tsai, Kevin Ji|arXiv (Cornell University)|Jul 29, 2020
Music and Audio Processing参考文献 34被引用 6
一句话总结

本文提出了一种新颖的方法,通过利用语言模型预训练技术,对钢琴乐谱图像进行作曲家风格分类。该方法使用 bootleg 特征表示将乐谱图像转换为音乐‘词’的序列,然后在小规模标注数据集上微调一个以预训练语言模型(如 GPT-2)权重初始化的分类器,实现了在九分类任务中准确率达到 70%,相较无预训练时的 46% 显著提升。

ABSTRACT

This paper studies composer style classification of piano sheet music images. Previous approaches to the composer classification task have been limited by a scarcity of data. We address this issue in two ways: (1) we recast the problem to be based on raw sheet music images rather than a symbolic music format, and (2) we propose an approach that can be trained on unlabeled data. Our approach first converts the sheet music image into a sequence of musical "words" based on the bootleg feature representation, and then feeds the sequence into a text classifier. We show that it is possible to significantly improve classifier performance by first training a language model on a set of unlabeled data, initializing the classifier with the pretrained language model weights, and then finetuning the classifier on a small amount of labeled data. We train AWD-LSTM, GPT-2, and RoBERTa language models on all piano sheet music images in IMSLP. We find that transformer-based architectures outperform CNN and LSTM models, and pretraining boosts classification accuracy for the GPT-2 model from 46\% to 70\% on a 9-way classification task. The trained model can also be used as a feature extractor that projects piano sheet music into a feature space that characterizes compositional style.

研究动机与目标

  • 通过从符号音乐格式转向原始乐谱图像,解决作曲家风格分类中标注数据稀缺的问题。
  • 通过在 IMSLP 上大规模无标注乐谱图像上进行预训练,克服数据限制。
  • 开发一种方法,将预训练于音乐序列的语言模型知识迁移至下游分类任务,以提升性能。
  • 探索训练好的模型作为未见作曲家的风格感知特征提取器的实用性。
  • 研究模型架构、预训练、片段大小和推理策略对分类准确率的影响。

提出的方法

  • 使用 bootleg 乐谱特征表示将钢琴乐谱图像转换为音乐‘词’的序列,该表示编码了 staff 级别的音乐元素。
  • 在 IMSLP 上所有无标注的钢琴乐谱图像上训练语言模型(AWD-LSTM、GPT-2、RoBERTa),以学习通用音乐模式。
  • 使用预训练语言模型的权重初始化文本分类器,以利用学习到的表示。
  • 在小规模作曲家标注的乐谱页面标注数据集上微调分类器。
  • 采用多裁剪推理策略以提升性能,尤其适用于较短的页面。
  • 将模型最后一层激活值作为风格编码的特征向量,用于下游分析,如对未见作曲家的 t-SNE 可视化。

实验结果

研究问题

  • RQ1当训练数据有限时,语言模型预训练是否能显著提升作曲家风格分类的准确率?
  • RQ2从大规模无标注乐谱语料中迁移表示是否能提升模型对未见作曲家的泛化能力?
  • RQ3模型架构选择(如 LSTM 与 Transformer)对分类任务性能有何影响?
  • RQ4片段大小和推理策略(单裁剪与多裁剪)对分类准确率有何影响?
  • RQ5模型学习到的特征是否能有效捕捉并区分训练集中未包含的作曲家的创作风格?

主要发现

  • 在无标注的 IMSLP 乐谱图像上使用 GPT-2 语言模型进行预训练,使九分类作曲家风格分类任务的准确率从 46% 提升至 70%。
  • 基于 Transformer 的模型(GPT-2、RoBERTa)在所有评估设置下均优于 CNN 和 LSTM 模型。
  • 最佳模型(GPT-2,片段大小为 64)的宏平均 F1 分数在三种预训练条件下分别从 0.41 提升至 0.51 再到 0.67。
  • 较小的片段大小(64 个词)通过减少与真实页面长度的数据分布差异,提升了整页分类的性能。
  • 多裁剪推理策略提升了除 CNN 外所有模型的性能,表明特征平均对某些架构效果较差。
  • RoBERTa 模型激活值的 t-SNE 可视化显示,来自五位新作曲家的乐谱页面呈现出有意义的聚类,表明模型学习到了解耦且风格感知的特征空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。