Skip to main content
QUICK REVIEW

[論文レビュー] Composer Style Classification of Piano Sheet Music Images Using Language Model Pretraining

T. J. Tsai, Kevin Ji|arXiv (Cornell University)|Jul 29, 2020
Music and Audio Processing参考文献 34被引用数 6
ひとこと要約

本論文は、言語モデルの事前学習を活用することで、ピアノ楽譜画像の作曲家スタイル分類のための新規アプローチを提案する。楽譜画像をブートラグ特徴表現を用いて音楽的「単語」の系列に変換し、その後、事前学習済み言語モデル(例:GPT-2)で初期化された分類器を、少量のラベル付きデータで微調整することで、9クラス分類タスクで70%の精度を達成。事前学習なしでは46%にとどまる。

ABSTRACT

This paper studies composer style classification of piano sheet music images. Previous approaches to the composer classification task have been limited by a scarcity of data. We address this issue in two ways: (1) we recast the problem to be based on raw sheet music images rather than a symbolic music format, and (2) we propose an approach that can be trained on unlabeled data. Our approach first converts the sheet music image into a sequence of musical "words" based on the bootleg feature representation, and then feeds the sequence into a text classifier. We show that it is possible to significantly improve classifier performance by first training a language model on a set of unlabeled data, initializing the classifier with the pretrained language model weights, and then finetuning the classifier on a small amount of labeled data. We train AWD-LSTM, GPT-2, and RoBERTa language models on all piano sheet music images in IMSLP. We find that transformer-based architectures outperform CNN and LSTM models, and pretraining boosts classification accuracy for the GPT-2 model from 46\% to 70\% on a 9-way classification task. The trained model can also be used as a feature extractor that projects piano sheet music into a feature space that characterizes compositional style.

研究の動機と目的

  • 楽譜形式のシンボリック音楽から生の楽譜画像へ移行することで、作曲家スタイル分類におけるラベル付きデータの不足を緩和する。
  • IMSLPから大規模なラベルなし楽譜画像を用いた事前学習を可能にすることで、データ制限を克服する。
  • 事前学習済み言語モデルが学習した音楽的表現を、下流の分類タスクに転送する手法を開発する。
  • 訓練済みモデルが未学習の作曲家に対して、スタイルに敏感な特徴抽出器として有効に機能するかを検証する。
  • モデルアーキテクチャ、事前学習、断片サイズ、推論戦略の各要因が分類精度に与える影響を調査する。

提案手法

  • ブートラグスコア特徴表現を用いて、ピアノ楽譜画像をスタッフレベルの音楽的要素をエンコードする音楽的「単語」の系列に変換する。
  • IMSLPに収録されたすべてのラベルなしピアノ楽譜画像を用いて、言語モデル(AWD-LSTM、GPT-2、RoBERTa)を訓練し、一般的な音楽的パターンを学習する。
  • 事前学習済み言語モデルの重みで初期化されたテキスト分類器を用い、学習済み表現を活用する。
  • 作曲家ラベルが付与された楽譜ページの少量のラベル付きデータで分類器を微調整する。
  • 特に短いページにおいて性能向上を図るため、マルチクロップ推論を適用する。
  • モデルの最終層の活性化を、t-SNEによる未学習の作曲家の可視化などの下流解析に用いられるスタイル符号化特徴ベクトルとして利用する。

実験結果

リサーチクエスチョン

  • RQ1訓練データが限られた状況下で、言語モデルの事前学習が作曲家スタイル分類の精度を顕著に向上させるか?
  • RQ2大規模なラベルなし楽譜コーパスから得た表現を転送することで、未学習の作曲家への一般化性能が向上するか?
  • RQ3モデルアーキテクチャの選択(例:LSTM対トランスフォーマー)が分類タスクのパフォーマンスに与える影響は?
  • RQ4断片サイズと推論戦略(単一クロップ対マルチクロップ)が分類精度に与える影響は?
  • RQ5訓練データに含まれない作曲家に対しても、モデルが学習した特徴が作曲スタイルを効果的に捉え、区別できるか?

主な発見

  • GPT-2言語モデルをIMSLPのラベルなし楽譜画像で事前学習することで、9クラスの作曲家分類タスクで分類精度が46%から70%に向上した。
  • トランスフォーマー型モデル(GPT-2、RoBERTa)は、すべての評価設定でCNNおよびLSTMモデルを上回った。
  • 最良のモデル(GPT-2、断片サイズ64)のマクロF1スコアは、3つの事前学習条件において0.41から0.51から0.67に上昇した。
  • より小さな断片サイズ(64単語)は、実際のページ長とのデータ分布の不一致を低減したため、全ページ分類のパフォーマンス向上に寄与した。
  • マルチクロップ推論は、CNNを除くすべてのモデルで性能向上をもたらした。これは、特定のアーキテクチャでは特徴の平均化が効果的でないことを示している。
  • RoBERTaモデルの活性化を用いたt-SNE可視化では、5人の未学習の作曲家の楽譜ページが意味のあるクラスタリングを示し、モデルが分離可能でスタイルに敏感な特徴空間を学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。