Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of CNN-based Automatic Music Tagging Models

Minz Won, Andrés Ferraro|arXiv (Cornell University)|Jun 1, 2020
Music and Audio Processing参考文献 16被引用数 46
ひとこと要約

この論文は、3つのデータセット(MTAT、MSD、MTG-Jamendo)にわたる最先端のCNNベースの音楽タグ付けモデルの一貫した評価を提供し、入力摂動に対する頑健性を評価する。事前学習済みの PyTorch 実装とモデルが公開されている。

ABSTRACT

Recent advances in deep learning accelerated the development of content-based automatic music tagging systems. Music information retrieval (MIR) researchers proposed various architecture designs, mainly based on convolutional neural networks (CNNs), that achieve state-of-the-art results in this multi-label binary classification task. However, due to the differences in experimental setups followed by researchers, such as using different dataset splits and software versions for evaluation, it is difficult to compare the proposed architectures directly with each other. To facilitate further research, in this paper we conduct a consistent evaluation of different music tagging models on three datasets (MagnaTagATune, Million Song Dataset, and MTG-Jamendo) and provide reference results using common evaluation metrics (ROC-AUC and PR-AUC). Furthermore, all the models are evaluated with perturbed inputs to investigate the generalization capabilities concerning time stretch, pitch shift, dynamic range compression, and addition of white noise. For reproducibility, we provide the PyTorch implementations with the pre-trained models.

研究の動機と目的

  • 先行研究における実験設定の不揃いがあるため、比較可能な評価の必要性を動機づける。
  • 共通のプロトコルの下で複数のCNNベース音楽タグ付けモデルの統一評価を提供する。
  • Time-stretch、pitch-shift、dynamic range compression、white noise に対するモデルの頑健性を評価する。
  • 再現性を可能にするオープンソースの PyTorch 実装と事前学習済みモデルを提供する。

提案手法

  • 音楽タグ付けの多様なCNNアーキテクチャを検討・実装する(FCN、MusicNN、Sample-level CNN、CRNN、Self-attention、Harmonic CNN、Short-chunk CNN、その他の variants)。
  • データセット間で入力表現(FFTと重なりを一定にしたMelスペクトログラム)とトレーニング設定を標準化する。
  • タグごとに平均した macro ROC-AUC および PR-AUC を評価し、チャンクベースのモデルには 16-chunk アグリゲーションを適用する。
  • MUDAベースの変形を用いて、ピッチシフト、時間伸長、ダイナミックレンジ圧縮、ホワイトノイズでテスト音声を摂動させ、頑健性を調査する。
  • 再現性を促進するため、事前学習済みモデルと PyTorch 実装を提供する。

実験結果

リサーチクエスチョン

  • RQ1共通のベンチマークで、どの CNN ベースのアーキテクチャが自動音楽タグ付けで最高の性能を発揮するか。
  • RQ2短いチャンクのトレーニング戦略は、長い入力アーキテクチャと比べて精度と一般化においてどうなるか。
  • RQ33x3 フィルター、プーリング、ハーモニック表現などの設計選択が、一般的な音声摂動に対する頑健性にどのような影響を与えるか。
  • RQ4Musicnn や Harmonic CNN といったドメイン知識を取り入れたモデルは、データセットの規模が大きくなるにつれて有利さを維持できるか。
  • RQ5曲レベル学習とチャンクレベル学習など、異なる評価プロトコルがデータセット間の報告性能にどのように影響するか。

主な発見

  • Short-chunk CNN 系は、MTAT、MSD、MTG-Jamendo のいずれでも一貫して高い性能を達成する。
  • Harmonic CNN と Short-chunk CNN は入力摂動下での一般化性能が高く、他のモデルよりも多くの変形タイプで優る。
  • 短い音声抜粋(3.69s–5s)で学習したモデルは、長いセグメント(29.1s)を用いたものよりも多くのデータセットで優れている。
  • Self-attention は逐次モデルの中で CRNN よりやや上回るが、最良の Short-chunk CNN や Harmonic CNN を超えるには至らない。
  • Musicnn は MTAT で競争力を持つが、大規模データセットでは他のアーキテクチャに劣る場合がある。
  • CRCベースおよび音楽ドメイン知識主導の設計は、より大規模または多様なデータセットへのスケーリング時に遅れを取る可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。