Skip to main content
QUICK REVIEW

[論文レビュー] Supervised and Unsupervised Learning of Audio Representations for Music Understanding

Matthew McCallum, Filip Korzeniowski|arXiv (Cornell University)|Oct 7, 2022
Music and Audio Processing被引用数 7
ひとこと要約

本稿は、音楽理解のための音声表現の教師ありおよび教師なし事前学習を比較し、大規模な専門家アノテーション付き音楽データセットを用いた教師あり学習が、100Mパラメータ未満のモデルでも多様な音楽タグ付けタスクにおいて最先端の性能を達成することを示している。音楽固有のデータを用いた教師なし学習も強力な結果を達成し、一般ドメインの教師なしモデルを上回り、キーやその他のタスクにおいても性能が向上している。

ABSTRACT

In this work, we provide a broad comparative analysis of strategies for pre-training audio understanding models for several tasks in the music domain, including labelling of genre, era, origin, mood, instrumentation, key, pitch, vocal characteristics, tempo and sonority. Specifically, we explore how the domain of pre-training datasets (music or generic audio) and the pre-training methodology (supervised or unsupervised) affects the adequacy of the resulting audio embeddings for downstream tasks. We show that models trained via supervised learning on large-scale expert-annotated music datasets achieve state-of-the-art performance in a wide range of music labelling tasks, each with novel content and vocabularies. This can be done in an efficient manner with models containing less than 100 million parameters that require no fine-tuning or reparameterization for downstream tasks, making this approach practical for industry-scale audio catalogs. Within the class of unsupervised learning strategies, we show that the domain of the training dataset can significantly impact the performance of representations learned by the model. We find that restricting the domain of the pre-training dataset to music allows for training with smaller batch sizes while achieving state-of-the-art in unsupervised learning -- and in some cases, supervised learning -- for music understanding. We also corroborate that, while achieving state-of-the-art performance on many tasks, supervised learning can cause models to specialize to the supervised information provided, somewhat compromising a model's generality.

研究の動機と目的

  • 音声表現の質に与える影響を評価する。特に、事前学習データドメイン(音楽対一般音声)および学習パラダイム(教師あり対教師なし)の影響を検討する。
  • 微小モデル(100Mパラメータ未満)が、微調整なしに大規模音楽データセットで学習した場合のスケーラビリティと性能を評価する。
  • 音楽専用データでの教師なし学習が、キーやピッチ推定などのタスクで教師あり学習の性能を同等または上回るかどうかを調査する。
  • 特に、教師ありモデルが訓練ラベルの分布に特化する場合に生じる性能と一般化のトレードオフを分析する。
  • ミニバッチサイズとデータドメインが、音楽表現学習における教師なしコントラスト学習に与える影響を特定する。

提案手法

  • 音楽セット(Musicset)データセットのマグニチュードログメルスペクトログ램を用いて、教師あり学習で音声モデルを事前学習する。
  • 同じ音声データに注釈を除き、対照的学習(SimCLR損失)を適用して、ラベルなしで表現を学習する。
  • ドメイン特化型(Musicset)と一般音声(Audioset)の両方のデータセットを用いて、ドメイン特化型対一般ドメインの事前学習を比較する。
  • 異なるミニバッチサイズ(1920および256)を用いて、教師なし表現品質に与えるトレーニングダイナミクスの影響を評価する。
  • さまざまな下流タスク(ジャンル、ムード、キーやピッチ、楽器など)における線形プローブを通じて、学習済み埋め込みを評価する。
  • 同一のモデルアーキテクチャと推論プロトコルを用いてモデル間の性能を公平に評価する。

実験結果

リサーチクエスチョン

  • RQ1専門家がアノテートした音楽データを用いた教師あり事前学習が、多様な音楽タグ付けタスクにおいて最先端の性能を達成するか?
  • RQ2音楽専用データでの教師なし学習が、一般ドメインの教師なし事前学習と比較して、競争力あるか、あるいは優れた性能を達成するか?
  • RQ3事前学習データセットを音楽に制限することで、特にキーやピッチ推定などのタスクにおいてモデル性能にどのような影響が生じるか?
  • RQ4教師ありモデルが、訓練ラベルに含まれないタスク(例:ピッチやキーディテクション)にどの程度一般化できるか?
  • RQ5教師なしコントラスト学習におけるミニバッチサイズが、音楽表現学習の性能に与える影響はいかほどか?

主な発見

  • Musicset-Supモデルは、10000万パラメータ未満のモデルで、ジャンル、ムード、楽器など、すべてのマルチラベル音楽タグ付けタスクで最先端の性能を達成している。
  • 音楽固有データでの教師なし学習(Musicset-ULarge)は、教師なし学習分野で最先端の結果を達成し、キーやピッチ推定などのタスクで一部の教師ありモデルを上回る性能を示している。
  • 音楽固有データで事前学習したモデル(Musicset-USmall)は、一般音声データで事前学習したモデル(Audioset-USmall)をすべての評価タスクで上回っており、ドメイン特化型が表現品質を向上させることを示している。
  • 教師ありモデルはピッチやキーや推定タスクで性能が低下しており、訓練データに存在するラベルに特化することで一般化能力が損なわれる可能性があることが確認された。
  • 音楽データで学習した教師なしモデルは、小さなバッチサイズ(256)でも強力な性能を発揮しており、音楽のスペクトル的均質性により、ネガティブサンプリングの効率が向上していると考えられる。
  • 本研究の結果は、音楽固有データで学習したコンパクトモデル(100Mパラメータ未満)が、大きなモデルを上回る性能を達成でき、かつトレーニングコストと推論要件を著しく削減できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。