Skip to main content
QUICK REVIEW

[論文レビュー] A Data-driven Approach to Mid-level Perceptual Musical Feature Modeling

Anna Aljanaki, Mohammad Soleymani|arXiv (Cornell University)|Jun 13, 2018
Music and Audio Processing参考文献 19被引用数 9
ひとこと要約

本論文は、作曲家による5,000曲の音楽データセットを収集し、その上で深層ニューラルネットワークを訓練することで、メロディアスさ、アーティキュレーション、不協和音などの中レベルの知覚的音楽的特徴をデータ駆動型アプローチでモデル化することを提案する。Inceptionベースのモデルをスペクトログラムに適用し、転移学習を用いた手法により、特にメロディアスさ、アーティキュレーション、不協和音の予測精度が高く、音楽感情認識において従来の手作業特徴量よりも優れた性能を示した。

ABSTRACT

Musical features and descriptors could be coarsely divided into three levels of complexity. The bottom level contains the basic building blocks of music, e.g., chords, beats and timbre. The middle level contains concepts that emerge from combining the basic blocks: tonal and rhythmic stability, harmonic and rhythmic complexity, etc. High-level descriptors (genre, mood, expressive style) are usually modeled using the lower level ones. The features belonging to the middle level can both improve automatic recognition of high-level descriptors, and provide new music retrieval possibilities. Mid-level features are subjective and usually lack clear definitions. However, they are very important for human perception of music, and on some of them people can reach high agreement, even though defining them and therefore, designing a hand-crafted feature extractor for them can be difficult. In this paper, we derive the mid-level descriptors from data. We collect and release a dataset\footnote{https://osf.io/5aupt/} of 5000 songs annotated by musicians with seven mid-level descriptors, namely, melodiousness, tonal and rhythmic stability, modality, rhythmic complexity, dissonance and articulation. We then compare several approaches to predicting these descriptors from spectrograms using deep-learning. We also demonstrate the usefulness of these mid-level features using music emotion recognition as an application.

研究の動機と目的

  • 明確な定義やアルゴリズム実装が欠如している主観的で知覚に基づく中レベル音楽的特徴をモデル化する課題に対処すること。
  • メロディアスさやトーナル安定性を含む7つの中レベル知覚的特徴について、作曲家によるアノテーションがなされた5,000曲の新規データセットを収集・公開すること。
  • 聴取者による評価に基づいて訓練されたディープラーニングモデルが、従来の手作業特徴抽出手法よりも、知覚的音楽的特徴を予測する上で優れているかどうかを評価すること。
  • これらの中レベル特徴が、音楽感情認識などの高レベル音楽理解タスクを向上させる応用可能性を示すこと。

提案手法

  • 訓練された作曲家を用いて、7つの中レベル特徴について知覚的比較質問を用いて、5,000曲の音楽データセットを大規模に収集・アノテーションした。
  • スペクトログラムを深層ニューラルネットワークの入力とし、ImageNetで事前学習されたInceptionネットワークからの転移学習を適用した。
  • まず、特徴抽出層を固定した状態でファインチューニングを行い、その後、すべての層をアンフリークにして低学習率で共同最適化することでさらに性能を向上させた。
  • 予測値と人間によるアノテーション値の間の相関係数を用いて性能を評価し、アブレーションスタディを通じて異なるアーキテクチャーや学習戦略を比較した。
  • MIRToolboxおよびEssentiaから得られる手作業特徴量と、学習された表現を比較し、その予測力を評価した。

実験結果

リサーチクエスチョン

  • RQ1手作業特徴量の代わりに、データ駆動型ディープラーニングアプローチによって中レベルの知覚的音楽的特徴を効果的にモデル化できるか?
  • RQ2聴取者による評価に基づいて訓練されたディープニューラルネットワークは、アーティキュレーションや不協和音などの知覚的特徴をどの程度正確に予測できるか?
  • RQ3学習された表現が、人間によるアノテーションの下位レベル記述子を予測する際、従来のMIR特徴量をどの程度上回るか?
  • RQ4中レベル特徴に対する人間のアノテーションの信頼性はどの程度か?また、どの特徴が最も高い評価者間一致度を示すか?

主な発見

  • データ駆動型ディープラーニングアプローチは、7つのすべての中レベル特徴において、最も高い予測精度を達成し、手作業特徴抽出手法を上回った。
  • メロディアスさ、アーティキュレーション、不協和音は相関係数0.7以上を示し、高いモデル信頼性を示した。
  • リズム的複雑さとトーナル安定性は、評価者間一致度が低く(Cronbach’s α = 0.27および0.44)、知覚的曖昧性や定義の洗練が求められることを示唆した。
  • 初期特徴抽出後にネットワーク全体をファインチューニングしたことで、固定特徴抽出よりも優れた性能が得られ、エンドツーエンド適応の利点を確認した。
  • 既存のMIR特徴量(例:粗さ(不協和音)、パルスの明瞭さ(リズム的安定性))は、人間の評価と中程度の相関(r ≈ 0.5–0.6)を示したが、知覚的ばらつきを完全に捉えてはいなかった。
  • 本研究は、中レベル特徴が、感情認識などの高レベル音楽理解タスクを豊かにするためのより豊かな知覚的文脈を提供できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。