Skip to main content
QUICK REVIEW

[論文レビュー] Towards Explainable Music Emotion Recognition: The Route via Mid-level Features

Shreyan Chowdhury, Andreu Vall|arXiv (Cornell University)|Jul 8, 2019
Music and Audio Processing被引用数 13
ひとこと要約

本稿では、リズムの複雑さや調性の特徴といった中レベルの知覚的特徴を用いて、音楽の感情を予測するVGGスタイルの深層ニューラルネットワークを提案する。予測性能にわずかな低下は見られるが、感情予測を人間が理解できる音楽的特徴に直接結びつけることで、解釈可能性が著しく向上し、解釈可能性のコストが予想に反して非常に低いことが示された。

ABSTRACT

Emotional aspects play an important part in our interaction with music. However, modelling these aspects in MIR systems have been notoriously challenging since emotion is an inherently abstract and subjective experience, thus making it difficult to quantify or predict in the first place, and to make sense of the predictions in the next. In an attempt to create a model that can give a musically meaningful and intuitive explanation for its predictions, we propose a VGG-style deep neural network that learns to predict emotional characteristics of a musical piece together with (and based on) human-interpretable, mid-level perceptual features. We compare this to predicting emotion directly with an identical network that does not take into account the mid-level features and observe that the loss in predictive performance of going through the mid-level features is surprisingly low, on average. The design of our network allows us to visualize the effects of perceptual features on individual emotion predictions, and we argue that the small loss in performance in going through the mid-level features is justified by the gain in explainability of the predictions.

研究の動機と目的

  • 音楽感情認識(MER)モデルの解釈可能性を高めるために、音楽的に意味のある中レベルの特徴を組み込むこと。
  • 中レベル特徴を中間処理として用いることによる性能の低下を定量化し、これを「解釈可能性のコスト」と呼ぶ。
  • 抽象的なニューラル活性化ではなく、「緊張感」や「アーティキュレーション」のような知覚的に直感的な音楽的質に、モデルの説明を可能にする。
  • 中レベル特徴と感情ラベルの両方を同時に学習することで、全体の予測性能を向上させる。
  • 人間が読み取れる根拠を提供することができる、感情ベースの推薦や検索システムのフレームワークを提供する。

提案手法

  • Soundtracksデータセットからの正解アノテーションを用いて、音声から中レベルの知覚的特徴を直接予測するVGGスタイルの深層ニューラルネットワークを訓練する。
  • 音声から直接ではなく、予測された中レベル特徴から感情を予測する第二のネットワークアーキテクチャを用い、解釈可能性を実現する。
  • 各感情ごとに特徴の寄与度を直接分析できるように、中レベル特徴から感情スコアへマップする1つの全結合層を採用する。
  • 音声から直接感情を予測する方法と、中レベル特徴を経由して間接的に予測する方法の性能を比較し、予測精度の差異を損失として測定する。
  • 中レベル特徴と感情ラベルの両方を同時に学習することで、一般化性能と予測性能の両方を向上させる。
  • 特徴の影響をボックスプロットとサリエンシー解析を用いて可視化し、各中レベル特徴が個々の感情予測にどのように寄与しているかを明らかにする。

実験結果

リサーチクエスチョン

  • RQ1中レベルの知覚的特徴を中間処理として用いることで、音楽感情予測の性能にどの程度の損失が生じるか?
  • RQ2中レベル特徴で学習された深層学習モデルは、エンドツーエンドモデルと比較して、より解釈可能で音楽的に意味のある説明を提供できるか?
  • RQ3中レベル特徴と感情ラベルの両方を同時に学習することは、音楽感情認識における全体の予測性能にどのように影響するか?
  • RQ4「緊張感」や「アーティキュレーション」のような中レベル特徴が、「恐怖」や「エネルギー」のような特定の感情次元とどの程度関連づけられるか?
  • RQ5モデルは、人間の音楽的質の認識と整合する、楽曲単位の説明を生成できるか?

主な発見

  • 中レベル特徴を中間処理として用いることで生じる性能の低下は、平均的に非常に小さく、解釈可能性のコストが最小限であることが裏付けられた。
  • 各中レベル特徴が個々の感情予測にどのように寄与しているかを直接可視化できることから、モデルは高い解釈性を達成した。たとえば、「アーティキュレーション」が「エネルギー」の高い感情と関連づけられるなど、明確な関連性が示された。
  • 楽曲#322では、「緊張感」が主に「マイナー性」と「アーティキュレーション」によって説明されており、逆に「リズム的安定性」がその効果を相殺していることが示され、知覚的根拠に基づいた洗練された説明が可能になった。
  • 中レベル特徴と感情ラベルの両方を同時に学習することで、単独で学習する場合よりも、予測性能がさらに向上した。
  • モデルの説明は人間の認識と整合しており、例として楽曲#153と#322の例では、予測された感情プロファイルがアノテートされた感情的質と一致した。
  • 第二のデータセット(MIREXライクなムードデータセット)における予備の結果も、Soundtracksデータセットで観察された傾向を再現しており、本手法の堅牢性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。