Skip to main content
QUICK REVIEW

[論文レビュー] Towards Deep Modeling of Music Semantics using EEG Regularizers

Francisco Raposo, David Martins de Matos|arXiv (Cornell University)|Dec 14, 2017
Music and Audio Processing参考文献 24被引用数 3
ひとこと要約

本稿では、音声とEEG信号を統合的にモデル化するための新規エンドツーエンドディープニューラルネットワークを提案する。Deep Canonical Correlation Analysis (DCCA) を用いて、共有された意味的埋め込み空間を学習する。脳波データを知覚的正則化子として活用することで、音声・歌詞間のクロスモーダル検索において、Spotifyの特徴量を上回り、700倍以上のデータで学習されたSOTAモデルと同等の性能を達成。使用した音声-EEGデータはわずか2.5時間である。

ABSTRACT

Modeling of music audio semantics has been previously tackled through learning of mappings from audio data to high-level tags or latent unsupervised spaces. The resulting semantic spaces are theoretically limited, either because the chosen high-level tags do not cover all of music semantics or because audio data itself is not enough to determine music semantics. In this paper, we propose a generic framework for semantics modeling that focuses on the perception of the listener, through EEG data, in addition to audio data. We implement this framework using a novel end-to-end 2-view Neural Network (NN) architecture and a Deep Canonical Correlation Analysis (DCCA) loss function that forces the semantic embedding spaces of both views to be maximally correlated. We also detail how the EEG dataset was collected and use it to train our proposed model. We evaluate the learned semantic space in a transfer learning context, by using it as an audio feature extractor in an independent dataset and proxy task: music audio-lyrics cross-modal retrieval. We show that our embedding model outperforms Spotify features and performs comparably to a state-of-the-art embedding model that was trained on 700 times more data. We further discuss improvements to the model that are likely to improve its performance.

研究の動機と目的

  • 音声のみのモデルが主観的な音楽意味論を捉えきれないという限界を、知覚の神経的相関を組み込むことで解決すること。
  • EEGデータを正則化子として統合する汎用的なフレームワークを構築し、音楽表現学習における意味的埋め込み品質を向上させること。
  • 転移学習設定下でのEEG正則化埋め込みの有効性を評価すること。
  • 知覚に基づいた埋め込みが、はるかに大きな音声のみのデータセットで学習されたモデルと同等またはそれ以上の性能を発揮できることを示すこと。

提案手法

  • 1.5秒の同期された音声とEEG入力をエンドツーエンドで処理する2ビューのニューラルネットワークアーキテクチャを設計する。
  • 音声とEEGの埋め込み空間間の相関を最大化するために、損失関数としてDeep Canonical Correlation Analysis (DCCA) を採用する。
  • 各音声-EEG記録を1.5秒のチャンクに分割し、訓練に使用。曲単位の埋め込みは、チャンクレベルの出力を平均することで得る。
  • 5分割交差検証を採用。1フォールドあたり20エポックを訓練。2.5時間の音声-EEGデータを人間被験者から収集して訓練。
  • 訓練済みモデルを代理タスク(音声・歌詞間クロスモーダル検索)における特徴抽出器として適用する。
  • Spotifyの手作業特徴量と、2083時間以上の音声データで学習されたSOTAモデル(Choiら)と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1EEG信号は、音声のみのモデルを超えて、音楽意味論のディープラーニングモデルを正則化する有効な手段となり得るか?
  • RQ2音声とEEGのDCCAベースの共同埋め込み空間は、音声のみのモデルに比べてより優れた転送可能な表現を生み出せるか?
  • RQ33時間未満の音声-EEGデータで学習したモデルが、700倍以上のデータで学習されたSOTAモデルを上回る性能を発揮できるか?
  • RQ4知覚的脳信号の組み込みが、音楽意味的埋め込みの品質と一般化性能にどのように影響するか?

主な発見

  • 提案されたEEG正則化モデルは、音声・歌詞間検索においてインスタンスベースの平均逆順位(MRR)24.6%を達成。Spotifyの23.4%を上回った。
  • クラスベースのMRRは36.2%を記録。Spotifyの35.1%を上回り、SOTAモデル(Choi)の36.5%と同等の性能を達成した。
  • 3時間未満の音声-EEGデータでの学習にもかかわらず、2083時間以上の音声データで学習されたモデルと同等の性能を発揮した。
  • 単一GPUで約20分間の訓練時間で学習が完了し、高い訓練効率を示した。
  • 定性的な利点として、音声とEEGの間で細かく時間同期された関係性が得られ、固定された意味的分類体系を回避できた。
  • 将来の改善策として、残差接続、埋め込み集約のためのLSTM、個別被験者向けモデリングの導入により、さらなる性能向上が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。