Skip to main content
QUICK REVIEW

[論文レビュー] Emotion-Based End-to-End Matching Between Image and Music in Valence-Arousal Space

Sicheng Zhao, Yaxian Li|arXiv (Cornell University)|Aug 22, 2020
Music and Audio Processing参考文献 87被引用数 4
ひとこと要約

本稿は、連続的評価・覚醒(VA)空間における感情ベースの画像・音楽照合のための新規エンドツーエンドフレームワーク、Cross-Modal Deep Continuous Metric Learning(CDCML)を提案する。共通の埋め込み空間において、クロスモodal類似性と単モーダルVA感情関係を同時に最適化することで、140,000組以上の画像・音楽ペアを含む新しい大規模データセットIMEMNETにおいて、先行手法と比較してMSEで22.1%、MAEで5.4%の相対的改善を達成した。

ABSTRACT

Both images and music can convey rich semantics and are widely used to induce specific emotions. Matching images and music with similar emotions might help to make emotion perceptions more vivid and stronger. Existing emotion-based image and music matching methods either employ limited categorical emotion states which cannot well reflect the complexity and subtlety of emotions, or train the matching model using an impractical multi-stage pipeline. In this paper, we study end-to-end matching between image and music based on emotions in the continuous valence-arousal (VA) space. First, we construct a large-scale dataset, termed Image-Music-Emotion-Matching-Net (IMEMNet), with over 140K image-music pairs. Second, we propose cross-modal deep continuous metric learning (CDCML) to learn a shared latent embedding space which preserves the cross-modal similarity relationship in the continuous matching space. Finally, we refine the embedding space by further preserving the single-modal emotion relationship in the VA spaces of both images and music. The metric learning in the embedding space and task regression in the label space are jointly optimized for both cross-modal matching and single-modal VA prediction. The extensive experiments conducted on IMEMNet demonstrate the superiority of CDCML for emotion-based image and music matching as compared to the state-of-the-art approaches.

研究の動機と目的

  • 既存の感情ベースの画像・音楽照合手法が粗いカテゴリカルな感情ラベルとマルチステージパイプラインに依存するという限界を是正すること。
  • 連続的評価・覚醒(VA)空間において、クロスモダリティ類似性と単モダル感情関係を両立させる共有潜在埋め込み空間をエンドツーエンドで学習可能にする。
  • 連続的VA感情ラベルでアノテートされた140,000組以上の画像・音楽ペアを含む大規模かつ公開可能なデータセットIMEMNETを構築すること。
  • 共有埋め込み空間におけるメトリクス学習とラベル空間における回帰を、クロスモダリティ照合と単モダルVA予測の両方に対して同時に最適化すること。
  • クロスモダリティおよび単モダル空間における感情的関係の保存が、一般化性能と性能向上に寄与することを示すこと。

提案手法

  • 連続的評価・覚醒(VA)感情ラベルでアノテートされた140,000組の画像・音楽ペアを含む大規模データセットIMEMNETを構築する。
  • クロスモダリティ類似性と単モダルVA感情関係の両方を同時に最適化する、マルチタスク学習フレームワークであるCross-Modal Deep Continuous Metric Learning(CDCML)を提案する。
  • 画像と音楽を共通の潜在空間に埋め込むために、共有されたシアンズ型ネットワークアーキテクチャを用い、MSE、特徴量比、特徴量マージン損失を用いてクロスモダリティ類似性を維持する。
  • 埋め込み空間における単モダル監視を導入し、VAのMSE損失と単モダル特徴量比損失を適用することで、モダリティ内感情関係を保持する。
  • 共有埋め込みから照合類似性と連続的VA値を同時に予測するマルチタスクヘッドを採用する。
  • クロスモダリティおよび単モダル監視を統合した複合損失を用いて、ネットワーク全体をエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1共通の埋め込み空間におけるエンドツーエンド学習は、マルチステージパイプラインと比較して、感情ベースの画像・音楽照合性能を向上させ得るか?
  • RQ2クロスモダリティおよび単モダル空間の両方で連続的評価・覚醒(VA)感情関係を保存することは、照合性能の向上に寄与するか?
  • RQ3照合類似性とVA予測の共同最適化は、一般化性能およびロバストネスをどの程度向上させるか?
  • RQ4連続的VA監視の導入は、学習された埋め込みの判別性にどのような影響を及ぼすか?
  • RQ5IMEMNETのような大規模かつ公開可能なデータセットは、感情ベースの画像・音楽照合モデルの公平かつ再現可能なベンチマークを可能にするか?

主な発見

  • CDCMLは、最も優れた既存手法ACP-Netと比較して、照合類似度予測のMSEで22.1%の相対的改善を達成した。
  • 類似度予測における平均絶対誤差(MAE)も5.4%の相対的改善を示し、優れた回帰性能を示した。
  • クロスモダリティ特徴量比損失の導入により、照合類似度予測および単モダルVA予測の両方の性能が顕著に向上し、特徴量の判別性が向上した。
  • 単モダルVAのMSEおよび特徴量比損失を追加することで、特にVA予測の性能が向上し、モダリティ内感情構造の重要性を裏付けた。
  • 定性的な可視化では、CDCMLが、例えて「悲しみ」の感情を共有する音楽と「退廃的」な感情を共有する画像を適切に照合できていることが示された。
  • アブレーションスタディにより、クロスモダリティおよび単モダル監視の共同最適化が、単独で使用する損失よりも優れた一般化性能をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。