Skip to main content
QUICK REVIEW

[論文レビュー] Latent Structures Mining with Contrastive Modality Fusion for Multimedia Recommendation.

Jinghao Zhang, Yanqiao Zhu|arXiv (Cornell University)|Nov 1, 2021
Recommender Systems and Techniques参考文献 36被引用数 6
ひとこと要約

本稿では、マルチモーダル推薦フレームワークMICROを提案する。MICROは、モダリティ固有の潜在的アイテム同士の構造を抽出し、対照的モダリティ統合を用いてアイテム表現学習を向上させる。モダリティに適応したグラフ畳み込みと対照的特徴統合を統合することで、実世界のデータセットにおいて最先端の手法を上回る性能を発揮し、マルチモーダルコンテンツおよびアイテム関係のより良いモデリングにより推薦精度が向上することを示している。

ABSTRACT

Recent years have witnessed growing interests in multimedia recommendation, which aims to predict whether a user will interact with an item with multimodal contents. Previous studies focus on modeling user-item interactions with multimodal features included as side information. However, this scheme is not well-designed for multimedia recommendation. Firstly, only collaborative item-item relationships are implicitly modeled through high-order item-user-item co-occurrences. We argue that the latent semantic item-item structures underlying these multimodal contents could be beneficial for learning better item representations and assist the recommender models to comprehensively discover candidate items. Secondly, previous studies disregard the fine-grained multimodal fusion. Although having access to multiple modalities might allow us to capture rich information, we argue that the simple coarse-grained fusion by linear combination or concatenation in previous work is insufficient to fully understand content information and item relationships.To this end, we propose a latent structure MIning with ContRastive mOdality fusion method (MICRO for brevity). To be specific, we devise a novel modality-aware structure learning module, which learns item-item relationships for each modality. Based on the learned modality-aware latent item relationships, we perform graph convolutions that explicitly inject item affinities to modality-aware item representations. Then, we design a novel contrastive method to fuse multimodal features. These enriched item representations can be plugged into existing collaborative filtering methods to make more accurate recommendations. Extensive experiments on real-world datasets demonstrate the superiority of our method over state-of-the-art baselines.

研究の動機と目的

  • 既存のマルチモーダル推薦手法が、個々のモダリティ内での潜在的意味的アイテム同士の関係を明示的にモデリングできないという限界を解消すること。
  • 例えば連結や線形結合といった粗い粒度のマルチモーダル統合では、モダリティ間の細粒度な相互作用を十分に捉えられないという不十分さを克服すること。
  • グラフ畳み込みニューラルネットワークを用いてモダリティに適応したアイテム類似度を統合することで、アイテム表現学習を向上させること。
  • 対照的学習戦略を用いて、判別性の高い意味的情報を保持するようにマルチモーダル特徴統合を強化すること。
  • 既存の協調フィルタリングモデルと互換性があり、アーキテクチャの大幅な見直しを伴わずに推薦性能を向上できる、プラグアンドプレイモジュールの開発

提案手法

  • 各モダリティに対して学習された注目度または類似度行列を用いて、アイテム同士の関係を明示的にモデリングするモダリティに適応した構造学習モジュールを提案する。
  • モダリティ固有のアイテム類似度グラフにグラフ畳み込みネットワーク(GCN)を適用し、潜在的アイテム類似度を組み込むことでアイテム表現を精緻化する。
  • 正例ペアをモダリティ間で一致させ、負例ペアを分離することで特徴の判別性を高める、対照的学習に基づく統合機構を設計する。
  • 対照的損失関数を用い、同じアイテムに対してはモダリティ固有の表現をより類似させ、異なるアイテムに対してはより相違させるように促進する。
  • 強化されたマルチモーダル表現を標準的な協調フィルタリングフレームワークに統合し、エンドツーエンドの推薦学習を実現する。
  • 各モダリティを統合前に独立して処理する二重ストリームアーキテクチャを採用することで、モダリティ固有の構造抽出と共同表現学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1モダリティ固有の潜在的アイテム同士の関係をモデリングすることで、マルチモーダル推薦におけるアイテム表現学習が向上するか?
  • RQ2従来の連結や線形統合と比較して、マルチモーダル特徴の対照的統合はより優れた表現品質をもたらすか?
  • RQ3モダリティに適応したグラフ畳み込みの統合は、ベースラインの協調フィルタリングと比較して推薦性能にどのように影響するか?
  • RQ4提案手法は、実世界のデータセットにおいて、最先端のマルチモーダル推薦モデルをどの程度上回るか?
  • RQ5提案フレームワークは、アーキテクチャの大幅な見直しを伴わずに、既存の協調フィルタリングモデルに効果的に統合可能か?

主な発見

  • MICROは、複数の実世界のマルチモーダル推薦データセットにおいて、最先端のベースラインを上回る優れた性能を達成した。
  • アブレーションスタディの結果、モダリティに適応した構造学習と対照的統合の両方が、性能向上に顕著な寄与をしていることが確認された。
  • モダリティ固有のグラフ畳み込みを通じて、細粒度のアイテム関係を捉えることで、表現品質が向上した。
  • 対照的統合により、より判別性の高いマルチモーダル埋め込みが得られ、類似するアイテムを区別する能力が向上した。
  • 複数のデータセットおよび複数の評価指標(Recall、NDCG、Precision)において一貫した性能向上が見られた。
  • プラグアンドプレイ設計により、MICROは既存の協調フィルタリングモデルに容易に統合可能であり、明確な性能向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。