Skip to main content
QUICK REVIEW

[論文レビュー] Latent Structure Mining with Contrastive Modality Fusion for Multimedia Recommendation

Jinghao Zhang, Yanqiao Zhu|arXiv (Cornell University)|Nov 1, 2021
Recommender Systems and Techniques被引用数 7
ひとこと要約

本稿では、マルチモーダル特徴から隠れられたアイテム同士の関係性をモダリティに依存するグラフ構造学習を用いて抽出し、対照的学習の目的関数によってマルチモーダル融合を強化する、新しいマルチメディア推薦フレームワークMICROを提案する。モダリティ固有のアイテム関係性とクロスモーダル整合性を同時に最適化することで、3つの実世界のデータセットにおいて最先端の手法を上回る推薦精度を達成する。

ABSTRACT

Recent years have witnessed growing interests in multimedia recommendation, which aims to predict whether a user will interact with an item with multimodal contents. Previous studies focus on modeling user-item interactions with multimodal features included as side information. However, this scheme is not well-designed for multimedia recommendation. Firstly, only collaborative item-item relationships are implicitly modeled through high-order item-user-item co-occurrences. We argue that the latent semantic item-item structures underlying these multimodal contents could be beneficial for learning better item representations and assist the recommender models to comprehensively discover candidate items. Secondly, previous studies disregard the fine-grained multimodal fusion. Although having access to multiple modalities might allow us to capture rich information, we argue that the simple coarse-grained fusion by linear combination or concatenation in previous work is insufficient to fully understand content information and item relationships.To this end, we propose a latent structure MIning with ContRastive mOdality fusion method (MICRO for brevity). To be specific, we devise a novel modality-aware structure learning module, which learns item-item relationships for each modality. Based on the learned modality-aware latent item relationships, we perform graph convolutions that explicitly inject item affinities to modality-aware item representations. Then, we design a novel contrastive method to fuse multimodal features. These enriched item representations can be plugged into existing collaborative filtering methods to make more accurate recommendations. Extensive experiments on real-world datasets demonstrate the superiority of our method over state-of-the-art baselines.

研究の動機と目的

  • 既存のマルチメディア推薦手法がマルチモーダルアイテム特徴に内在する隠れされた意味的構造を十分に活用していないという限界を解消すること。
  • マルチモーダル情報の統合に単純な線形的または連結的統合手法が不十分であるという問題を克服すること。
  • 各モダリティ内でアイテム同士の関係性を明示的にモデル化することで、アイテム表現を豊かにすること。
  • モダリティ固有の表現とそれらのマルチモーダル統合表現を一致させる対照的学習フレームワークを構築し、より細分化された統合を実現すること。
  • 強化されたアイテム表現を協調フィルタリングモデルに統合し、推薦性能を向上させること。

提案手法

  • 各モダリティにおけるアイテム同士の関係性を、ペairワイズ類似度を距離測度としてモデル化することで学習する、モダリティに依存する構造学習モジュールを導入する。
  • グラフ畳み込みネットワークを用いて、学習されたモダリティに依存するアイテム類似度をモダリティ固有のアイテム表現に組み込む。
  • 各アイテムのモダリティに依存する表現とそのマルチモーダル統合表現を一致させる対照的学習フレームワークを設計する。
  • 対照的目的関数は、個々のモダリティ表現と最終的なマルチモーダル統合表現の間で一致を最大化し、強固で判別性の高い埋め込みを促進する。
  • 強化されたアイテム表現を協調フィルタリングモデルに統合し、推薦性能を向上させる。
  • 構造学習、対照的学習、協調フィルタリングの3つを統合した共同目的関数を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダル特徴から導出された隠れアイテム同士の関係性は、マルチメディア推薦におけるアイテム表現学習を改善するか?
  • RQ2モダリティ固有の表現とマルチモーダル統合表現を一致させる対照的学習フレームワークは、マルチモーダル情報の統合をより良くするか?
  • RQ3モダリティに依存する構造学習は、異なるモダリティ間のアイテム間の意味的関係をどれほど効果的に捉えられるか?
  • RQ4提案手法は、既存の最先端のマルチメディア推薦モデルをどの程度上回るか?
  • RQ5各構成要素(構造学習と対照的統合)が全体の推薦性能に果たす寄与度はどの程度か?

主な発見

  • MICROは、3つの実世界のマルチメディア推薦データセットにおいて最先端の性能を達成し、ランキング指標および精度指標の両面で既存手法を上回っている。
  • アブレーションスタディの結果、モダリティに依存する構造学習と対照的統合フレームワークの両方が推薦性能の向上に顕著に寄与することが確認された。
  • さまざまな評価指標において一貫した向上が見られ、モデルの頑健性と一般化能力が裏付けられた。
  • 対照的学習部は、モダリティ固有の表現とマルチモーダル統合表現を効果的に一致させ、特徴の質を向上させた。
  • 学習されたアイテム関係性の統合により、より正確で意味的に明確なアイテム埋め込みが得られた。
  • 豊富なマルチモーダルコンテンツと構造的関係性を活用することで、コールドスタートアイテムの処理においても高い有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。