[論文レビュー] Bootstrap Latent Representations for Multi-modal Recommendation
本稿では、潜在的埋め込みドロップアウトを用いて対照的ビューをブートストラップすることで、負例サンプリングや補助グラフの必要性を排除する自己教師ありマルチモーダル推薦モデルBM3を提案する。相互作用グラフ再構築、クロスモダリティ整合性、およびモダリティ内特徴マスキングを共同最適化し、20,000〜200,000ノードのデータセットでSOTAの精度を達成するとともに、2〜9倍高速な学習を実現した。
This paper studies the multi-modal recommendation problem, where the item multi-modality information (e.g., images and textual descriptions) is exploited to improve the recommendation accuracy. Besides the user-item interaction graph, existing state-of-the-art methods usually use auxiliary graphs (e.g., user-user or item-item relation graph) to augment the learned representations of users and/or items. These representations are often propagated and aggregated on auxiliary graphs using graph convolutional networks, which can be prohibitively expensive in computation and memory, especially for large graphs. Moreover, existing multi-modal recommendation methods usually leverage randomly sampled negative examples in Bayesian Personalized Ranking (BPR) loss to guide the learning of user/item representations, which increases the computational cost on large graphs and may also bring noisy supervision signals into the training process. To tackle the above issues, we propose a novel self-supervised multi-modal recommendation model, dubbed BM3, which requires neither augmentations from auxiliary graphs nor negative samples. Specifically, BM3 first bootstraps latent contrastive views from the representations of users and items with a simple dropout augmentation. It then jointly optimizes three multi-modal objectives to learn the representations of users and items by reconstructing the user-item interaction graph and aligning modality features under both inter- and intra-modality perspectives. BM3 alleviates both the need for contrasting with negative examples and the complex graph augmentation from an additional target network for contrastive view generation. We show BM3 outperforms prior recommendation models on three datasets with number of nodes ranging from 20K to 200K, while achieving a 2-9X reduction in training time. Our code is available at https://github.com/enoche/BM3.
研究の動機と目的
- 大規模なユーザ-アイテム相互作用グラフにおけるベイジアンパーソナライズドランク(BPR)損失の負例サンプリングにかかる高い計算コストを低減すること。
- 既存のGNNベースのマルチモーダル推薦手法で用いられる補助グラフ(例:ユーザ-ユーザ、アイテム-アイテム)に起因するメモリおよび計算負荷を軽減すること。
- 追加のネットワークを用いずに、潜在表現からの対照的ビューを生成することで、自明な解やノイズの多い監視を回避する自己教師ありフレームワークの開発。
- 統一された目的関数を用いて、マルチモーダル統合と相互作用グラフ再構築を共同最適化し、表現学習を強化すること。
- 大規模なマルチモーダルデータセットにおいて、SOTAの推薦精度を達成するとともに、学習時間を顕著に短縮すること。
提案手法
- BM3は、ユーザおよびアイテムの潜在的埋め込みに対してランダムドロップアウトを適用することで、複雑なデータ増強やターゲットネットワークを用いずに、対照的ビューをブートストラップする。
- マルチモーダル対照的損失を導入し、以下の3つを同時に最小化する:(1) ユーザ-アイテム相互作用グラフ再構築損失、(2) アイテムID埋め込みとそのマルチモーダル特徴間のクロスモダリティ整合性損失、(3) モダリティ固有の特徴に対するモダリティ内特徴マスキング損失。
- モデルはグラフニューラルネットワーク(GNN)バックボーンを用い、表現を伝搬および集約するが、対照的ビュー生成はドロップアウトによる潜在空間の摂動にのみ依存する。
- 負例サンプリングを回避するため、同一サンプルの摂動されたビューから対照的信号を抽出するポジティブオンative対照学習に依存する。
- 正則化係数とドロップアウト率は、データセットごとに表現の安定性と性能のバランスを取るために調整されるハイパーパrameterである。
- 本手法は、3つの実世界データセット上でエンドツーエンドに評価され、最大200,000ノードを有する大規模なエレクトロニクスデータセットも含む。
実験結果
リサーチクエスチョン
- RQ1自己教師ありマルチモーダル推薦モデルは、BPR損失における負例サンプリングの必要性を排除しつつ、推薦精度を維持または向上させることができるか?
- RQ2補助ネットワークや複雑なデータ増強を用いずに、潜在的埋め込みから効果的に対照的ビューを生成できるか?
- RQ3相互作用グラフ再構築、クロスモダリティ統合、およびモダリティ内マスキングの共同最適化は、マルチモーダル推薦における表現学習を向上させるか?
- RQ4本手法の性能は、サイズが異なるデータセットにおいてどのようにスケーリングされるか、特に大規模グラフにおいては?
- RQ5異なる損失部の寄与度はモデル性能にどのように影響するか、また、小規模および大規模データセットにおいてその寄与度はどのように変化するか?
主な発見
- BM3は、最大200,000ノードを有する大規模なエレクトロニクスデータセットも含む3つの実世界データセットでSOTAの性能を達成した。
- ベースライン手法と比較して、学習時間を2〜9倍短縮し、特に大規模グラフにおいて顕著な効率性の向上を示した。
- エレクトロニクスデータセットでは、明示的なマルチモーダル信号が存在しない状況でもBM3が既存手法を上回った。これは、自己教師あり目的関数からの強力な表現学習を示唆している。
- アブレーションスタディの結果、小規模データセットではモダリティ間統合損失とモダリティ内マスキング損失が性能向上に重要であるが、大規模データセットでは監視信号が支配的になるため、その寄与度は低下した。
- ハイパーパrameter設定に対して頑健であり、ドロップアウト率が0.2以上で、さまざまな正則化係数に対しても安定した性能を示した。特に大規模データでは顕著であった。
- マルチモーダル信号を含まないBM3(BM3 w/o mm)の性能は、エレクトロニクスデータセットで既に競争力があり、自己教師あり信号のみで強力な表現が得られることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。