[論文レビュー] Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning
本稿では、ユーザー行動シーケンスとアイテムのマルチモーダルコンテンツ(テキストおよび画像)を対照的学習を用いて整合化する、順序推薦のためのマルチモーダル事前学習フレームワークMSM4SRを提案する。視覚言語モデルを用いて画像特徴をテキストトークンに変換し、新規のマルチモーダルミックスアップシーケンスエンコーダー(M2SE)を採用することで、モダリティの差異とドメインギャップを低減し、実世界のデータセットにおいて順序推薦、コールドスタート、クロスドメイン推薦のタスクで最先端の性能を達成する。
Current multimodal sequential recommendation models are often unable to effectively explore and capture correlations among behavior sequences of users and items across different modalities, either neglecting correlations among sequence representations or inadequately capturing associations between multimodal data and sequence data in their representations. To address this problem, we explore multimodal pre-training in the context of sequential recommendation, with the aim of enhancing fusion and utilization of multimodal information. We propose a novel Multimodal Pre-training for Sequential Recommendation (MP4SR) framework, which utilizes contrastive losses to capture the correlation among different modality sequences of users, as well as the correlation among different modality sequences of users and items. MP4SR consists of three key components: 1) multimodal feature extraction, 2) a backbone network, Multimodal Mixup Sequence Encoder (M2SE), and 3) pre-training tasks. After utilizing pre-trained encoders to generate initial multimodal features of items, M2SE adopts a complementary sequence mixup strategy to fuse different modality sequences, and leverages contrastive learning to capture modality interactions at the sequence-to-sequence and sequence-to-item levels. Extensive experiments on four real-world datasets demonstrate that MP4SR outperforms state-of-the-art approaches in both normal and cold-start settings. We further highlight the efficacy of incorporating multimodal pre-training in sequential recommendation representation learning, serving as an effective regularizer and optimizing the parameter space for the recommendation task.
研究の動機と目的
- 豊富なマルチモーダルアイテムコンテンツ(テキストおよび画像)を活用して、順序推薦におけるデータスパarsity問題に対処する。
- マルチモーダル推薦におけるテキストモダリティと視覚モダリティ間の表現差異を低減する。
- 統一された事前学習フレームワークを通じて、ユーザー行動シーケンスとアイテムのマルチモーダルコンテンツの間のドメインギャップを埋める。
- 混合モダリティシーケンスにおける対照的学習を通じて、順序推薦モデルの汎化性能と移行可能性を向上させる。
- コールドスタートやクロスドメイン推薦のような困難なシナリオにおいて、提案フレームワークの有効性を示す。
提案手法
- 視覚言語事前学習モデルを用いて、アイテムの画像をテキストキーワードにトークン化し、テキスト記述と意味的整合性を確保する。
- Sentence-BERTを用いて、画像トークンとアイテム記述からの初期テキストおよび視覚埋め込みを抽出し、モダリティ差異を低減する。
- ユーザー行動シーケンスとマルチモーダルアイテム特徴を、補完的なシーケンスミックスアップ戦略を用いて統合するマルチモーダルミックスアップシーケンスエンコーダー(M2SE)を設計する。
- 2つの対照的学習目的を導入する:モダリティ固有の次アイテム予測と、モダリティ間の対照的学習により、異なるモダリティの表現を整合化する。
- 微調整を実行する前段階として、自己教師付き対照的信号を用いて、温かいアイテム(warm items)上でM2SEを事前学習する。
- 変換器バックボーンを固定し、適応段階でモダリティエンコーダーのみを更新することで、パラメータ効率の良い微調整を実施する。
実験結果
リサーチクエスチョン
- RQ1対照的学習を用いたマルチモーダル事前学習は、データスパarsity状況下でも順序推薦性能を向上させることができるか?
- RQ2提案されたM2SEモジュールは、マルチモーダルアイテムコンテンツと順序ユーザー行動を効果的に統合できるか?
- RQ3対照的学習目的は、モダリティ差異をどの程度低減し、表現の汎化性能を向上させるか?
- RQ4事前学習されたMSM4SRフレームワークは、コールドスタートおよびクロスドメイン推薦シナリオに一般化可能か?
- RQ5画像からテキストトークンを生成する手法は、直接的な画像埋め込み手法に比べて、マルチモーダル整合性を向上させるか?
主な発見
- MSM4SRは3つの実世界データセットにおいて、最先端の順序推薦モデルを上回り、全評価指標で最高の性能を達成した。
- コールドスタート推薦において、MSM4SRは最良のベースライン比でR@10で15.5%、N@10で14.7%の向上を達成し、低データアイテムへの汎化性能が優れていることを示した。
- クロスドメイン推薦において、MSM4SR CrossはPantryデータセットでR@10(0.0622)とN@10(0.0294)で最高を記録し、ArtsデータセットではR@10が0.1041に達し、UniSRecとRecGURUを上回った。
- アブレーションスタディにより、事前学習が極めて重要であることが確認された:MSM4SR w/o Pre-trainは完全モデルに劣り、自己教師付き事前学習の価値を裏付けた。
- クロスモダリティ対照的学習損失は、ドメイン内および移行学習タスクの両方でより良い性能を示しており、表現の整合性を著しく向上させた。
- 画像から得たテキストトークンの使用は、直接的な画像エンコーダーに比べて、より良い意味的整合性を実現し、追加のプロジェクションヘッドなしにモダリティギャップを低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。