[論文レビュー] Pre-training Graph Transformer with Multimodal Side Information for Recommendation
本稿では、自己教師あり事前学習フレームワークとして、Pre-trained Multimodal Graph Transformer (PMGT) を提案する。PMGT は、均質的なアイテムグラフを用いて、テキストや画像といったマルチモーダルな補助情報と、ユーザー主導のアイテム関係(例:共同購入)を統合的にモデリングすることで、アイテム表現を学習する。グラフ構造再構成とマスキングされたノード特徴再構成の二つの自己教師あり目的を活用することで、実世界のデータセットにおいて、アイテム推薦、クリックスルーレート予測、アイテム分類の各タスクで最先端の性能を達成し、オンライン A/B テストでは動画再生回数が 6.80% 増加した。
Side information of items, e.g., images and text description, has shown to be effective in contributing to accurate recommendations. Inspired by the recent success of pre-training models on natural language and images, we propose a pre-training strategy to learn item representations by considering both item side information and their relationships. We relate items by common user activities, e.g., co-purchase, and construct a homogeneous item graph. This graph provides a unified view of item relations and their associated side information in multimodality. We develop a novel sampling algorithm named MCNSampling to select contextual neighbors for each item. The proposed Pre-trained Multimodal Graph Transformer (PMGT) learns item representations with two objectives: 1) graph structure reconstruction, and 2) masked node feature reconstruction. Experimental results on real datasets demonstrate that the proposed PMGT model effectively exploits the multimodality side information to achieve better accuracies in downstream tasks including item recommendation, item classification, and click-through ratio prediction. We also report a case study of testing the proposed PMGT model in an online setting with 600 thousand users.
研究の動機と目的
- 既存の推薦モデルがマルチモーダルな補助情報(例:テキスト、画像)を十分に活用していないこと、およびアイテム関係を独立して扱っているという制限を解消すること。
- 単一のグラフ構造内で、アイテムのマルチモーダル特徴とユーザー主導のアイテム関係(例:共同購入)を統合的にモデリングする包括的なフレームワークを構築すること。
- この包括的なマルチモーダルグラフ上で自己教師あり目的を用いてグラフニューラルネットワークを事前学習することで、下流の推薦タスクの性能を向上させること。
- 提案された事前学習戦略が、オフラインベンチマークおよび実際のオンライン展開の両方で有効であることを検証すること。
提案手法
- ノードがアイテムを表し、エッジがユーザーの相互作用における共起(例:共同購入)を表す均質的なアイテムグラフを構築する。エッジの重みは相互作用頻度に基づく。
- 各アイテムの文脈的近傍を効果的に選択するための新しいサンプリングアルゴリズム MCNSampling を提案する。
- マルチモーダル特徴(テキスト、画像)、位置ID埋め込み、役割ラベル埋め込みを用いて、入力表現を豊かにする。
- グラフ構造再構成とマスキングされたノード特徴再構成の二つの自己教師あり目的を用いてモデルを訓練する。
- 事前学習済みモデルを、アイテム推薦、CTR予測、アイテム分類などの下流タスクで微調整する。バックボーンは固定し、分類器ヘッドのみ学習可能とする。
- オンラインケーススタディでは、事前学習済み表現のコサイン類似度を用いて動画検索を実施し、最終順位付けには ItemKNN を統合する。
実験結果
リサーチクエスチョン
- RQ1包括的なマルチモーダルアイテムグラフ上で事前学習することで、推薦システムの表現学習が向上するか?
- RQ2提案された自己教師あり事前学習戦略(グラフ構造再構成とマスキング特徴再構成)は、アイテムのコンテンツ情報と関係性情報を両方効果的に捉えられるか?
- RQ3PMGT モデルは、アイテム推薦、CTR予測、アイテム分類といった多様な下流タスクに一般化可能か?
- RQ4事前学習済み表現は、実際のオンライン推薦システムにおいて、既存のベースラインを上回る性能を示せるか?
主な発見
- PMGT は、三つの実世界データセット(MI、IS、ML)において、すべての下流タスク(アイテム推薦、CTR予測、アイテム分類)で最先端の性能を達成した。
- 分類タスクに置き換えた PMGT-NP よりも、PMGT が優れた性能を示し、自己教師あり事前学習の価値を裏付けた。
- 淘宝(Taobao)の動画推薦システムにおけるオンライン A/B テストでは、PMGT が UNITER 埋め込みを用いたベースラインと比較して、新規動画再生回数を 6.80% 増加させた。
- ケーススタディでは、PMGT を用いた動画検索が、UNITER を用いた検索よりも多様な推薦結果を生み出した。これは、より優れた意味的・関係的理解を示している。
- モデルの性能は、異なるデータモダリティおよびタスクにおいても安定しており、マルチモーダル特徴とユーザー主導のアイテム関係を統合的にモデリングすることの有効性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。