Skip to main content
QUICK REVIEW

[論文レビュー] Parameter-Efficient Transfer from Sequential Behaviors for User Modeling and Recommendation

Fajie Yuan, Xiangnan He|arXiv (Cornell University)|Jan 13, 2020
Recommender Systems and Techniques参考文献 42被引用数 9
ひとこと要約

本論文では、主なネットワークを微調整せずに、多様な下流推薦タスクに事前学習済みの順序付きユーザ行動モデルを効率的に適応するパラメータ効率の良い転移学習フレームワーク、PeterRecを提案する。固定された事前学習済み表現に埋め込む小さな学習可能な「モデルパッチ」を介して、PeterRecは完全微調整と同等の性能を達成する一方、パラメータ更新とメモリ使用量を著しく削減する。特にデータが少ない状況下で顕著な効果を示す。

ABSTRACT

Inductive transfer learning has had a big impact on computer vision and NLP domains but has not been used in the area of recommender systems. Even though there has been a large body of research on generating recommendations based on modeling user-item interaction sequences, few of them attempt to represent and transfer these models for serving downstream tasks where only limited data exists. In this paper, we delve on the task of effectively learning a single user representation that can be applied to a diversity of tasks, from cross-domain recommendations to user profile predictions. Fine-tuning a large pre-trained network and adapting it to downstream tasks is an effective way to solve such tasks. However, fine-tuning is parameter inefficient considering that an entire model needs to be re-trained for every new task. To overcome this issue, we develop a parameter efficient transfer learning architecture, termed as PeterRec, which can be configured on-the-fly to various downstream tasks. Specifically, PeterRec allows the pre-trained parameters to remain unaltered during fine-tuning by injecting a series of re-learned neural networks, which are small but as expressive as learning the entire network. We perform extensive experimental ablation to show the effectiveness of the learned user representation in five downstream tasks. Moreover, we show that PeterRec performs efficient transfer learning in multiple domains, where it achieves comparable or sometimes better performance relative to fine-tuning the entire model parameters. Codes and datasets are available at https://github.com/fajieyuan/sigir2020_peterrec.

研究の動機と目的

  • 限られたラベル付きデータを伴う下流タスクへの順序付き行動からのユーザ表現の転送の課題に対処すること。
  • 微調整時に全事前学習モデルの再訓練を回避するパラメータ効率の良い手法を開発すること。
  • 単一のユニバーサルユーザ表現を用いて複数のドメインおよびタスク間での効果的な転送を可能にすること。
  • マルチタスク推薦シナリオにおけるメモリおよび計算コストの低減を図ること。
  • 自己教師付き事前学習によって順序付きインタラクションに学習させた結果、転送可能なユーザ表現が得られることを示すこと。

提案手法

  • 2段階の訓練手順:まず、自己教師付きの次アイテム予測を用いて、順序付きニューラルネットワーク(例:NextItNetスタイル)をユーザインタラクションシーケンス上で事前学習する。
  • 「モデルパッチ」(MP)モジュールの導入—事前学習済みネットワークの残差ブロックに挿入される小さな学習可能な全結合ネットワーク。
  • MPは残差パスと並列に挿入され、固定された事前学習済み特徴を下流タスクに適応する役割を果たす。
  • 微調整時には、MPパラメータのみが更新され、すべての事前学習済み重みは凍結されるため、高いパラメータ効率が達成される。
  • 勾配不安定性を避けるために、正規化層の直前にMPを挿入することで、残差ブロックの整合性を保つ。
  • 各ターゲットタスクに対して新しい小さなMPを単に学習することで、新規タスクへのオンザフライ適応が可能になる。

実験結果

リサーチクエスチョン

  • RQ1順序付きユーザ行動における自己教師付き事前学習が、多様な下流タスクに転送可能なユニバーサルユーザ表現を生成できるか?
  • RQ2パラメータ効率の良い微調整手法が、低データまたはマルチドメイン設定で完全微調整を上回れるか?
  • RQ3モデルパッチのアーキテクチャおよび配置が、性能および安定性に与える影響は何か?
  • RQ4タスク間でパラメータを共有することで、精度を損なわずに効率が向上するか?
  • RQ5本手法はデータが限られた状況下でも頑健であるか?

主な発見

  • PeterRecは、クロスドメイン推薦やユーザプロファイル予測を含む5つの下流タスクすべてで、完全微調整(FineAll)と同等の性能を達成した。
  • 訓練データの5%のみを用いても、PeterRecはFineAllを1.5%上回る最適性能を示し、優れた一般化性能と安定性を示した。
  • 正則化やドロップアウトを適用しても、PeterRecはFineAllに比べて著しく過学習を抑制した。
  • 正規化層の直前に挿入されたモデルパッチ(図3b)が最良の性能を示し、残差ブロック構造と勾配フローを保持した。
  • PeterRecは、マルチタスク学習(MTL)よりもメモリ効率が高く、全モデルを保存するのではなく、タスク固有の小さなMPパラメータのセットのみを保存するためである。
  • より優れた事前学習モデル(例:PeterRecon)が、必ずしもより良い転送性能をもたらすわけではない。これは、上流の事前学習品質よりも、下流タスクとの整合性の重要性がより顕著であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。