Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Reinforcement Learning for Recommender Systems

Xin Xin, Alexandros Karatzoglou|arXiv (Cornell University)|Jun 10, 2020
Recommender Systems and Techniques参考文献 40被引用数 17
ひとこと要約

本稿では、順序付き推薦モデルに二重出力ヘッドを追加することで、自己教師付き強化学習(SRL)を順序付き推薦に適用する手法を提案する。一方のヘッドは自己教師学習用、もう一方は長期報酬を最適化する強化学習(RL)用である。RLヘッドは予測の正則化子として機能し、特に購入予測において、実世界のECデータで教師ありベースラインを上回る性能を発揮する。

ABSTRACT

In session-based or sequential recommendation, it is important to consider a number of factors like long-term user engagement, multiple types of user-item interactions such as clicks, purchases etc. The current state-of-the-art supervised approaches fail to model them appropriately. Casting sequential recommendation task as a reinforcement learning (RL) problem is a promising direction. A major component of RL approaches is to train the agent through interactions with the environment. However, it is often problematic to train a recommender in an on-line fashion due to the requirement to expose users to irrelevant recommendations. As a result, learning the policy from logged implicit feedback is of vital importance, which is challenging due to the pure off-policy setting and lack of negative rewards (feedback). In this paper, we propose self-supervised reinforcement learning for sequential recommendation tasks. Our approach augments standard recommendation models with two output layers: one for self-supervised learning and the other for RL. The RL part acts as a regularizer to drive the supervised layer focusing on specific rewards(e.g., recommending items which may lead to purchases rather than clicks) while the self-supervised layer with cross-entropy loss provides strong gradient signals for parameter updates. Based on such an approach, we propose two frameworks namely Self-Supervised Q-learning(SQN) and Self-Supervised Actor-Critic(SAC). We integrate the proposed frameworks with four state-of-the-art recommendation models. Experimental results on two real-world datasets demonstrate the effectiveness of our approach.

研究の動機と目的

  • 順序付き推薦モデルの教師あり学習が長期的なユーザーエンゲージメントや複数のインタラクションタイプ(例:クリック vs. 購入)を捉える能力に限界を示す問題に対処すること。
  • 強化学習を推薦に適用する際の課題、特に純粋なオフポリシー学習とネガティブフィードバックの欠如に対処すること。
  • モデル最適化を望ましい長期報酬に一致させる正則化子として強化学習を統合することで、推薦品質の向上を図ること。
  • オンライン相互作用を必要とせず、ログに記録された暗黙的フィードバックのみを用いて、教師ありおよびRLヘッドを同時に学習するフレームワークの構築。

提案手法

  • 既存の順序付き推薦モデルに二重出力ヘッドを追加:一方は自己教師学習(次アイテム予測における交差エントロピー損失)用、もう一方は強化学習(Q学習またはアクターキャリブレーター)用。
  • 自己教師学習ヘッドが学習中に強い勾配信号を提供する一方、RLヘッドは長期報酬を最大化する方向にモデルを正則化する。
  • オフポリシー強化学習アルゴリズム(SQNおよびSAC)を用いてログに記録されたインタラクションデータから学習し、オンラインデプロイのリスクを回避する。
  • 教師ありヘッドは自己教師学習から学び、RLヘッドはユーザーエンゲージメントの目的(例:購入)を最適化する二重目的の学習スキームを実装。
  • 割引率を用いて即時の報酬と長期的報酬のバランスを調整し、実験により最適な性能が中程度のγ値(例:0.9)で得られることを示した。
  • 4つの最先端のモデル(例:GRU)と統合された本手法のフレームワークを構築し、2つの実世界のECデータセット(RC15、RetailRocket)で評価。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き強化学習は、特に長期的なユーザーエンゲージメントの観点から、順序付き推薦の性能を向上させ得るか?
  • RQ2RLヘッドを正則化子として統合することで、教師あり推薦モデルの性能にどのような影響を与えるか?
  • RQ3オフポリシー強化学習の文脈において、異なる割引率が推薦品質に与える影響は何か?
  • RQ4暗黙的ユーザーフィードバックにおけるネガティブフィードバックの欠如は、本手法によってどのように扱われるか?
  • RQ5提案されたフレームワークは、購入のような高価値行動の予測において、教師ありベースラインを上回る性能を発揮するか?

主な発見

  • 提案されたSQNおよびSACフレームワークは、購入予測のヒット率(HR@10)を顕著に向上させ、RC15データセットで0.54のHR@10を達成し、ベースラインのGRUモデル(0.5183)を上回った。
  • 割引率γが高くなるほど性能が向上し、γ=0.9でピークに達した。これは、長期報酬モデリングが推薦品質の向上に寄与することを示唆している。
  • 過剰な割引(γ=0.99)は、平均セッション長が約6件という短さのため性能を劣化させ、γ=0.9が推薦タスクにおいて最適であると示唆された。
  • Q学習を単独で使用した場合の推薦性能は、ベースラインのGRUモデルを下回った。これは、正則化なしで直接強化学習を適用しても、この文脈では効果が薄いことを確認した。
  • 自己教師学習ヘッドは強力な勾配信号を提供し、RLヘッドが正則化子としてのみ使用される場合でも、効果的な共同学習が可能であることを示した。
  • 本手法はモデルに依存せず汎用的であり、4つの最先端の推薦アーキテクチャに統合することで性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。