[論文レビュー] Rethinking Reinforcement Learning for Recommendation: A Prompt Perspective
本稿では、次アイテム推薦のための新しいオフライン学習フレームワークであるプロンプトベース強化学習(PRL)を提案する。PRLは、状態と報酬のペアをプロンプトとして扱い、直接推奨アイテムを予測することで、強化学習を教師あり学習問題に定式化する。2つのECデータセット上で評価された結果、PRLは歴史的データを知識ベースとして活用し、オンライン探索の誤差が生じないセッションベース推薦において、従来の強化学習手法を上回る優れた性能を達成した。
Modern recommender systems aim to improve user experience. As reinforcement learning (RL) naturally fits this objective -- maximizing an user's reward per session -- it has become an emerging topic in recommender systems. Developing RL-based recommendation methods, however, is not trivial due to the \emph{offline training challenge}. Specifically, the keystone of traditional RL is to train an agent with large amounts of online exploration making lots of `errors' in the process. In the recommendation setting, though, we cannot afford the price of making `errors' online. As a result, the agent needs to be trained through offline historical implicit feedback, collected under different recommendation policies; traditional RL algorithms may lead to sub-optimal policies under these offline training settings. Here we propose a new learning paradigm -- namely Prompt-Based Reinforcement Learning (PRL) -- for the offline training of RL-based recommendation agents. While traditional RL algorithms attempt to map state-action input pairs to their expected rewards (e.g., Q-values), PRL directly infers actions (i.e., recommended items) from state-reward inputs. In short, the agents are trained to predict a recommended item given the prior interactions and an observed reward value -- with simple supervised learning. At deployment time, this historical (training) data acts as a knowledge base, while the state-reward pairs are used as a prompt. The agents are thus used to answer the question: \emph{ Which item should be recommended given the prior interactions \& the prompted reward value}? We implement PRL with four notable recommendation models and conduct experiments on two real-world e-commerce datasets. Experimental results demonstrate the superior performance of our proposed methods.
研究の動機と目的
- 強化学習ベースの推薦におけるオフライン学習の課題に対処すること。オンライン探索は費用がかかり、現実的ではない。
- 多様な、あるいは未知の行動方策のもとで収集された固定された歴史的データから、効果的な方策学習が可能な手法を開発すること。
- 強化学習の推薦タスクをプロンプトベースの推論問題に再定式化し、一般化性能を向上させるとともに、分布シフトの問題を軽減すること。
- 歴史的相互作用シーケンスと報酬信号を用いて、単純な教師あり学習により強化学習エージェントを訓練できること。
- PRLの有効性を、実世界の環境における複数の最先端の順序付き推薦モデルで実証すること。
提案手法
- PRLは強化学習の目的関数を再定義する。状態(ユーザー履歴)とプロンプトされた報酬値が与えられたもとで、直接推奨アイテムを予測する。
- この手法では、歴史的ユーザー行動シーケンスと観測された報酬を入力プロンプトとして扱い、教師あり学習により最適な行動(推奨アイテム)を出力するようにモデルを学習する。
- 学習データは、オフラインログから抽出された(状態、報酬、行動)の三つ組みであり、行動はユーザーが相互作用したアイテムである。
- モデルのアーキテクチャは順序付きエンコーダーに依存しない。PRLは、任意の順序付きモデル(例:GRU、CNN、Transformer)と組み合わせて使用可能であり、ユーザー状態を表現できる。
- 推論時、エージェントは次のように答える:「この状態と望ましい報酬期待値が与えられた場合、どのアイテムを推奨すべきか?」
- プロンプト(状態+報酬)を直接行動にマッピングすることで、方策評価と改善のループを回避し、分散と分布シフトの問題を低減する。
実験結果
リサーチクエスチョン
- RQ1プロンプトベースの学習アプローチは、オフライン推薦設定において、従来の価値ベース強化学習を効果的に置き換えることができるか?
- RQ2PRLは、従来の強化学習および教師ありベースラインと比較して、推薦精度と耐性の面でどのように性能を発揮するか?
- RQ3PRLは、異なる順序付きモデルや、ユーザー行動が異なる実世界のデータセットにも一般化可能か?
- RQ4PRLは、推論時に報酬期待値やその分散の選択にどれほど感度を示すか?
- RQ5PRLは、オンライン相互作用や複雑な報酬モデリングを必要とせずに、既存のオフライン強化学習手法を上回る性能を達成できるか?
主な発見
- PRLは、2つの実世界のECデータセットにおいて、従来の強化学習ベースの推薦手法を顕著に上回り、オフライン設定でも優れた性能を示した。
- PRLは、GRU、CNN、Transformerベースのアーキテクチャを含む4つの異なる順序付き推薦モデルにおいて、最先端の結果を達成した。
- Challenge15では、ユーザーは高報酬・低探索の推薦を好む傾向にあり、PRLはこの好みのパターンをうまく適応した。
- RetailRocketでは、より高い探索(大きな報酬分散)がわずかに性能を向上させ、PRLはこの動的行動を効果的に捉えた。
- アブレーションスタディの結果、PRLの性能は報酬期待値や分散の変動に対して頑健であることが確認され、強力な一般化能力を示した。
- 結果は、PRLが分布シフトを回避し、方策学習における分散を低減することで、オフライン学習の課題を効果的に軽減していることを裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。