[論文レビュー] ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor
ResActは、オンラインで配備済みのポリシーに近いが、それより優れたポリシーを学習することで、長期間にわたる関与を向上させる強化学習フレームワークを提案する。オンラインでの相互作用を回避するため、高コストなオンライン相互作用を避ける。行動再構築を改善するためのリーマンアクターと、特徴表現の表現力と洗練さを高める情報理論的正則化項を用い、ベンチマークおよび産業界データセットで最先端の性能を達成する。
Long-term engagement is preferred over immediate engagement in sequential recommendation as it directly affects product operational metrics such as daily active users (DAUs) and dwell time. Meanwhile, reinforcement learning (RL) is widely regarded as a promising framework for optimizing long-term engagement in sequential recommendation. However, due to expensive online interactions, it is very difficult for RL algorithms to perform state-action value estimation, exploration and feature extraction when optimizing long-term engagement. In this paper, we propose ResAct which seeks a policy that is close to, but better than, the online-serving policy. In this way, we can collect sufficient data near the learned policy so that state-action values can be properly estimated, and there is no need to perform online exploration. ResAct optimizes the policy by first reconstructing the online behaviors and then improving it via a Residual Actor. To extract long-term information, ResAct utilizes two information-theoretical regularizers to confirm the expressiveness and conciseness of features. We conduct experiments on a benchmark dataset and a large-scale industrial dataset which consists of tens of millions of recommendation requests. Experimental results show that our method significantly outperforms the state-of-the-art baselines in various long-term engagement optimization tasks.
研究の動機と目的
- 長期間にわたるユーザ関与を最適化するという課題に取り組むこと。これはDAUや滞在時間といった指標にとって極めて重要である。
- 実世界のシステムにおける強化学習の限界、特に報酬が疎らで、探索コストが高く、長期的な責任割り当てが難しいという点を克服すること。
- 現在のオンライン配信ポリシーに近い位置で動作させることで、オンライン相互作用を一切行わずに改善されたポリシーを学習すること。
- 情報理論的正則化を用いて、表現力と洗練さの両方を確保することで、長期間の関与のための特徴表現を強化すること。
- 提案手法の有効性を、ベンチマークデータセットおよび大規模産業データセットの両方で検証すること。
提案手法
- ResActは、履歴データを用いてオンライン配信ポリシーの行動を再構築し、教師あり事前学習フェーズを構築する。
- 再構築されたポリシーを改善するリーマンアクターを導入することで、完全なオンライン相互作用を伴わずに局所的ポリシー最適化を可能にする。
- 2つの情報理論的正則化項を用いる:1つは隠れ状態とユーザ履歴の間の相互情報量を最大化することで表現力を高めるもの、もう1つは表現の冗長性を最小化することで洗練さを高めるもの。
- 複雑なポリシー最適化を、行動再構築と残差ポリシー改善の2つのサブタスクに分解することで、学習を簡略化する。
- 再構築データ上で教師あり学習を用いてエンドツーエンドに訓練することで、オンライン探索や報酬の疎らさを回避する。
- モデルは、MovieLens-1mと、数千万件のリクエストを含む大規模産業データセットの両方で評価される。
実験結果
リサーチクエスチョン
- RQ1オンライン相互作用を一切必要とせず、現在のオンライン配信ポリシーに近いがそれより優れたポリシーを学習できるか?
- RQ2報酬が疎らで遅延が長い状況で、長期間の関与をどのように最適化できるか?
- RQ3特徴表現の表現力と洗練さが、長期間の推薦性能向上に果たす役割は何か?
- RQ4情報理論的正則化項は、順序付き推薦の表現学習を効果的に向上させられるか?
- RQ5残差アクター機構は、長期間の関与タスクにおいて、直接的なポリシー学習を上回る性能を発揮できるか?
主な発見
- ResActは、MovieLens-1mベンチマークおよび大規模産業データセットRecL-25mの両方で、最先端のベースラインを顕著に上回る。
- RecL-25mデータセットでは、セッション長が7.3%、リターン時間は12.1%の相対的改善を達成した。
- アブレーションスタディの結果、表現力正則化項または洗練さ正則化項のいずれかを削除すると、顕著な性能低下が見られた。これにより、両者の重要性が確認された。
- 両正則化項を同時に削除すると、片方だけを削除した場合ほど性能が低下しないことが示され、表現力と洗練さの間には相乗効果があることが示唆された。
- リーマンアクター機構により、完全な空間におけるポリシー最適化よりも優れた結果が得られ、有効な局所的ポリシー改善が可能となった。
- オンライン相互作用を一切行わず、産業界での導入に実用的である強力な性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。