Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning to Optimize Long-term User Engagement in Recommender Systems

Lixin Zou, Long Xia|arXiv (Cornell University)|Feb 13, 2019
Recommender Systems and Techniques参考文献 38被引用数 21
ひとこと要約

本稿では、階層的LSTMベースのQネットワークと環境シミュレーションによるSネットワークを組み合わせることで、長期的なユーザーエンゲージメントを最適化する強化学習フレームワーク、FeedRecを提案する。FeedRecは、クリック時間、再訪問率、累積クリック数といった長期的エンゲージメント指標において、最先端手法を著しく上回り、統計的に有意な改善(p < 0.01)を達成する。

ABSTRACT

Recommender systems play a crucial role in our daily lives. Feed streaming mechanism has been widely used in the recommender system, especially on the mobile Apps. The feed streaming setting provides users the interactive manner of recommendation in never-ending feeds. In such an interactive manner, a good recommender system should pay more attention to user stickiness, which is far beyond classical instant metrics, and typically measured by {\bf long-term user engagement}. Directly optimizing the long-term user engagement is a non-trivial problem, as the learning target is usually not available for conventional supervised learning methods. Though reinforcement learning~(RL) naturally fits the problem of maximizing the long term rewards, applying RL to optimize long-term user engagement is still facing challenges: user behaviors are versatile and difficult to model, which typically consists of both instant feedback~(e.g. clicks, ordering) and delayed feedback~(e.g. dwell time, revisit); in addition, performing effective off-policy learning is still immature, especially when combining bootstrapping and function approximation. To address these issues, in this work, we introduce a reinforcement learning framework --- FeedRec to optimize the long-term user engagement. FeedRec includes two components: 1)~a Q-Network which designed in hierarchical LSTM takes charge of modeling complex user behaviors, and 2)~an S-Network, which simulates the environment, assists the Q-Network and voids the instability of convergence in policy learning. Extensive experiments on synthetic data and a real-world large scale data show that FeedRec effectively optimizes the long-term user engagement and outperforms state-of-the-arts.

研究の動機と目的

  • クリックのような即時の指標をはるかに超える、フィード配信型推薦システムにおける長期的ユーザーエンゲージメントを最適化する課題に対処する。
  • 関数近似、ブートストラapping、オフライン学習を含む「危険な三つ組み(Deadly Triad)」によって引き起こされるオフポリシー強化学習における不安定性と発散問題を克服する。
  • 多様なユーザ行動(例:クリックのような即時の反応、滞在時間や再訪問といった遅延フィードバック)をモデル化できるスケーラブルで安定したRLフレームワークを開発する。
  • 高価なオンライン探索を必要とせず、ログ記録済みの相互作用データからオフラインでポリシー学習を効果的に行えるようにする。
  • ユーザーエンゲージメントと推薦の多様性の関係を調査し、直接的なエンゲージメント最適化が多様性を向上させるかどうかを検証する。

提案手法

  • クリック、滞在時間、ブラウジング深さ、再訪問頻度を統合した複数成分の報酬関数を用いて、フィードストリーミング推薦をマルコフ決定過程(MDP)として定式化する。
  • 複数の相互作用レベル(例:アイテムレベルおよびセッションレベルのダイナミクス)における複雑な順序的ユーザ行動をモデル化するため、階層的LSTMベースのQネットワークを設計する。
  • ログデータから環境のダイナミクスを学習するSネットワーク(シミュレータネットワーク)を導入し、ブートストラップ誤差を低減することで、オフポリシー学習の安定性を向上させる。
  • Sネットワークを用いて合成遷移を生成し、Qネットワークの訓練に使用することで、実環境との直接的相互作用を回避し、「危険な三つ組み」問題を緩和する。
  • 経験リプレイを用いたオフポリシー深層Q学習を適用し、リプレイバッファに実際のログデータとSネットワークからの合成遷移の両方を組み込む。
  • 異なるエンゲージメント指標の重要性をバランスさせるために学習可能な重み(ω)を報酬関数に導入し、短期的および長期的目標のトレードオフ分析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習フレームワークは、従来のクリックスルーレート指標をはるかに超える、フィードベースの推薦システムにおける長期的ユーザーエンゲージメントを効果的に最適化できるか?
  • RQ2関数近似とブートストラップを伴うオフライン学習におけるオフポリシー学習の不安定性という「危険な三つ組み」問題は、実世界の推薦システムでどのように緩和できるか?
  • RQ3直接的に長期的エンゲージメントを最適化することで、推薦の多様性はどの程度向上するのか?また、多様性はユーザ満足度の向上の副産物として現れるのか?
  • RQ4報酬関数における異なるエンゲージメント指標の重み付けに、提案フレームワークの性能はどの程度敏感か?
  • RQ5オフラインデータから学習したポリシーは、オンラインファインチューニングや標準的なDQNベース手法と比較して、安定的かつ優れた性能を達成できるか?

主な発見

  • FeedRecは、実世界のECデータにおいて、すべての最先端ベースラインを著しく上回り、累積クリック数で12.7%の向上(p < 0.01)と、再訪問率で15.3%の増加(p < 0.01)を達成した。
  • Sネットワークは訓練の安定性を効果的に高め、性能の低下を防いでいる。DQNやDDPG-KNNとは異なり、早期にピークに達した後、性能が急低下するのではなく、全訓練イテレーションにわたり高い性能を維持する。
  • 累積クリック数の最適性能は、深さと再訪問時間の指標に対してω = 0.005で達成され、遅延指標の適切な重み付けが、クリックスルーレートを損なわずに全体のエンゲージメントを向上させることを示している。
  • FeedRecは、行動空間における多様性スコアが高くなるようにポリシーを学習しており、多様なアイテム推薦を好む傾向があることが裏付けられており、直接的なエンゲージメント最適化が自然に推薦の多様性を向上させることを示唆している。
  • 本フレームワークは合成データに対しても頑健で、複雑なユーザ行動シーケンスと長期依存関係を効果的にモデル化できることを確認した。
  • 有意性検定により、ベースラインとのすべての性能向上が統計的に有意(p < 0.01)であることが確認され、提案アーキテクチャおよび訓練戦略の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。