Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning based Group Recommender System

Zefang Liu, Shuran Wen|arXiv (Cornell University)|Jun 13, 2021
Recommender Systems and Techniques参考文献 17被引用数 4
ひとこと要約

本稿では、Deep Deterministic Policy Gradient (DDPG) を用いてトレーニングされたアクタ・クリティックネットワークを用いて、グループ推薦を強化学習に基づくマルコフ意思決定過程(MDP)としてモデル化する、Deep Reinforcement Learningに基づくグループレコメンデーションシステム(DRGR)を提案する。DRGRは、MovieLens-Rand データセットにおいて、GroupIM よりもリCALL および NDCG メトリクスで優れているが、アイテム固有のメンバー間相互作用のモデル化が限定的であるため、AGREE よりも劣る性能を示す。

ABSTRACT

Group recommender systems are widely used in current web applications. In this paper, we propose a novel group recommender system based on the deep reinforcement learning. We introduce the MovieLens data at first and generate one random group dataset, MovieLens-Rand, from it. This randomly generated dataset is described and analyzed. We also present experimental settings and two state-of-art baselines, AGREE and GroupIM. The framework of our novel model, the Deep Reinforcement learning based Group Recommender system (DRGR), is proposed. Actor-critic networks are implemented with the deep deterministic policy gradient algorithm. The DRGR model is applied on the MovieLens-Rand dataset with two baselines. Compared with baselines, we conclude that DRGR performs better than GroupIM due to long interaction histories but worse than AGREE because of the self-attention mechanism. We express advantages and shortcomings of DRGR and also give future improvement directions at the end.

研究の動機と目的

  • 動的嗜好の扱い、長期的報酬最適化、レコメンデーションの多様性の観点から、既存のグループレコメンデーションシステムの限界を是正すること。
  • 強化学習を用いてグループ推薦を段階的決定プロセスとしてモデル化することで、現在のモデルの静的特性を克服すること。
  • グループ嗜好の時間的ダイナミクスと長期間の相互作用履歴を活用することで、レコメンデーション品質を向上させること。
  • 深層学習と強化学習を組み合わせた新規フレームワークを導入し、グループレコメンデーションの柔軟性と性能を向上させること。

提案手法

  • グループレコメンデーションタスクをマルコフ意思決定過程(MDP)として定式化し、グループメンバーの埋め込みとアイテム相互作用に基づいて状態空間と行動空間を定義する。
  • MDPにおける状態遷移と報酬を生成するために、行列分解を用いた環境シミュレータを実装する。
  • アクター・クリティックネットワークを備えたエージェントを設計:アクターは行動方策を出力し、クリティックは状態行動ペアのQ値を推定する。
  • 経験再生とターゲットネットワークを用いて、安定した学習を実現するため、Deep Deterministic Policy Gradient (DDPG) アルゴリズムでエージェントをトレーニングする。
  • 状態埋め込み層に自己注意機構を適用し、グループメンバーの嗜好を集約することで、メンバー間の相対的影響を捉える。
  • MovieLens からの抽出に基づくランダムに生成されたグループデータセットである MovieLens-Rand データセット上で、モデルをエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習フレームワークは、長期的報酬を伴う段階的意思決定プロセスとしてグループ推薦を効果的にモデル化できるか?
  • RQ2DRGR は、AGREE や GroupIM といった最先端のベースラインと比較して、リCALL および NDCG メトリクスにおいてどの程度の性能を示すか?
  • RQ3DRGR に組み込まれた自己注意機構は、グループメンバーの影響をどの程度正しく捉え、レコメンデーション品質を向上させているか?
  • RQ4DRGR は GroupIM を上回るが、AGREE よりも劣る理由は何か?この差を生じさせる構造的制限要因は何か?

主な発見

  • DRGR は、すべての K 値(5, 10, 20)において GroupIM よりも高いリCALL および NDCG スコアを達成し、MovieLens-Rand データセットでは R@20 が 0.5572、N@20 が 0.2653 を記録した。
  • DRGR は、アイテム固有のメンバー影響をモデル化するニューラル注意機構を用いる AGREE よりも劣る性能を示す。AGREE は R@20 が 0.7335、N@20 が 0.3691 を達成した。
  • DRGR と AGREE の性能差は、DRGR の自己注意機構が特定のアイテムの推薦リストにおけるメンバーとの相互作用をモデル化していないため生じる。
  • DRGR の性能は、平均グループ評価数が 53.25 と比較的高い MovieLens-Rand の設定において安定的であり、豊富な相互作用履歴の処理能力を示している。
  • ユーザーとアイテムの埋め込みの直接的共同学習における不安定性が、性能が最適でない可能性の要因であると指摘され、アーキテクチャの洗練が求められる。
  • グループメンバーとアイテムの相互作用に対する注目機構の統合や、埋め込み集約に Deep Sets を用いることなど、将来的な改善策が提案され、柔軟性と性能の向上が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。