Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning based Group Recommender System

Zefang Liu, Shuran Wen|arXiv (Cornell University)|Jun 13, 2021
Recommender Systems and Techniques参考文献 17被引用 4
一句话总结

该论文提出了一种基于深度强化学习的群体推荐系统(DRGR),将群体推荐建模为马尔可夫决策过程(MDP),采用深度确定性策略梯度(DDPG)训练的演员-评论家网络。在MovieLens-Rand数据集上,DRGR在召回率和NDCG指标上优于GroupIM,但因对项目特定成员交互建模不足,表现不及AGREE。

ABSTRACT

Group recommender systems are widely used in current web applications. In this paper, we propose a novel group recommender system based on the deep reinforcement learning. We introduce the MovieLens data at first and generate one random group dataset, MovieLens-Rand, from it. This randomly generated dataset is described and analyzed. We also present experimental settings and two state-of-art baselines, AGREE and GroupIM. The framework of our novel model, the Deep Reinforcement learning based Group Recommender system (DRGR), is proposed. Actor-critic networks are implemented with the deep deterministic policy gradient algorithm. The DRGR model is applied on the MovieLens-Rand dataset with two baselines. Compared with baselines, we conclude that DRGR performs better than GroupIM due to long interaction histories but worse than AGREE because of the self-attention mechanism. We express advantages and shortcomings of DRGR and also give future improvement directions at the end.

研究动机与目标

  • 解决现有群体推荐系统在处理动态偏好、长期奖励优化和推荐多样性方面的局限性。
  • 通过将群体推荐建模为使用强化学习的序列决策过程,克服当前模型的静态特性。
  • 通过利用群体偏好中的长期交互历史和时间动态性,提升推荐质量。
  • 提出一种新颖的框架,结合深度学习与强化学习,增强群体推荐的灵活性与性能。

提出的方法

  • 将群体推荐任务建模为马尔可夫决策过程(MDP),基于群体成员嵌入和项目交互定义状态空间与动作空间。
  • 使用矩阵分解构建环境模拟器,用于在MDP中生成状态转移和奖励。
  • 设计一个包含演员-评论家网络的智能体:演员输出动作策略,评论家估计状态-动作对的Q值。
  • 使用深度确定性策略梯度(DDPG)算法,结合经验回放和目标网络,实现稳定学习。
  • 在状态嵌入层中引入自注意力机制,聚合群体成员偏好,捕捉成员间的相对影响力。
  • 在MovieLens-Rand数据集上端到端优化模型,该数据集为从MovieLens生成的随机群体数据集。

实验结果

研究问题

  • RQ1深度强化学习框架能否有效将群体推荐建模为具有长期奖励的序列决策过程?
  • RQ2在召回率和NDCG指标上,DRGR相较于SOTA基线方法(如AGREE和GroupIM)表现如何?
  • RQ3DRGR中的自注意力机制在多大程度上捕捉了群体成员影响力并提升了推荐质量?
  • RQ4尽管DRGR优于GroupIM,为何其表现仍不及AGREE?其结构上的局限性是什么?

主要发现

  • 在所有K值(5、10、20)下,DRGR的召回率和NDCG得分均高于GroupIM,在MovieLens-Rand数据集上R@20为0.5572,N@20为0.2653。
  • DRGR表现不及AGREE,后者在R@20达到0.7335,N@20达到0.3691,原因在于AGREE使用神经注意力机制,能够建模项目特定的成员影响力。
  • DRGR与AGREE之间的性能差距源于DRGR的自注意力机制仅聚合群体成员嵌入,未对推荐列表中特定项目与成员的交互进行建模。
  • 在平均群体评分数量较高(53.25)的MovieLens-Rand设置中,DRGR表现稳定且优于GroupIM,表明其在处理丰富交互历史方面具有优势。
  • 模型在用户和项目嵌入的联合端到端训练中表现出不稳定性,这可能是性能未达最优的潜在原因,提示需要进行架构优化。
  • 未来改进方向包括引入对群体成员-项目交互的注意力机制,或使用Deep Sets进行嵌入聚合,以增强模型的灵活性与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。