[论文解读] Diversity-Promoting Deep Reinforcement Learning for Interactive Recommendation
该论文提出D²RL,一种用于交互式推荐的多样性促进深度强化学习框架,通过将个性化确定性点过程(DPP)与演员-评论家强化学习架构相结合,实现动态学习项目相关性并结合固定的项目相似度矩阵,生成多样且相关的推荐。在Movielens数据集的离线和模拟在线实验中,D²RL在准确率和多样性方面均优于当前最先进方法。
Interactive recommendation that models the explicit interactions between users and the recommender system has attracted a lot of research attentions in recent years. Most previous interactive recommendation systems only focus on optimizing recommendation accuracy while overlooking other important aspects of recommendation quality, such as the diversity of recommendation results. In this paper, we propose a novel recommendation model, named \underline{D}iversity-promoting \underline{D}eep \underline{R}einforcement \underline{L}earning (D$^2$RL), which encourages the diversity of recommendation results in interaction recommendations. More specifically, we adopt a Determinantal Point Process (DPP) model to generate diverse, while relevant item recommendations. A personalized DPP kernel matrix is maintained for each user, which is constructed from two parts: a fixed similarity matrix capturing item-item similarity, and the relevance of items dynamically learnt through an actor-critic reinforcement learning framework. We performed extensive offline experiments as well as simulated online experiments with real world datasets to demonstrate the effectiveness of the proposed model.
研究动机与目标
- 解决现有交互式推荐系统主要关注准确率而缺乏多样性的不足。
- 开发一种基于强化学习的框架,通过动态用户偏好建模,促进多样且相关的推荐。
- 通过结合相关性和多样性偏好,模拟真实用户反馈,用于在线评估。
- 在离线和在线交互式推荐设置中,证明所提模型的有效性。
提出的方法
- D²RL框架使用个性化DPP核矩阵,为每位用户生成多样且相关的项目推荐。
- DPP核由固定的项目-项目相似度矩阵和通过深度强化学习动态学习的相关性矩阵组成。
- 采用演员-评论家深度强化学习框架:演员生成动作向量(DPP核参数),评论家利用即时奖励和未来奖励评估策略质量。
- DPP模型通过偏好高多样性和相关性的项目集合,实现集合级别的多样性,其建模基于确定性点过程。
- 引入一种新型在线模拟器,通过结合用户偏好和多样性考量,使用MMR启发的概率建模来模拟用户反馈。
- 模型通过端到端深度强化学习进行训练,评论家网络估计推荐策略的长期价值。
实验结果
研究问题
- RQ1深度强化学习框架能否在保持高准确率的同时,有效促进交互式推荐中的多样性?
- RQ2将DPP模型与个性化核结合,相比标准强化学习方法,如何提升推荐多样性?
- RQ3所提出的D²RL模型在通过在线反馈模拟适应动态用户偏好方面,其适应程度如何?
- RQ4在离线和在线设置中,D²RL相较于当前最先进基于上下文Bandit和深度强化学习的交互式推荐方法,表现如何?
主要发现
- 在Movielens-1M数据集上,D²RL在所有推荐周期的离线评估中,准确率和多样性均持续优于所有基线方法。
- 在Movielens-100K数据集的模拟在线实验中,D²RL的精度比C²UCB高出52.13%,多样性高出92.79%。
- 在Movielens-1M数据集的在线模拟中,D²RL的精度比C²UCB高出76.04%,多样性高出156.58%,表现出优异的性能稳定性和优越性。
- 该模型在在线环境中表现出稳定且优越的性能,多样性迅速提升并在初始波动后维持在高水平。
- 在Movielens-100K数据集上,D²RL在多样性方面与基线方法表现相当,但准确率偶尔表现较差,表明评论家网络估计可能存在潜在不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。