Skip to main content
QUICK REVIEW

[论文解读] Offline Meta-level Model-based Reinforcement Learning Approach for Cold-Start Recommendation

Yanan Wang, Yong Ge|arXiv (Cornell University)|Dec 4, 2020
Advanced Bandit Algorithms Research参考文献 31被引用 5
一句话总结

该论文提出 M3Rec,一种基于元学习的离线模型增强强化学习框架,可在推荐系统中实现对冷启动用户的快速适应。通过学习用户上下文变量,并利用逆强化学习从极少的交互中推断用户策略与奖励,M3Rec 提高了样本效率,在仅有一个交互序列的情况下即实现最先进性能。

ABSTRACT

Reinforcement learning (RL) has shown great promise in optimizing long-term user interest in recommender systems. However, existing RL-based recommendation methods need a large number of interactions for each user to learn a robust recommendation policy. The challenge becomes more critical when recommending to new users who have a limited number of interactions. To that end, in this paper, we address the cold-start challenge in the RL-based recommender systems by proposing a meta-level model-based reinforcement learning approach for fast user adaptation. In our approach, we learn to infer each user's preference with a user context variable that enables recommendation systems to better adapt to new users with few interactions. To improve adaptation efficiency, we learn to recover the user policy and reward from only a few interactions via an inverse reinforcement learning method to assist a meta-level recommendation agent. Moreover, we model the interaction relationship between the user model and recommendation agent from an information-theoretic perspective. Empirical results show the effectiveness of the proposed method when adapting to new users with only a single interaction sequence. We further provide a theoretical analysis of the recommendation performance bound.

研究动机与目标

  • 解决基于强化学习的推荐系统中,新用户交互历史不足所带来的冷启动推荐挑战。
  • 通过仅使用每个新用户少量交互,实现快速策略适应,提升样本效率。
  • 构建一种元学习框架,学习用户偏好之间的结构相似性,以实现对冷启动用户的泛化。
  • 整合逆强化学习,从有限的离线数据中推断用户策略与奖励函数。
  • 利用信息论中的互信息正则化,建模用户与推荐智能体之间的依赖关系。

提出的方法

  • 引入用户上下文变量,以表示并从稀疏交互序列中推断用户偏好。
  • 使用逆强化学习,从少量用户交互中恢复用户策略与奖励函数。
  • 构建以用户上下文变量为条件的元级用户模型,用于模拟用户行为。
  • 在元学习框架内,使用基于模型的强化学习训练元级推荐智能体,以优化长期用户参与度。
  • 在用户策略与推荐策略之间应用互信息正则化,以建模其相互依赖关系并提升适应能力。
  • 利用离线数据进行元训练,并在模拟环境与真实离线设置中评估性能。

实验结果

研究问题

  • RQ1元级模型增强强化学习方法是否能仅凭单一交互序列有效适应冷启动用户?
  • RQ2引入逆强化学习在冷启动推荐中如何提升样本效率?
  • RQ3用户策略与推荐策略之间的互信息正则化在多大程度上提升了适应性能?
  • RQ4在在线与离线设置下,所提方法与最先进强化学习与元学习推荐方法相比表现如何?
  • RQ5所提离线元强化学习框架在推荐任务中的理论性能边界是什么?

主要发现

  • 在在线仿真中,M3Rec 在 k=3 时获得 40.72 ± 0.66 的平均奖励,在 k=5 时获得 40.80 ± 0.50,优于所有基线方法。
  • 在 CIKM CUP 2016 数据集的离线评估中,M3Rec 在 top-1 达到 7.26% 精确率,top-5 达到 28.42%,top-10 达到 40.02%,显著超越所有基线。
  • M3Rec 在 NDCG@5 达到 17.89%,NDCG@10 达到 21.63%,较次优方法提升超过 2 个百分点。
  • M3Rec 的 Recall@10 达到 9.16%,优于最佳基线方法的 8.97%,表明对相关项目的覆盖能力更强。
  • 理论分析确认了离线元强化学习框架的性能边界,支持其泛化能力。
  • 互信息正则化的集成显著提升了冷启动用户适应的速度与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。