Skip to main content
QUICK REVIEW

[论文解读] Handling Cold-Start Collaborative Filtering with Reinforcement Learning

Hima Varsha Dureddy, Zachary Kaden|arXiv (Cornell University)|Jun 16, 2018
Recommender Systems and Techniques参考文献 11被引用 5
一句话总结

本文提出一种基于深度Q网络(DQN)的深度强化学习方法,用于优化电影推荐系统中冷启动用户的访谈问题,通过学习在每一步最大化信息增益。Q-Embedding模型通过直接最小化用户嵌入误差,优于先前方法,实现更低的RMSE并能良好泛化至更长的访谈,同时支持主动学习和暖启动用户适应。

ABSTRACT

A major challenge in recommender systems is handling new users, whom are also called $ extit{cold-start}$ users. In this paper, we propose a novel approach for learning an optimal series of questions with which to interview cold-start users for movie recommender systems. We propose learning interview questions using Deep Q Networks to create user profiles to make better recommendations to cold-start users. While our proposed system is trained using a movie recommender system, our Deep Q Network model should generalize across various types of recommender systems.

研究动机与目标

  • 为解决协同过滤中的冷启动问题,即新用户缺乏历史评分。
  • 设计一种自适应访谈系统,学习最优问题序列以构建准确的用户画像。
  • 利用强化学习在每一步访谈中最大化信息增益,从而提升推荐质量。
  • 将方法推广至其他类型的推荐系统,而不仅限于电影推荐。
  • 通过估计边际信息增益,实现主动学习,支持动态终止或继续访谈。

提出的方法

  • 该方法使用深度Q网络(DQN)选择能最大化关于用户偏好信息增益的访谈问题。
  • 通过最小化预测用户嵌入与BPMF估计用户嵌入之间的MSE,学习冷启动用户的嵌入(Q-Embedding模型)。
  • 另一种Q-Rating模型直接最小化预测电影评分的RMSE,使用预测评分作为奖励信号。
  • DQN通过经验回放和目标网络进行训练,以稳定学习,其中状态由先前的回答定义,动作为电影查询。
  • 该模型可泛化至不同长度的访谈,当为更长访谈训练时性能进一步提升。
  • DQN的Q值支持主动学习:可根据估计的信息增益动态选择或跳过问题。

实验结果

研究问题

  • RQ1强化学习能否有效用于学习冷启动用户访谈的最优问题序列?
  • RQ2与传统的基于决策树的方法相比,基于DQN的访谈策略在推荐准确度和适应性方面表现如何?
  • RQ3当仅针对3个问题的访谈进行训练时,DQN模型能否泛化至4个问题的访谈?
  • RQ4能否通过基于现有评分生成上下文感知问题,将模型应用于暖启动用户?
  • RQ5估计的Q值能否通过识别何时应停止或继续访谈来支持主动学习?

主要发现

  • Q-Embedding模型的RMSE低于Q-Rating模型,在增加第四个问题时RMSE下降了2e-3,表明其在用户嵌入学习方面表现更优。
  • Q-Rating模型的训练时间约为Q-Embedding模型的3倍,使后者在Netflix等大规模数据集上更具可扩展性。
  • 尽管仅针对3个问题的访谈进行训练,两种模型在4个问题的访谈中均表现出良好泛化能力,显示出强大的泛化性能。
  • Q-Embedding模型每100名用户的训练时间与数据集大小无关,表明其可扩展性优于Q-Rating模型。
  • 基于DQN的方法通过估计边际信息增益实现主动学习,支持对冷启动和暖启动用户进行动态访谈控制。
  • 该模型优于现有方法,可适配于多种推荐系统类型,不限于电影推荐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。