[论文解读] Handling Cold-Start Collaborative Filtering with Reinforcement Learning
本文提出一种基于深度Q网络(DQN)的深度强化学习方法,用于优化电影推荐系统中冷启动用户的访谈问题,通过学习在每一步最大化信息增益。Q-Embedding模型通过直接最小化用户嵌入误差,优于先前方法,实现更低的RMSE并能良好泛化至更长的访谈,同时支持主动学习和暖启动用户适应。
A major challenge in recommender systems is handling new users, whom are also called $ extit{cold-start}$ users. In this paper, we propose a novel approach for learning an optimal series of questions with which to interview cold-start users for movie recommender systems. We propose learning interview questions using Deep Q Networks to create user profiles to make better recommendations to cold-start users. While our proposed system is trained using a movie recommender system, our Deep Q Network model should generalize across various types of recommender systems.
研究动机与目标
- 为解决协同过滤中的冷启动问题,即新用户缺乏历史评分。
- 设计一种自适应访谈系统,学习最优问题序列以构建准确的用户画像。
- 利用强化学习在每一步访谈中最大化信息增益,从而提升推荐质量。
- 将方法推广至其他类型的推荐系统,而不仅限于电影推荐。
- 通过估计边际信息增益,实现主动学习,支持动态终止或继续访谈。
提出的方法
- 该方法使用深度Q网络(DQN)选择能最大化关于用户偏好信息增益的访谈问题。
- 通过最小化预测用户嵌入与BPMF估计用户嵌入之间的MSE,学习冷启动用户的嵌入(Q-Embedding模型)。
- 另一种Q-Rating模型直接最小化预测电影评分的RMSE,使用预测评分作为奖励信号。
- DQN通过经验回放和目标网络进行训练,以稳定学习,其中状态由先前的回答定义,动作为电影查询。
- 该模型可泛化至不同长度的访谈,当为更长访谈训练时性能进一步提升。
- DQN的Q值支持主动学习:可根据估计的信息增益动态选择或跳过问题。
实验结果
研究问题
- RQ1强化学习能否有效用于学习冷启动用户访谈的最优问题序列?
- RQ2与传统的基于决策树的方法相比,基于DQN的访谈策略在推荐准确度和适应性方面表现如何?
- RQ3当仅针对3个问题的访谈进行训练时,DQN模型能否泛化至4个问题的访谈?
- RQ4能否通过基于现有评分生成上下文感知问题,将模型应用于暖启动用户?
- RQ5估计的Q值能否通过识别何时应停止或继续访谈来支持主动学习?
主要发现
- Q-Embedding模型的RMSE低于Q-Rating模型,在增加第四个问题时RMSE下降了2e-3,表明其在用户嵌入学习方面表现更优。
- Q-Rating模型的训练时间约为Q-Embedding模型的3倍,使后者在Netflix等大规模数据集上更具可扩展性。
- 尽管仅针对3个问题的访谈进行训练,两种模型在4个问题的访谈中均表现出良好泛化能力,显示出强大的泛化性能。
- Q-Embedding模型每100名用户的训练时间与数据集大小无关,表明其可扩展性优于Q-Rating模型。
- 基于DQN的方法通过估计边际信息增益实现主动学习,支持对冷启动和暖启动用户进行动态访谈控制。
- 该模型优于现有方法,可适配于多种推荐系统类型,不限于电影推荐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。