[论文解读] Generative Adversarial User Model for Reinforcement Learning Based Recommendation System
本文提出了一种基于模型的强化学习框架用于推荐系统,使用生成对抗用户模型来学习用户行为动态与奖励,并引入级联DQN以实现高效的组合推荐。
There are great interests as well as many challenges in applying reinforcement learning (RL) to recommendation systems. In this setting, an online user is the environment; neither the reward function nor the environment dynamics are clearly defined, making the application of RL challenging. In this paper, we propose a novel model-based reinforcement learning framework for recommendation systems, where we develop a generative adversarial network to imitate user behavior dynamics and learn her reward function. Using this user model as the simulation environment, we develop a novel Cascading DQN algorithm to obtain a combinatorial recommendation policy which can handle a large number of candidate items efficiently. In our experiments with real data, we show this generative adversarial user model can better explain user behavior than alternatives, and the RL policy based on this model can lead to a better long-term reward for the user and higher click rate for the system.
研究动机与目标
- 在环境未知且奖励不显式的情况下,激励用于长期用户参与的推荐系统中的强化学习。
- 提出一个统一的基于模型的强化学习框架,能够同时学习用户行为模型和奖励函数。
- 开发一个生成对抗训练过程,以联合估计用户动态和奖励。
- 引入级联DQN策略,在从大规模候选集合中高效选择前k个项。
提出的方法
- 将用户行为表述为一个以奖励最大化为目标的序列决策过程,其中用户选择一个项目以最大化她的奖励,奖励随历史而依赖。
- 将用户状态参数化为对过去点击项的嵌入;使用学习到的神经网络组件定义奖励函数 r(s,a)。
- 通过生成对抗训练进行模型训练:在小极大对抗设置中同时优化行为模型 φ 和奖励 r(类似GAN)。
- 在学习 φ 和 r 时,给出熵正则化下的闭式解,以实现稳定的初始化与训练。
- 开发级联Q网络(及相关损失),通过将子集上的最大化分解为一系列较小的Q函数级联,以高效优化组合行动空间。
- 使用基于GAN用户模型构建的仿真环境来训练和评估策略,以预测长期奖励和点击率。
实验结果
研究问题
- RQ1基于GAN的用户模型是否比基线更好地预测用户行为和奖励?
- RQ2与模型无关或贪心基线相比,基于模型的RL策略是否能提升长期用户奖励与系统点击率?
- RQ3在推荐设置的巨大组合行动空间中,级联Q网络方法的表现如何?
- RQ4学习到的用户模型是否能快速适应新的动态或有限的交互?
主要发现
- GAN-PW 与 GAN-LSTM 在多个真实世界数据集上相对于基线呈现出更高的预测精度,其中 GAN-PW 提供了更佳的效率-准确性平衡。
- 基于GAN的方法相对于若干强基线(如 W&D-LR、W&D-CCF、GAN-Greedy、GAN-RWD1、GAN-GDQN、GAN-CDQN)在推荐项的累计奖励和CTR方面表现更高。
- GAN-CDQN 一贯优于其他RL策略,在所报告的表格中实现了最高的奖励和CTR(例如 k=3 和 k=5 时)。
- 级联Q网络框架实现了 O(k|I|) 的计算来选择前k个项,使组合推荐在大规模候选集合上具有可扩展性。
- 基于GAN的模型在适应新动态方面表现出更快的适应性(更低的样本复杂度),从学习到的环境模型中获益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。