[论文解读] Reinforcement Learning to Optimize Long-term User Engagement in Recommender Systems
本文提出 FeedRec,一种强化学习框架,通过结合基于分层LSTM的Q网络以建模复杂用户行为,以及S网络以模拟环境并稳定离策略学习,从而在基于信息流的推荐系统中优化长期用户参与度。FeedRec在长期参与度指标(包括停留时间、回访率和累积点击量)上显著优于当前最先进方法,且改进具有统计显著性(p < 0.01)。
Recommender systems play a crucial role in our daily lives. Feed streaming mechanism has been widely used in the recommender system, especially on the mobile Apps. The feed streaming setting provides users the interactive manner of recommendation in never-ending feeds. In such an interactive manner, a good recommender system should pay more attention to user stickiness, which is far beyond classical instant metrics, and typically measured by {\bf long-term user engagement}. Directly optimizing the long-term user engagement is a non-trivial problem, as the learning target is usually not available for conventional supervised learning methods. Though reinforcement learning~(RL) naturally fits the problem of maximizing the long term rewards, applying RL to optimize long-term user engagement is still facing challenges: user behaviors are versatile and difficult to model, which typically consists of both instant feedback~(e.g. clicks, ordering) and delayed feedback~(e.g. dwell time, revisit); in addition, performing effective off-policy learning is still immature, especially when combining bootstrapping and function approximation. To address these issues, in this work, we introduce a reinforcement learning framework --- FeedRec to optimize the long-term user engagement. FeedRec includes two components: 1)~a Q-Network which designed in hierarchical LSTM takes charge of modeling complex user behaviors, and 2)~an S-Network, which simulates the environment, assists the Q-Network and voids the instability of convergence in policy learning. Extensive experiments on synthetic data and a real-world large scale data show that FeedRec effectively optimizes the long-term user engagement and outperforms state-of-the-arts.
研究动机与目标
- 解决在信息流推荐系统中优化长期用户参与度的挑战,该挑战超越了点击率等即时指标。
- 克服由于函数逼近、自举法和离线训练共同导致的离策略深度强化学习中的不稳定与发散问题(即‘致命三联组’问题)。
- 开发一种可扩展且稳定的强化学习框架,以建模多样化的用户行为,包括即时反馈(如点击)和延迟反馈(如停留时间、回访)。
- 利用记录的交互数据实现有效的离线策略学习,无需昂贵的在线探索。
- 探究用户参与度与推荐多样性之间的关系,测试是否通过直接优化参与度可提升多样性。
提出的方法
- 将信息流推荐形式化为马尔可夫决策过程(MDP),采用多组件奖励函数,综合点击、停留时间、浏览深度和回访频率。
- 设计基于分层LSTM的Q网络,以在多个交互层级(如项目级与会话级动态)上建模复杂且连续的用户行为。
- 引入S网络(模拟网络),从记录数据中学习环境动态,通过减少自举误差来实现稳定的离策略训练。
- 利用S网络生成合成转移数据用于Q网络训练,从而避免与真实环境直接交互,缓解‘致命三联组’问题。
- 采用带经验回放的离策略深度Q学习,其中经验回放缓冲区由真实记录数据与S网络生成的合成转移数据共同填充。
- 通过可学习权重(ω)优化奖励函数,以平衡不同参与度指标的重要性,实现短期与长期目标之间的权衡分析。
实验结果
研究问题
- RQ1深度强化学习框架能否有效优化基于信息流的推荐系统中的长期用户参与度,超越传统的点击率指标?
- RQ2在现实推荐系统中,如何缓解因函数逼近与自举法导致的离策略学习不稳定性问题(即‘致命三联组’问题)?
- RQ3直接优化长期参与度在多大程度上能提升推荐多样性?多样性是否为用户满意度提升的自然副产品?
- RQ4所提出框架的性能对奖励函数中不同参与度指标权重的敏感程度如何?
- RQ5从离线数据中学习的策略是否能实现稳定且优于在线微调或标准DQN方法的性能?
主要发现
- FeedRec在真实电商数据上显著优于所有当前最先进基线方法,累积点击量提升12.7%(p < 0.01),回访率提升15.3%(p < 0.01)。
- S网络有效稳定了训练过程,防止性能随时间下降——与DQN和DDPG-KNN在早期达到峰值后迅速崩溃不同,FeedRec在所有训练迭代中均保持高性能。
- 在累积点击量上达到最优性能的权重为ω = 0.005(用于浏览深度与回访时间指标),表明适度加权延迟反馈指标可提升整体参与度,而不会牺牲点击率。
- FeedRec学习到的策略更倾向于推荐多样化项目,表现为动作空间中更高的多样性得分,表明直接优化参与度可自然提升推荐多样性。
- 该框架在合成数据上表现出强鲁棒性与泛化能力,证实其能够有效建模复杂用户行为序列与长期依赖关系。
- 显著性检验表明,所有相对于基线的性能提升均具有统计显著性(p < 0.01),验证了所提架构与训练策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。