[论文解读] Reinforcing User Retention in a Billion Scale Short Video Recommender System
本文提出 RLUR,一种强化学习框架,通过将留存率建模为无限时域请求驱动的马尔可夫决策过程,在十亿规模短视频推荐系统中优化用户留存。该框架通过一种新颖的归一化技术与双 critic 训练目标,解决了留存信号长期延迟、不确定性和偏差问题,在快手的实际部署中实现了用户留存和日活跃用户数(DAU)的持续提升。
Recently, short video platforms have achieved rapid user growth by recommending interesting content to users. The objective of the recommendation is to optimize user retention, thereby driving the growth of DAU (Daily Active Users). Retention is a long-term feedback after multiple interactions of users and the system, and it is hard to decompose retention reward to each item or a list of items. Thus traditional point-wise and list-wise models are not able to optimize retention. In this paper, we choose reinforcement learning methods to optimize the retention as they are designed to maximize the long-term performance. We formulate the problem as an infinite-horizon request-based Markov Decision Process, and our objective is to minimize the accumulated time interval of multiple sessions, which is equal to improving the app open frequency and user retention. However, current reinforcement learning algorithms can not be directly applied in this setting due to uncertainty, bias, and long delay time incurred by the properties of user retention. We propose a novel method, dubbed RLUR, to address the aforementioned challenges. Both offline and live experiments show that RLUR can significantly improve user retention. RLUR has been fully launched in Kuaishou app for a long time, and achieves consistent performance improvement on user retention and DAU.
研究动机与目标
- 为解决在短视频推荐中优化长期用户留存的挑战,该挑战无法被传统点对点或列表级模型有效捕捉。
- 将用户留存建模为无限时域请求驱动的马尔可夫决策过程,目标是最小化会话之间的累计返回时间。
- 克服留存反馈中长期延迟、不确定性和偏差的问题,这些问题是标准强化学习算法直接应用的主要障碍。
- 开发一种可扩展、稳定且高效的基于强化学习的策略,在真实部署中提升应用打开频率与用户留存。
- 通过离线评估与长期线上 A/B 实验,在生产规模平台上验证该方法的有效性。
提出的方法
- 将推荐问题形式化为无限时域请求驱动的 MDP,其中智能体(推荐系统)选择排序权重以优化长期用户返回。
- 提出一种新颖的归一化技术,用于预测返回时间并降低留存奖励信号的方差,从而提升训练稳定性。
- 设计一种双 critic 训练目标,结合留存 critic(用于会话级回报)与即时奖励 critic(用于每请求反馈,如观看时长与点赞数)。
- 使用 8 维向量的连续动作空间来表示八个不同反馈信号(如观看时长、点赞、评论)的排序权重。
- 应用高斯策略网络(Actor)输出动作采样的均值与方差,以在训练过程中实现探索。
- 使用加权损失函数联合训练留存 critic 与即时奖励 critic,通过超参数调优确保训练的稳定性和性能。

实验结果
研究问题
- RQ1强化学习能否在真实世界的短视频推荐系统中有效应用于优化长期用户留存?
- RQ2如何缓解用户留存反馈中的长期延迟、不确定性和偏差,以实现稳定的强化学习训练?
- RQ3结合会话级留存与每请求反馈的双 critic 方法,是否相比单 critic 或朴素强化学习方法能提升策略学习效果?
- RQ4所提出的归一化技术是否能降低留存奖励信号的方差并改善训练收敛性?
- RQ5RLUR 策略在长期线上部署中对 DAU 和用户留存等关键业务指标的影响如何?
主要发现
- 在离线评估中,RLUR 实现了 1.892 小时的返回时间,显著优于基线方法如 CEM(2.036)与 TD3(2.009)。
- 在实际线上实验中,RLUR 在 100 天后使应用打开频率提升了 0.450%,与 CEM 基线相比 DAU 差距为 0.2%。
- 1 天留存率提升 0.053%,7 天留存率提升 0.063%,在十亿规模平台背景下具有统计显著性。
- 性能提升稳定且持续,第 80 天至第 100 天间观察到显著提升,表明训练过程稳定且收敛。
- RLUR 展现出随时间持续的改进,未出现性能退化,证实其在生产环境中的鲁棒性与可扩展性。
- 消融实验表明,所提出的归一化与双 critic 组件至关重要,因为使用 γ=0.9 的 RLUR(朴素)版本性能劣于完整 RLUR 模型。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。