[论文解读] Top-K Off-Policy Correction for a REINFORCE Recommender System
本文提出了一种新颖的 top-K 离策略修正方法,以在大规模工业推荐系统中使用 REINFORCE 实现稳定且可扩展的策略梯度学习。通过校正来自多个行为策略的记录反馈中的数据偏差,并考虑多物品推荐,该方法提升了长期用户参与度,在 YouTube 的实际实验中实现了 ViewTime 0.85% 的增长和观看视频数 0.53% 的增长。
Industrial recommender systems deal with extremely large action spaces -- many millions of items to recommend. Moreover, they need to serve billions of users, who are unique at any point in time, making a complex user state space. Luckily, huge quantities of logged implicit feedback (e.g., user clicks, dwell time) are available for learning. Learning from the logged feedback is however subject to biases caused by only observing feedback on recommendations selected by the previous versions of the recommender. In this work, we present a general recipe of addressing such biases in a production top-K recommender system at Youtube, built with a policy-gradient-based algorithm, i.e. REINFORCE. The contributions of the paper are: (1) scaling REINFORCE to a production recommender system with an action space on the orders of millions; (2) applying off-policy correction to address data biases in learning from logged feedback collected from multiple behavior policies; (3) proposing a novel top-K off-policy correction to account for our policy recommending multiple items at a time; (4) showcasing the value of exploration. We demonstrate the efficacy of our approaches through a series of simulations and multiple live experiments on Youtube.
研究动机与目标
- 解决由于从多个历史策略记录反馈而导致的工业推荐系统中的数据偏差问题,这些策略具有非平稳行为特征。
- 将 REINFORCE 策略梯度算法扩展至可处理现实生产环境中数百万项物品的动作空间。
- 开发一种专为 top-K 推荐系统设计的新颖 top-K 离策略修正机制,其中多个项目被同时推荐。
- 展示探索与方差减少技术在提升长期用户满意度和参与度方面的价值。
- 通过模拟和 YouTube 推荐系统上的大规模实际实验验证该方法。
提出的方法
- 将 REINFORCE 算法适配至具有巨大动作空间(数百万项物品)的神经候选生成器,通过深度神经网络进行函数逼近。
- 通过建模记录策略并使用重要性采样重新加权记录反馈,实施离策略校正,以减少非均匀数据收集带来的偏差。
- 提出一种新颖的 top-K 离策略修正方法,通过修改策略梯度更新方式,以考虑 K 个项目的联合推荐,确保相关项目在 top-1 之外仍具有非零概率质量。
- 实施方差减少技术,包括重要性权重截断(c = e³),以防止对高奖励、低概率动作的过拟合。
- 使用学习得到的记录策略来估计行为策略,从而准确校正记录隐式反馈中的选择偏差。
- 应用 TRPO 风格的约束和归一化重要性采样,以进一步稳定训练并改善收敛性。
实验结果
研究问题
- RQ1如何将 REINFORCE 扩展至动作空间达数百万项的生产推荐系统?
- RQ2标准离策略修正在 top-K 推荐场景中为何会失效,以及如何改进?
- RQ3top-K 离策略修正对 ViewTime 和观看视频数等用户参与度指标有何影响?
- RQ4K 值和重要性权重截断等超参数如何影响所学习策略的性能与稳定性?
- RQ5通过离策略修正实现的探索是否能带来长期用户满意度的可测量提升?
主要发现
- 在 YouTube 实际实验中,top-K 离策略修正带来了 ViewTime 0.85% 的统计显著增长,以及观看视频数 0.53% 的增长。
- 在 top-K 修正中使用 K=1 相较于基线 K=16 导致 ViewTime 下降 0.66%,证实了多项目修正相比仅关注 top-1 的学习具有优势。
- 设置 K=8 时,ViewTime 获得 +0.15% 的统计显著提升,表明在探索与利用之间达到了更优的平衡。
- 将重要性权重截断上限从 c=e³ 提升至 c=e⁵ 导致 ViewTime 下降 0.52%,表明截断可有效防止对高方差、低概率动作的过拟合。
- 标准离策略修正导致策略过度集中于 top-1 准确率,而 top-K 修正则生成了更平滑的策略,整体 top-K 推荐质量更优。
- 模拟与实际实验均证实,考虑 K 个项目的联合推荐显著改善了全页面用户体验,优于仅关注 top-1 的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。