[论文解读] Personalized Re-ranking for Improving Diversity in Live Recommender Systems
本文提出一种基于个性化确定性点过程(pDPP)的个性化重排序模型,以在不牺牲准确性的前提下提升实时推荐系统中的多样性。通过建模个体用户的多样性偏好,该方法在离线和在线A/B测试中均优于标准DPP和基线模型,在多样性指标和用户参与度方面取得显著提升,同时保持相关性。
Users of industrial recommender systems are normally suggesteda list of items at one time. Ideally, such list-wise recommendationshould provide diverse and relevant options to the users. However, in practice, list-wise recommendation is implemented as top-N recommendation. Top-N recommendation selects the first N items from candidates to display. The list is generated by a ranking function, which is learned from labeled data to optimize accuracy.However, top-N recommendation may lead to suboptimal, as it focuses on accuracy of each individual item independently and overlooks mutual influence between items. Therefore, we propose a personalized re-ranking model for improving diversity of the recommendation list in real recommender systems. The proposed re-ranking model can be easily deployed as a follow-up component after any existing ranking function. The re-ranking model improves the diversity by employing personalized Determinental Point Process (DPP). DPP has been applied in some recommender systems to improve the diversity and increase the user engagement.However, DPP does not take into account the fact that users may have individual propensities to the diversity. To overcome such limitation, our re-ranking model proposes a personalized DPP to model the trade-off between accuracy and diversity for each individual user. We implement and deploy the personalized DPP model on alarge scale industrial recommender system. Experimental results on both offline and online demonstrate the efficiency of our proposed re-ranking model.
研究动机与目标
- 解决工业系统中Top-N推荐性能欠佳的问题,该问题通常因独立的项目评分机制导致推荐列表冗余且缺乏多样性。
- 克服现有基于DPP的方法的局限性,即假设用户对多样性的偏好一致,这与真实用户行为不符。
- 设计一个可轻松部署在任意现有排序函数之后的重排序组件,确保与现有系统的向后兼容性,并降低生产环境中的部署风险。
- 通过基于用户行为历史推导出的个性化多样性偏好,建模用户特定的相关性与多样性之间的权衡。
- 通过离线评估和大规模在线A/B测试,在真实工业推荐系统中证明所提方法的有效性。
提出的方法
- 提出一种个性化DPP(pDPP)模型,通过从历史交互模式中估计个体用户对多样性的倾向,学习用户特定的多样性偏好。
- 在DPP公式中使用一个结合项目相关性得分与成对相似性的核矩阵,并引入个性化缩放因子α₀,以控制每位用户的多样性水平。
- 引入一个可学习参数l,用于建模最小熵阈值ℋ_min,该阈值基于用户的下载历史熵定义每位用户的基线多样性水平。
- 将pDPP作为后处理重排序层部署在任意现有排序函数之后,保留原始相关性得分的同时增强列表多样性。
- 通过离线评估校准超参数α₀,以在相关性与多样性之间取得平衡,基于MovieLens 1M和Company数据集上的表现,选定α₀ = 0.6为最优值。
- 在大规模工业推荐系统中开展在线A/B测试,将pDPP与BASE和标准DPP模型进行对比,使用真实世界指标评估性能。
实验结果
研究问题
- RQ1一种考虑用户个体多样性偏好差异的重排序模型,是否能在不降低相关性的情况下提升推荐列表的多样性?
- RQ2与基于DPP的重排序中假设统一多样性的方法相比,个性化多样性建模在离线和在线性能上表现如何?
- RQ3在真实工业系统中,个性化重排序能在多大程度上提升用户参与度及下载率、人均下载量等业务指标?
- RQ4用户特定的多样性倾向对其重排序效果有何影响,特别是对行为历史稀疏或高度集中的用户?
- RQ5模块化、可插拔的重排序组件是否能有效部署在生产系统中,而无需替换现有排序流水线?
主要发现
- 在在线A/B测试中,pDPP模型相比BASE模型在多样性(ILD)上实现了4.32%的相对提升,优于标准DPP 0.26个百分点。
- pDPP提升了用户参与度指标:相比BASE模型,下载率提升6.52%,人均下载量提升3.54%。
- 在MovieLens 1M数据集上,当l=0时,pDPP实现最佳平衡,保持与BASE模型相同的相关性(P@5 = 0.7051),同时提升多样性(ILD@5 = 0.6179)。
- α₀ = 0.6的模型在avg(P@5, ILD@5)上表现最佳,确认其在离线评估中实现了准确率与多样性的最优权衡。
- 尽管在线结果的增益幅度小于离线评估,但由于App Store日均交易量巨大,pDPP模型仍带来显著的商业价值——估计年收益达数百万美元。
- 行为历史极稀疏的用户(如仅下载过一次)限制了模型对多样性偏好的估计能力,这可能是pDPP与DPP在在线结果中增益差距较小的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。