[论文解读] Sequential Evaluation and Generation Framework for Combinatorial Recommender System
本文提出了一种用于组合推荐系统的新型评估-生成框架,通过联合优化项目序列,训练神经评估器以预测整体效用(例如总点击量),并利用启发式搜索或强化学习生成高质量序列。该框架在在线性能上达到最先进水平,相较于强基线模型实现2.44%的相对提升,证明其在建模列表内相关性方面具有优越性,并通过与真实A/B测试结果高度相关的评估器(r = 0.9680)实现稳健的离线评估。
In the combinatorial recommender systems, multiple items are fed to the user at one time in the result page, where the correlations among the items have impact on the user behavior. In this work, we model the combinatorial recommendation as the problem of generating a sequence(ordered list) of items from a candidate set, with the target of maximizing the expected overall utility(e.g. total clicks) of the sequence. Toward solving this problem, we propose the Evaluation-Generation framework. On the one hand of this framework, an evaluation model is trained to evaluate the expected overall utility, by fully considering the user, item information and the correlations among the co-exposed items. On the other hand, generation policies based on heuristic searching or reinforcement learning are devised to generate potential high-quality sequences, from which the evaluation model select one to expose. We propose effective model architectures and learning metrics under this framework. We also offer series of offline tests to thoroughly investigate the performance of the proposed framework, as supplements to the online experiments. Our results show obvious increase in performance compared with the previous solutions.
研究动机与目标
- 为解决现有多样化排序方法依赖僵化、手工设计的相关性假设且缺乏可靠评估标准的局限性。
- 通过捕捉共曝光项目间复杂且非均匀的关系,更有效地建模列表内相关性。
- 开发一种实用的离线评估框架,可靠预测在线表现,减少对昂贵A/B测试的依赖。
- 优化排序列表的整体效用,而非依赖贪心的逐步项目选择,避免因局部次优选择导致的性能下降。
- 实现在拥有数亿用户的大规模系统中可扩展的、真实世界部署组合推荐。
提出的方法
- 该框架由两部分组成:评估器模型使用深度神经网络预测序列的预期整体效用,整合用户、项目及项目间相关性特征。
- 生成器使用序列解码策略——包括启发式搜索(如贪心采样)或强化学习(如Q-learning)——从候选项目集中生成候选序列。
- 评估器对多个生成的序列进行评估,并选择预测效用最高的序列进行展示,从而在生成与评估之间形成反馈循环。
- 评估器采用Bi-GRNN架构,与真实在线A/B测试结果的相关性高达0.9680,验证了其预测能力。
- 离线评估通过渐进式验证进行:首先评估评估器的预测准确性,然后评估生成器的性能,使用模拟和真实反馈。
- 在离策略强化学习设置下,使用合成反馈(来自评估器)和真实点击数据联合训练和验证该框架,确保其鲁棒性与泛化能力。
实验结果
研究问题
- RQ1神经评估器能否准确预测组合推荐序列的在线表现,从而减少对昂贵A/B测试的依赖?
- RQ2在学习到的效用评估器引导下,强化学习与启发式搜索在生成高效益项目序列方面效果如何?
- RQ3所提出的框架在多大程度上能捕捉超越简单多样性或子模性假设的复杂列表内相关性?
- RQ4在真实世界部署中,该框架是否能在未显式优化多样性的情况下,同时提升整体效用与类别覆盖率?
- RQ5在RL设置下,当暴露于噪声或动态在线环境时,生成器策略的鲁棒性如何?
主要发现
- Bi-GRNN评估器在400次实验中与真实在线A/B测试结果的相关性达到0.9680,显著优于MLP(0.2282),验证了其作为仿真代理的可靠性。
- 采用GRNN生成器与Bi-GRNN选择器的评估器-生成器框架,在在线性能上相比仅使用GRNN的基线模型实现了2.44%的相对提升。
- 强化学习方法(SetToSeq + RL)表现与评估器-生成器框架相当,尽管由于在线策略噪声存在偶尔的不稳定性。
- 与GRNN基线相比,该框架使类别覆盖率提升了0.62%,表明在未显式引入多样性正则化的情况下也增强了多样性。
- 评估器的高预测准确性使得有效的离线验证成为可能,从而在保持高置信度预测结果的同时,显著减少了对大规模在线A/B测试的需求。
- 该框架已成功部署于生产系统,服务于每日数亿活跃用户,证明了其可扩展性与真实世界有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。