[论文解读] A Next Basket Recommendation Reality Check
本文对下一篮子推荐(NBR)方法进行了严格且公平的评估,揭示了文献中性能提升往往因过度关注重复行为而产生误导,忽视了探索行为。本文提出了新颖的指标以衡量重复与探索之间的平衡,并发现重复项预测远比探索项预测容易,且深度学习模型在探索任务上表现不佳,呼吁设计任务特定的模型架构,将重复与探索策略分开处理。
The goal of a next basket recommendation (NBR) system is to recommend items for the next basket for a user, based on the sequence of their prior baskets. Recently, a number of methods with complex modules have been proposed that claim state-of-the-art performance. They rarely look into the predicted basket and just provide intuitive reasons for the observed improvements, e.g., better representation, capturing intentions or relations, etc. We provide a novel angle on the evaluation of next basket recommendation methods, centered on the distinction between repetition and exploration: the next basket is typically composed of previously consumed items (i.e., repeat items) and new items (i.e, explore items). We propose a set of metrics that measure the repeat/explore ratio and performance of NBR models. Using these new metrics, we analyze state-of-the-art NBR models. The results of our analysis help to clarify the extent of the actual progress achieved by existing NBR methods as well as the underlying reasons for the improvements. Overall, our work sheds light on the evaluation problem of NBR and provides useful insights into the model design for this task.
研究动机与目标
- 为了严格评估NBR方法报告的性能提升是否在多数据集和多指标的公平且全面的评估下依然成立。
- 识别现有NBR评估实践中的缺陷,包括基线不一致、指标非标准化以及数据集异质性问题。
- 提出一个以推荐篮子中重复(重复)项与探索(发现)项区分为中心的新评估框架。
- 通过分析模型在重复与探索任务上的行为,揭示某些NBR模型为何表现更优。
- 通过强调重复与探索作为具有不同建模需求的独立子任务,为未来NBR模型设计提供指导。
提出的方法
- 作者在三个基准数据集上对三类NBR模型——基于频率的、基于最近邻的和深度学习的——进行了大规模对比。
- 引入新的任务特定指标,以量化推荐篮子中重复与探索的比例,衡量模型预测已消费项目与新颖项目的能力。
- 评估包含用户级别的性能分解,以分析不同用户群体在重复与探索项推荐方面的表现。
- 使用原始实现的已发表模型,以确保可复现性并避免再实现偏差。
- 分析预测重复项(基于频率和最近性)与探索新项(需建模项目相关性)的难度差异。
- 提出双路径模型设计策略:使用频率/最近性处理重复,使用神经网络处理探索,从而实现两者之间的可控权衡。
实验结果
研究问题
- RQ1在多个数据集和指标下,SOTA NBR方法报告的性能提升是否依然成立?
- RQ2现有NBR模型在多大程度上偏向推荐重复项而非探索新项?这种偏向如何影响长期用户参与度?
- RQ3不同NBR模型家族(基于频率、最近邻、深度学习)在重复与探索子任务上分别表现如何?
- RQ4重复项与探索项推荐之间的性能差距是否可由任务难度和模型容量的固有差异解释?
- RQ5未来NBR模型设计应遵循哪些原则,以更好地平衡用户偏好下的重复与探索?
主要发现
- 无任何NBR方法在所有数据集上始终优于其他方法,表明方法性能高度依赖于数据集。
- 所有评估的NBR方法均严重偏向重复行为,对重复项的性能显著高于探索项,表明任务难度存在根本性失衡。
- 重复项推荐远比探索项推荐容易,性能差距表明当前模型未能充分应对新项目发现的挑战。
- 与简单基线相比,基于深度学习的NBR模型在探索任务上表现更差,挑战了复杂模型在NBR中总是更优的假设。
- 所提出的重复/探索指标揭示,即使用户有探索历史,模型也常无法推荐新颖项目,暴露出当前评估与设计中的关键缺口。
- 在模型设计中分离重复与探索——使用频率/最近性处理重复,使用神经网络处理探索——可带来更高效且可控的NBR系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。