[论文解读] Exploring Data Splitting Strategies for the Evaluation of Recommendation Models
本文研究了不同数据划分策略对推荐模型评估与排名的显著影响,表明即使使用相同的数据集和指标,同一模型在不同策略下的排名也可能不同。作者指出,诸如 leave-one-last 和时间用户划分等策略可能泄露未来信息,导致不可靠的比较,并主张采用标准化的时间全局划分作为公平评估的默认方法。
Effective methodologies for evaluating recommender systems are critical, so that such systems can be compared in a sound manner. A commonly overlooked aspect of recommender system evaluation is the selection of the data splitting strategy. In this paper, we both show that there is no standard splitting strategy and that the selection of splitting strategy can have a strong impact on the ranking of recommender systems. In particular, we perform experiments comparing three common splitting strategies, examining their impact over seven state-of-the-art recommendation models for two datasets. Our results demonstrate that the splitting strategy employed is an important confounding variable that can markedly alter the ranking of state-of-the-art systems, making much of the currently published literature non-comparable, even when the same dataset and metrics are used.
研究动机与目标
- 调查数据划分策略对推荐模型性能与排名的影响。
- 识别文献中当前评估实践在数据划分方法上的不一致性。
- 证明即使在相同数据集和指标下,不同划分策略也会导致最先进模型的排名出现显著差异。
- 为未来研究提供最佳实践,包括数据划分的报告与共享。
提出的方法
- 作者在三种数据划分策略——leave-one-item、leave-one-basket 和 temporal global 下,对七种最先进推荐模型(BPR、NMF、VAECF、NGCF、NeuMF、VBCAR 和 Triple2Vec)进行评估。
- 他们将这些策略应用于两个真实世界数据集:Amazon 和 Dunnhumby,确保预处理和超参数调优的一致性。
- 性能通过标准指标进行衡量:所有划分下的 NDCG@10 和 Recall@10。
- 通过超参数调优三个核心模型(NeuMF、VBCAR、Triple2Vec)生成的 230 种模型变体,开展大规模相关性实验,以评估不同策略下的排名稳定性。
- 计算每对划分策略之间得分分布的 Kendall’s τ 相关系数,以量化排名一致性。
- 作者分析了 leave-one-last 和 temporal user 划分中的信息泄露问题,发现未来交互信息可能被无意中用于训练,从而扭曲评估结果。
实验结果
研究问题
- RQ1数据划分策略的选择是否显著改变最先进推荐模型的排名?
- RQ2在使用相同数据集和指标的情况下,不同划分策略在性能排名上不一致的程度如何?
- RQ3哪种划分策略能最小化信息泄露,并提供最真实的模型性能评估?
- RQ4某些推荐模型是否因数据分布或信息泄露而系统性地被特定划分策略所偏爱?
- RQ5为确保未来推荐系统评估的可复现性与公平性,应采用哪些最佳实践?
主要发现
- 时间全局划分策略产生最一致且最真实的评估结果,应作为公平比较的默认策略。
- leave-one-last 和时间用户划分存在显著信息泄露,未来交互信息可能被无意中用于训练,从而扭曲性能评估。
- 不同划分策略之间的 Kendall’s τ 相关系数在 0.5284 到 0.7630 之间,表明即使在高性能模型中,排名也存在显著的互换。
- leave-one-item 策略在 NDCG@10 和 Recall@10 上表现出更宽的得分分布,表明其评估的是模型行为的其他方面,与更结构化的划分方式不同。
- 某些模型(如 Triple2Vec 和 VBCAR)在特定划分下表现更强,表明模型排名对数据划分设计高度敏感。
- 本研究证实,数据划分策略是模型评估中的关键混淆变量,即使在相同数据集和指标下,也会破坏已发表研究之间的可比性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。