Skip to main content
QUICK REVIEW

[论文解读] Evaluation Metrics for Item Recommendation under Sampling

Steffen Rendle|arXiv (Cornell University)|Dec 4, 2019
Recommender Systems and Techniques参考文献 7被引用 12
一句话总结

本文研究了在物品推荐中采样对评估指标的影响,表明采样指标与其精确对应指标不一致,且无法保持算法间相对性能排名的一致性——即使在期望下也是如此。研究发现,当采样规模较小时,所有指标均退化为AUC类似的行为,从而削弱了精确度、NDCG或AP等指标强调高排名物品的设计初衷。

ABSTRACT

The task of item recommendation requires ranking a large catalogue of items given a context. Item recommendation algorithms are evaluated using ranking metrics that depend on the positions of relevant items. To speed up the computation of metrics, recent work often uses sampled metrics where only a smaller set of random items and the relevant items are ranked. This paper investigates sampled metrics in more detail and shows that sampled metrics are inconsistent with their exact version. Sampled metrics do not persist relative statements, e.g., 'algorithm A is better than B', not even in expectation. Moreover the smaller the sampling size, the less difference between metrics, and for very small sampling size, all metrics collapse to the AUC metric.

研究动机与目标

  • 研究在物品推荐评估中使用采样指标而非精确指标所带来的后果。
  • 识别采样指标是否能在期望下保持算法间相对性能排名的一致性。
  • 分析采样对常见排序指标(如AUC、精确度、AP和NDCG)的特性与区分能力的影响。
  • 证明当采样规模较小时,所有指标行为相似并趋同于AUC行为,从而破坏了指标特异性设计目标。
  • 提醒研究人员在目标是评估top-list性能且使用如精确度或NDCG等高精度指标时,避免使用采样指标。

提出的方法

  • 将标准排序指标(AUC、精确度、AP、NDCG)形式化为列表大小为n时,唯一相关物品排名的函数。
  • 引入一种采样机制,仅对少量随机物品和相关物品进行排序,以降低计算成本。
  • 在均匀采样下分析采样指标的期望值,推导出采样AP及其他指标的闭式表达式。
  • 通过数学分析表明,当m=1(采样一个项目)时,所有采样指标均变为真实排名r的线性函数,导致其在排序行为上无法区分。
  • 将采样指标与精确指标进行比较,并证明采样AUC与精确AUC一致,但其他指标则不一致。
  • 采用渐近分析与极限分析(如m→1)表明,在重度采样下,指标间的差异消失,尤其在m=1时最为显著。

实验结果

研究问题

  • RQ1采样指标是否能在期望下保持两个推荐算法间相对性能排序的一致性?
  • RQ2采样规模如何影响AUC、精确度、AP和NDCG等不同排序指标的区分能力?
  • RQ3采样指标在多大程度上偏离了精确指标的预期行为,特别是其对高排名项目的强调作用?
  • RQ4是否存在一个采样规模使得所有指标变得无法区分?若存在,其极限行为如何?
  • RQ5当目标是评估top-k性能时,采样指标是否仍可视为精确指标的有效代理?

主要发现

  • 采样指标与精确指标不一致,且无法在期望下保持算法间相对性能排名的一致性。
  • 当采样规模较小时,尤其是m=1时,所有采样指标行为完全相同,且均为真实排名r的线性函数,彼此间无法区分。
  • 当m=1时,所有采样指标的定性排序结果与精确AUC指标完全一致,无论原始指标的设计意图为何。
  • 随着采样规模减小,精确度、AP和NDCG等指标之间的差异逐渐缩小,所有指标均趋同于AUC行为。
  • 单个相关项目位于排名r时,采样AP的期望值近似与(1 - AUC^n(r)^{m+1}) / (r-1)成正比,表明其仅在m较大时近似精确AP。
  • 分析证明,采样AUC与精确AUC一致,但其他采样指标不一致,表明采样指标度量的是与设计初衷不同的量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。