Skip to main content
QUICK REVIEW

[论文解读] Study of a bias in the offline evaluation of a recommendation algorithm

Arnaud De Myttenaere, Boris Golden|arXiv (Cornell University)|Nov 4, 2015
Recommender Systems and Techniques被引用 3
一句话总结

本文识别出离线推荐算法评估中的一种偏差,该偏差源于先前推荐影响历史数据。本文提出一种基于实例加权的加权离线评估方法,以校正此偏差,在真实Viadeo数据上显著降低了评估误差,尤其在恒定推荐和协同过滤算法中表现明显,尽管由于活动期间的结构变化导致评分未能完全稳定。

ABSTRACT

Recommendation systems have been integrated into the majority of large online systems to filter and rank information according to user profiles. It thus influences the way users interact with the system and, as a consequence, bias the evaluation of the performance of a recommendation algorithm computed using historical data (via offline evaluation). This paper describes this bias and discuss the relevance of a weighted offline evaluation to reduce this bias for different classes of recommendation algorithms.

研究动机与目标

  • 识别并分析由先前推荐影响历史数据所导致的离线推荐算法评估中的系统性偏差。
  • 评估实例加权作为该偏差校正方法在离线评估中的有效性。
  • 评估加权评估是否能提高对简单(恒定)和复杂(协同过滤)推荐算法性能估计的准确性。
  • 研究该偏差的双重性质:一是由于项目选择概率的变化,二是由于用户-项目交互图结构的变化。
  • 在Viadeo专业社交网络的真实数据上,展示加权方法的实际相关性。

提出的方法

  • 本文引入一种加权离线评估框架,基于其在参考分布下的可能性,为每个用户-项目对分配实例特定权重,以校正协变量偏移。
  • 将评估形式化为预测准确率的加权平均,其中权重通过最小化训练数据与评估数据分布之间的差异来优化。
  • 该方法使用概率模型估计每个项目在评估中被选中的概率,并调整先前推荐活动的影响。
  • 对于协同过滤,该方法将加权方案应用于余弦相似度和朴素CF算法,使用相同的优化过程来校正偏差。
  • 权重随时间迭代计算,优化权重数量(p)控制重新校准的程度。
  • 该方法在Viadeo数据的201天周期内进行了验证,期间在t=330和t=430发生了两次主要推荐活动。

实验结果

研究问题

  • RQ1历史数据中存在先前推荐如何导致离线推荐算法评估的偏差?
  • RQ2实例加权在多大程度上能减少恒定推荐算法在离线评估中的偏差?
  • RQ3相同的加权策略是否能有效减少更复杂协同过滤算法中的偏差?
  • RQ4用户-项目图中选择概率变化与结构变化对整体评估偏差的相对贡献是什么?
  • RQ5优化权重数量(p)如何影响校正后评估的性能与稳定性?

主要发现

  • 在Viadeo的两次推荐活动(t=330和t=430)后,离线评估得分显著下降,表明先前推荐导致了显著偏差。
  • 所提出的加权方法有效减少了离线评估中的偏差,且p值越高(优化权重越多),校正效果越明显。
  • 对于恒定推荐算法,加权评估在活动后稳定了得分,充分校正了选择偏差。
  • 对于协同过滤算法,该方法减少了基于选择概率的偏差,但由于用户-项目图的结构变化,无法完全稳定得分。
  • 偏差被发现具有两个组成部分:一是项目选择概率的变化,二是活动驱动的用户-项目连接增加导致图密度上升。
  • 结果证实,实例加权是减少离线环境中评估偏差的实用且有效的方法,尤其在无法进行随机数据采集的情况下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。