[论文解读] Reducing Offline Evaluation Bias in Recommendation Systems
该论文提出了一种加权离线评估方法,以减少由于先前推荐算法影响用户行为而导致的协变量偏移所引起的推荐系统评估偏差。通过基于时间点间概率变化分配可调节的项目权重,该方法稳定了评估分数,显著降低了在真实 Viadeo 数据上对生产算法的过度估计。
Recommendation systems have been integrated into the majority of large online systems. They tailor those systems to individual users by filtering and ranking information according to user profiles. This adaptation process influences the way users interact with the system and, as a consequence, increases the difficulty of evaluating a recommendation algorithm with historical data (via offline evaluation). This paper analyses this evaluation bias and proposes a simple item weighting solution that reduces its impact. The efficiency of the proposed solution is evaluated on real world data extracted from Viadeo professional social network.
研究动机与目标
- 解决由于历史数据受先前推荐算法影响而带来的推荐系统离线评估偏差日益严重的问题。
- 指出离线评估会随着时间推移高估生产算法的性能,原因在于频繁推荐的项目变得更具可预测性。
- 提出一种可推广的解决方案,以减轻此类偏差,同时不丢弃参考评估时间点之后生成的新数据。
- 通过校正项目受欢迎程度的分布变化,稳定常量推荐算法的离线评估分数。
- 在真实世界的职业社交网络数据上展示该方法的有效性,表明非主导算法的性能随时间的退化程度降低。
提出的方法
- 引入一种加权评估框架,其中每个项目根据两个时间点之间项目受欢迎程度概率的变化被赋予可调节的权重。
- 使用权重函数 $ P(i|u,\omega) = \frac{\omega_i P(i|u)}{\sum_{j \in I} \omega_j P(j|u)} $ 基于历史数据重新加权用户-项目概率。
- 通过最小化 Kullback-Leibler 散度 $ D(\omega) = \sum_i \frac{P_{t_0}(i)}{P_{t_1}(i|\omega)} \log \frac{P_{t_1}(i|\omega)}{P_{t_0}(i)} $ 来优化权重,该散度衡量基础分布与加权分布之间的差异。
- 使用解析表达式计算散度的梯度:$ \frac{\partial P(i|u,\omega)}{\partial \omega_k} = \frac{P(k|u,\omega)}{\omega_k}(\delta_{ik} - P(i|u,\omega)) $。
- 采用基于梯度的优化方法,寻找能减少评估偏差的最优权重,同时保留整个历史数据。
- 预先计算用户-项目关联矩阵,并利用稀疏性,实现 $ \mathcal{O}(p \cdot N_{U \times I}) $ 的复杂度,其中 $ p $ 为活跃权重数量。
实验结果
研究问题
- RQ1由于先前算法对用户行为的影响,离线评估在多大程度上高估了生产推荐算法的性能?
- RQ2如何调整离线评估以纠正由先前推荐引起的项目受欢迎程度分布变化?
- RQ3简单的项目加权方案是否能有效稳定非生产系统中主导的算法的离线评估分数?
- RQ4活跃权重数量对偏差减少性能有何影响,特别是对推荐项目稳定或不稳定的算法?
- RQ5所提出的方法是否能在不丢弃参考评估时间点后生成的新数据的情况下,长期保持评估稳定性?
主要发现
- 所提出的加权方法显著减少了离线评估偏差,尤其对在生产系统中不占主导地位的算法效果明显。
- 对于主导算法 $ g^1 $,仅需 $ p=20 $ 个活跃权重即可实现性能稳定,因其推荐的项目在时间上受欢迎程度变化显著。
- 对于较不占主导地位的算法 $ g^2 $,则需要更多权重($ p>20 $),因其无法推荐因外部因素而变得热门的项目,导致性能下降。
- 该方法成功缓解了“赢家通吃”偏差,防止对生产算法的过度估计,从而实现对非主导算法更公平的比较。
- 基于梯度的权重优化在计算上是可行的,复杂度为 $ \mathcal{O}(p \cdot N_{U \times I}) $,使其适用于大规模数据集。
- 该方法通过整合全部历史数据而不丢弃新交互,保持了评估的完整性,确保对协变量偏移具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。