Skip to main content
QUICK REVIEW

[论文解读] Adversarial Counterfactual Learning and Evaluation for Recommender System

Da Xu, Chuanwei Ruan|arXiv (Cornell University)|Nov 7, 2020
Recommender Systems and Techniques参考文献 47被引用 14
一句话总结

本文提出了一种新颖的极小极大对抗反事实学习框架,以解决推荐系统中因未观测到的曝光机制导致的曝光偏差问题。通过将曝光机制建模为两模型博弈中的对手,该方法实现了稳健的离线学习与评估,在模拟实验和真实世界在线A/B测试中均显著优于标准基线方法,尤其在缓解离线评估结果与在线评估结果之间的差异方面表现突出。

ABSTRACT

The feedback data of recommender systems are often subject to what was exposed to the users; however, most learning and evaluation methods do not account for the underlying exposure mechanism. We first show in theory that applying supervised learning to detect user preferences may end up with inconsistent results in the absence of exposure information. The counterfactual propensity-weighting approach from causal inference can account for the exposure mechanism; nevertheless, the partial-observation nature of the feedback data can cause identifiability issues. We propose a principled solution by introducing a minimax empirical risk formulation. We show that the relaxation of the dual problem can be converted to an adversarial game between two recommendation models, where the opponent of the candidate model characterizes the underlying exposure mechanism. We provide learning bounds and conduct extensive simulation studies to illustrate and justify the proposed approach over a broad range of recommendation settings, which shed insights on the various benefits of the proposed approach.

研究动机与目标

  • 解决离线推荐系统评估中的根本性问题:反馈数据受未观测到的曝光机制影响。
  • 克服因真实世界反馈数据中曝光状态部分观测导致的反事实学习可识别性问题。
  • 构建一种基于极小极大的原则性学习框架,将未知的曝光机制视为对抗性组件,以确保鲁棒性。
  • 弥合离线评估与在线A/B测试之间的差距,因为深度学习模型在离线指标上常表现不佳,尽管其在真实世界中表现优异。
  • 在合成数据集和真实世界数据集(包括在线A/B实验)上提供泛化边界和实证验证。

提出的方法

  • 将反事实学习问题表述为极小极大优化问题,其中候选模型在最坏情况的曝光机制下进行训练以保证性能。
  • 利用对偶性和松弛技术,将极小极大问题转化为可处理的两模型对抗博弈:一个模型(f_θ)用于预测用户反馈,另一个模型(g_ψ)用于建模曝光机制。
  • 引入正则化项 α 以平衡反馈预测与曝光建模目标之间的优化。
  • 在反事实设置中应用倾向性加权,但通过将曝光不确定性视为对抗性因素,放松可识别性约束。
  • 以交替方式训练两个模型,其中 g_ψ 作为 f_θ 的最坏情况曝光对手,提升在分布偏移下的泛化能力。
  • 使用真实世界数据集(Movielens-1M、Last-FM、Goodreads)和合成模拟实验,评估该方法在多种曝光机制和模型架构下的表现。

实验结果

研究问题

  • RQ1当曝光机制未知且未被考虑时,基于反馈数据的监督学习是否会导致用户偏好检测不一致?
  • RQ2曝光偏差在多大程度上扭曲了离线评估指标,尤其是在依赖历史曝光模式的情况下?
  • RQ3极小极大公式能否有效建模曝光机制中的不确定性,并提升离线模型评估的鲁棒性?
  • RQ4与标准倾向性加权方法相比,所提出的对抗反事实框架在泛化能力和与在线A/B测试结果的一致性方面表现如何?
  • RQ5该方法对超参数(如隐因子维度和正则化强度 α)的敏感性如何?

主要发现

  • 论文从理论上证明,基于反馈数据的标准监督学习由于未观测到的曝光机制,可能导致偏好检测不一致。
  • 所提出的对抗反事实方法在真实世界数据集上实现了最先进性能,使用ACL-Attention模型在Movielens-1M和Last-FM数据集上的Hit@10得分均为83.64。
  • 在在线A/B测试中,对抗反事实模型在点击率方面优于基线模型,证实其与真实世界部署结果高度一致。
  • 敏感性分析表明,当正则化参数 α 既不太小也不太大时性能最优,极端值下性能会下降。
  • 更大的隐因子维度始终能提升模型性能,表明该方法继承了底层推荐模型的泛化特性。
  • 该方法有效减少了离线评估与在线A/B测试之间的差异,解决了深度学习模型在离线指标中表现不佳但真实世界部署成功这一悖论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。