[论文解读] TDR-CL: Targeted Doubly Robust Collaborative Learning for Debiased Recommendations
本文提出 TDR-CL,一种面向去偏推荐的靶向双重稳健协作学习方法,通过将插补误差分解为参数和非参数分量,降低双重稳健(DR)估计器中的偏差和方差,实现协作优化。该方法在多个基准测试中实现了评分预测和点击率估计的最先进性能,在各种偏差条件下显著提升了 AUC、NDCG 和 MSE。
Bias is a common problem inherent in recommender systems, which is entangled with users' preferences and poses a great challenge to unbiased learning. For debiasing tasks, the doubly robust (DR) method and its variants show superior performance due to the double robustness property, that is, DR is unbiased when either imputed errors or learned propensities are accurate. However, our theoretical analysis reveals that DR usually has a large variance. Meanwhile, DR would suffer unexpectedly large bias and poor generalization caused by inaccurate imputed errors and learned propensities, which usually occur in practice. In this paper, we propose a principled approach that can effectively reduce bias and variance simultaneously for existing DR approaches when the error imputation model is misspecified. In addition, we further propose a novel semi-parametric collaborative learning approach that decomposes imputed errors into parametric and nonparametric parts and updates them collaboratively, resulting in more accurate predictions. Both theoretical analysis and experiments demonstrate the superiority of the proposed methods compared with existing debiasing methods.
研究动机与目标
- 解决现有推荐系统中双重稳健(DR)方法存在的高方差和对模型误设的敏感性问题。
- 当误差插补模型不准确时(实践中常见),降低 DR 估计器中的偏差与方差。
- 开发一种模型无关的框架,通过误差插补优化实现对任意 DR 方法的增强。
- 提出一种统一的无数据协作学习方法,联合优化参数与非参数误差分量,实现稳健预测。
- 在不同暴露偏差水平下,实现在真实世界与半合成推荐数据集中的更好泛化性与鲁棒性。
提出的方法
- 引入一种靶向双重稳健(TDR)估计器,利用靶向学习降低 DR 方法中的偏差与方差,即使在误差插补误设时亦成立。
- 采用基于 $1/\hat{p}_{u,i} - 1$ 的靶向步骤作为关键组件,以满足高效影响函数条件,确保渐近效率。
- 提出 TDR-CL,一种新颖的半参数协作学习框架,将插补误差分解为参数模型与非参数残差校正项。
- 通过协作学习机制联合更新参数与非参数误差分量,以自适应方式校正偏差。
- 采用统一的无数据设计,无需额外的均匀数据,同时保持对小倾向得分的鲁棒性。
- 将方法应用于评分预测与点击后转化率预测任务,使用平方损失、AUC 与 NDCG 作为评估指标。
实验结果
研究问题
- RQ1靶向学习能否有效应用于去偏推荐,以同时降低 DR 估计器中的偏差与方差?
- RQ2在模型误设条件下,TDR-CL 与标准 DR 及 MRDR 方法相比,其鲁棒性如何?
- RQ3误差插补模型的准确性对基于 DR 的推荐系统性能有何影响?
- RQ4一种联合优化参数与非参数误差分量的协作学习框架,能否优于标准 DR 方法?
- RQ5所提方法在不同倾向剪裁水平下的表现如何,体现其对小倾向值的鲁棒性?
主要发现
- TDR-CL 在合成数据与真实世界数据集上所有指标(MSE、AUC、NDCG@5、NDCG@10)中均表现最佳,显著优于 DR-CL 与 MRDR-CL。
- 最优性能出现在倾向剪裁阈值为 0.15 时,表明信息利用与鲁棒性之间存在显著权衡。
- 与标准 DR 及 MRDR 方法相比,TDR-CL 显著降低了偏差与方差,尤其在模型误设条件下表现更优。
- 消融实验确认,靶向步骤与协作学习至关重要,因为 DR-CL 与 MRDR-CL(无靶向)性能均低于 TDR-CL。
- 该方法对小倾向得分具有鲁棒性,即使在误差插补不准确时仍能保持低方差。
- 理论分析证实,TDR 确保双重稳健性、有界性、低方差性,并对小倾向值具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。