Skip to main content
QUICK REVIEW

[论文解读] Off-Policy Evaluation and Learning for External Validity under a Covariate Shift

Masahiro Kato, Masatoshi Uehara|arXiv (Cornell University)|Feb 26, 2020
Advanced Causal Inference Techniques参考文献 43被引用 12
一句话总结

本文提出了一种在协变量偏移下用于离策略评估(OPE)和离策略学习(OPL)的双重稳健且高效的估计器,其中历史数据与评估数据具有不同的协变量分布。通过利用非参数密度比估计和交叉拟合,该方法实现了效率界限,并对模型误设具有鲁棒性,在多个数据集的实证评估中优于标准OPE方法。

ABSTRACT

We consider evaluating and training a new policy for the evaluation data by using the historical data obtained from a different policy. The goal of off-policy evaluation (OPE) is to estimate the expected reward of a new policy over the evaluation data, and that of off-policy learning (OPL) is to find a new policy that maximizes the expected reward over the evaluation data. Although the standard OPE and OPL assume the same distribution of covariate between the historical and evaluation data, a covariate shift often exists, i.e., the distribution of the covariate of the historical data is different from that of the evaluation data. In this paper, we derive the efficiency bound of OPE under a covariate shift. Then, we propose doubly robust and efficient estimators for OPE and OPL under a covariate shift by using a nonparametric estimator of the density ratio between the historical and evaluation data distributions. We also discuss other possible estimators and compare their theoretical properties. Finally, we confirm the effectiveness of the proposed estimators through experiments.

研究动机与目标

  • 解决历史数据与评估数据存在协变量偏移(即协变量分布不同)时的离策略评估与学习挑战。
  • 推导协变量偏移下OPE的效率界限,建立估计精度的理论下限。
  • 开发既高效(达到效率界限)又双重稳健(若密度比或行为策略模型任一正确则一致)的估计器。
  • 通过在估计过程中使用交叉拟合,确保对模型误设的鲁棒性,且无需依赖Donsker条件。
  • 在多个真实世界数据集上实证验证所提估计器,证明其在性能上显著优于标准OPE方法。

提出的方法

  • 推导协变量偏移下OPE的效率界限,定义任意正则估计器的理论最小方差。
  • 提出一种双重稳健且高效的估计器(DRCS),结合Kanamori等人(2012)的非参数密度比估计、逆概率加权和结果回归。
  • 应用交叉拟合以放松对扰动估计器的Donsker型条件要求,增强在高维或复杂设定下的鲁棒性。
  • 使用评估数据与历史数据分布之间密度比的非参数估计器,以校正协变量偏移。
  • 将估计的密度比整合进双重稳健的OPE框架,确保若行为策略或条件结果模型任一正确指定,则估计具有一致性。
  • 通过将高效OPE估计器作为策略优化的代理目标,将该框架扩展至离策略学习。

实验结果

研究问题

  • RQ1协变量偏移下离策略评估的理论效率界限是什么?
  • RQ2我们能否在协变量偏移下构建一个既高效又双重稳健的OPE估计器?
  • RQ3如何在不依赖强函数约束的条件下,确保协变量偏移下OPE对模型误设的鲁棒性?
  • RQ4协变量偏移对标准OPE方法有何影响?所提方法如何缓解此影响?
  • RQ5所提OPE框架能否有效扩展至协变量偏移下的离策略学习?

主要发现

  • 在对扰动估计器施加温和的非参数速率条件时,所提DRCS估计器达到了效率界限,确保了最优的估计精度。
  • DRCS估计器具有双重稳健性:若密度比或行为策略模型任一正确指定,则其保持一致。
  • 在SatImage、Vehicle和PenDigits数据集上的实证结果表明,DRCS显著降低了均方误差(MSE),相比标准OPE方法如IPW、DM和IPW-R。
  • 在离策略学习中,基于DRCS的策略优于基线方法,实现了更高的期望奖励(例如,在0.7πd+0.3πu行为策略下,RWD为0.683 vs. 0.241的IPW)。
  • DRCS-SN变体(使用样本分割)在不同数据集和样本规模下表现出稳定性能,证实了交叉拟合的有效性。
  • 该方法有效处理了协变量偏移,表现为在不同行为策略和评估数据分布下均保持一致的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。