Skip to main content
QUICK REVIEW

[论文解读] Optimal and Adaptive Off-policy Evaluation in Contextual Bandits

Yu-Xiang Wang, Alekh Agarwal|arXiv (Cornell University)|Dec 4, 2016
Advanced Bandit Algorithms Research参考文献 19被引用 20
一句话总结

该论文在无一致奖励模型的上下文Bandit设置下,首次建立了离策略评估的极小极大最优下界,表明逆 propensity scoring (IPS) 和双重稳健 (DR) 估计器在常数因子范围内达到极小极大最优。论文提出了切换估计器(switch estimator),通过自适应结合直接方法(DM)与DR估计器,实现更优的偏差-方差权衡,在实际应用中显著优于以往方法,尤其在重要性权重方差较高的情况下表现更优。

ABSTRACT

We study the off-policy evaluation problem---estimating the value of a target policy using data collected by another policy---under the contextual bandit model. We consider the general (agnostic) setting without access to a consistent model of rewards and establish a minimax lower bound on the mean squared error (MSE). The bound is matched up to constants by the inverse propensity scoring (IPS) and doubly robust (DR) estimators. This highlights the difficulty of the agnostic contextual setting, in contrast with multi-armed bandits and contextual bandits with access to a consistent reward model, where IPS is suboptimal. We then propose the SWITCH estimator, which can use an existing reward model (not necessarily consistent) to achieve a better bias-variance tradeoff than IPS and DR. We prove an upper bound on its MSE and demonstrate its benefits empirically on a diverse collection of data sets, often outperforming prior work by orders of magnitude.

研究动机与目标

  • 在奖励模型不一致的情况下,建立上下文Bandit中离策略评估的统计困难性。
  • 在对抗性设定下,推导离策略评估的均方误差(MSE)的极小极大下界。
  • 设计一种自适应估计器,通过更好地平衡偏差与方差,改进IPS与DR。
  • 在多样化的现实世界数据集中,实证验证切换估计器的优越性。

提出的方法

  • 推导了在无一致奖励模型的上下文Bandit中,离策略评估的MSE极小极大下界,表明IPS与DR在常数因子范围内达到最优。
  • 提出切换估计器,基于重要性权重自适应结合直接方法(DM)与双重稳健(DR)估计器。
  • 采用阈值机制:若重要性权重超过阈值τ,则估计器切换至DM;否则使用DR。
  • 分析切换估计器的MSE,证明其在最坏情况下不劣于DR或IPS,同时在实际中实现更低的方差。
  • 利用Hoeffding不等式与KL散度界,控制经验均值与重要性权重的集中性。
  • 在真实世界多分类数据集上验证方法,通过模拟具有确定性与噪声奖励的上下文Bandit问题。

实验结果

研究问题

  • RQ1当奖励模型不一致时,上下文Bandit中离策略评估的基本统计极限(极小极大风险)是什么?
  • RQ2在对抗性设定下,标准估计器如IPS与DR是否最优?能否进一步改进?
  • RQ3一种结合DM与DR的自适应估计器是否能实现优于现有方法的偏差-方差权衡?
  • RQ4切换估计器在多样化的真实世界数据集上与IPS、DR及DM相比表现如何?

主要发现

  • 在对抗性上下文Bandit设置下,离策略评估的极小极大下界与IPS与DR估计器的上界在常数因子范围内一致,证明了它们的极小极大最优性。
  • 尽管IPS与DR在理论上达到极小极大最优,但DR在实践中始终优于IPS,因其方差更低,即使在参数化模型不一致的情况下亦然。
  • 在多个真实世界数据集中,切换估计器的均方误差显著低于DR与IPS,有时降低一个数量级以上。
  • 切换估计器对高方差重要性权重具有鲁棒性,能自适应地响应数据,避免了IPS的不稳定性,同时在方差上优于DR。
  • 实证结果表明,尽管DR通常表现良好,但有时仍被DM超越,凸显了像切换估计器这样的自适应估计器的必要性。
  • 切换估计器的理论MSE上界不劣于DR或IPS,且在实际中实现显著更优的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。