Skip to main content
QUICK REVIEW

[论文解读] On Minimax Optimal Offline Policy Evaluation

Lihong Li, Rémi Munos|arXiv (Cornell University)|Sep 12, 2014
Advanced Bandit Algorithms Research参考文献 19被引用 14
一句话总结

本文为有限MDP和多臂赌博机中的离线策略评估建立了极小化极大最优界,分析了两种标准估计量——似然比(LR)和回归(REG)——的均方误差(MSE)。结果表明,REG估计量在与动作数或奖励方差相关的常数因子内达到极小化极大最优;而LR估计量由于对重要性权重敏感,其表现可能任意差。

ABSTRACT

This paper studies the off-policy evaluation problem, where one aims to estimate the value of a target policy based on a sample of observations collected by another policy. We first consider the multi-armed bandit case, establish a minimax risk lower bound, and analyze the risk of two standard estimators. It is shown, and verified in simulation, that one is minimax optimal up to a constant, while another can be arbitrarily worse, despite its empirical success and popularity. The results are applied to related problems in contextual bandits and fixed-horizon Markov decision processes, and are also related to semi-supervised learning.

研究动机与目标

  • 为有限MDP和多臂赌博机中的离线策略评估建立基本的有限样本性能极限。
  • 在均方误差(MSE)准则下,分析策略价值估计的极小化极大风险下界。
  • 将两种广泛使用的估计量——似然比(LR)和回归(REG)——的性能与该极小化极大下界进行比较。
  • 确定回归估计量的渐近效率是否可转化为有限样本下的最优性。
  • 将结果扩展至上下文赌博机和固定时域MDP,并讨论其在半监督学习和策略优化中的意义。

提出的方法

  • 通过在奖励均值和方差上取最坏情况分布,推导出多臂赌博机中离线策略评估的极小化极大风险下界。
  • 分析似然比(LR)估计量的MSE,表明其相对于极小化极大下界存在不可控的乘法因子。
  • 提出回归(REG)估计量,通过样本均值估计每种动作的平均奖励,并推导其MSE界。
  • 证明REG估计量的MSE在极小化极大风险的常数因子之内,其中常数因子依赖于$ K $(动作数)或奖励方差的倒数。
  • 通过将每个状态-动作对在时域内视为单一动作,将结果扩展至固定时域MDP。
  • 通过将MDP归约为多臂赌博机,将轨迹聚合为有效动作,从而将赌博机结果应用于MDP。

实验结果

研究问题

  • RQ1在均方误差下,有限多臂赌博机中离线策略评估的极小化极大风险下界是什么?
  • RQ2似然比(LR)估计量的性能与极小化极大下界相比如何?其对重要性权重敏感的原因是什么?
  • RQ3在有限样本设置中,回归(REG)估计量是否在绝对常数因子内达到极小化极大最优?
  • RQ4REG估计量的MSE对动作数$ K $的依赖是否可以避免,还是不可避免?
  • RQ5这些结果如何推广到更复杂的情形,如上下文赌博机和固定时域MDP?

主要发现

  • 多臂赌博机中离线策略评估的极小化极大风险下界为$ R_n^* \triangleq \frac{1}{n} \text{Var}(w) + \frac{1}{n} \text{Var}(r) $,其中$ w $为重要性权重,$ r $为奖励。
  • 似然比(LR)估计量的MSE为$ (V_1 + V_2)/n $,由于重要性权重方差相关的不可控因子,其严格劣于极小化极大下界。
  • 回归(REG)估计量的MSE在极小化极大风险的常数因子$ C $之内,其中$ C = MK\big\{\min(4MK, \max_{x,a} r_{\Phi}^2(x,a)/\sigma_{\Phi}^2(x,a)) + 5\big\} $,且该因子依赖于$ K $和奖励方差。
  • REG估计量的MSE对$ K $的依赖是不可避免的,因为下界随$ K $增长,尤其在低噪声情形下更为显著。
  • 在小样本量(最多$ \sqrt{K} $)时,所有估计量的MSE均受常数限制,表明存在根本性的有限样本限制。
  • 在固定时域MDP中,极小化极大风险下界按$ \max_B \left\{ \sum_{(x,a)\in B} \mu(x,a) \right\}^2 \left(1 - \sum_{\tau} \mu_D(\tau) \right)^n + V_1/n $缩放,REG估计量的MSE仍保持在该下界的一个常数因子之内,且该常数随$ N^{H+1}K^H $增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。