Skip to main content
QUICK REVIEW

[论文解读] Minimax Value Interval for Off-Policy Evaluation and Policy Optimization

Nan Jiang, Jiawei Huang|arXiv (Cornell University)|Feb 6, 2020
Advanced Causal Inference Techniques参考文献 38被引用 14
一句话总结

本文提出了一种统一的极小极大值区间用于离策略评估,将值函数估计与重要性权重估计整合进单一框架,实现双重稳健性:无论值函数或权重函数类是否正确设定,该区间均保持有效,且区间的长度可量化另一部分的模型误设程度。该方法提供了比以往方法更连贯、更紧致的界,并在数据覆盖有限的条件下支持合理的策略优化。

ABSTRACT

We study minimax methods for off-policy evaluation (OPE) using value functions and marginalized importance weights. Despite that they hold promises of overcoming the exponential variance in traditional importance sampling, several key problems remain: (1) They require function approximation and are generally biased. For the sake of trustworthy OPE, is there anyway to quantify the biases? (2) They are split into two styles ("weight-learning" vs "value-learning"). Can we unify them? In this paper we answer both questions positively. By slightly altering the derivation of previous methods (one from each style; Uehara et al., 2020), we unify them into a single value interval that comes with a special type of double robustness: when either the value-function or the importance-weight class is well specified, the interval is valid and its length quantifies the misspecification of the other class. Our interval also provides a unified view of and new insights to some recent methods, and we further explore the implications of our results on exploration and exploitation in off-policy policy optimization with insufficient data coverage.

研究动机与目标

  • 解决基于函数逼近的离策略评估(OPE)方法中缺乏偏差量化的问题。
  • 将两种主流的OPE范式——“权重学习”与“值学习”——统一为一个连贯的框架。
  • 提供一个在部分模型误设条件下仍保持有效的值区间,其长度可衡量另一部分的误设程度。
  • 通过利用悲观主义与乐观主义原则,将该框架扩展至在数据覆盖不足条件下支持离策略策略优化。

提出的方法

  • 通过一个共同的变分公式,重新诠释并统一两种先前的OPE方法——Liu等人[5]与Uehara等人[1]的方法——推导出极小极大值区间。
  • 采用单一优化程序,联合学习值函数与重要性权重,确保充分利用所有数据成分。
  • 对值函数与边际重要性权重使用贝尔曼方程,推导出真实回报的对偶表示。
  • 通过在值函数与权重函数上进行极小极大优化构造边界:$\inf_w \sup_q L(w,q)$ 与 $\sup_w \inf_q L(w,q)$,其中 $L(w,q) = \mathbb{E}_w[r + \gamma q(s',\pi) - q(s,a)]$。
  • 证明当值函数或权重函数类之一被正确设定时,该区间保持有效,且区间的宽度可度量另一部分的误设误差。
  • 通过适配平均奖励与有限horizon MDP的底层贝尔曼恒等式,将框架扩展至平均奖励与有限horizon MDP。

实验结果

研究问题

  • RQ1我们能否将两种主流的离策略评估风格——“权重学习”与“值学习”——统一为一个连贯的框架?
  • RQ2我们能否量化函数逼近在离策略评估中引入的偏差,特别是在值函数与权重函数均被误设的情况下?
  • RQ3即使仅值函数或权重函数之一被正确设定,该结果区间是否仍能提供有意义的模型误设度量?
  • RQ4该极小极大区间能否用于推导在数据覆盖有限条件下离策略策略优化的合理探索与利用策略?

主要发现

  • 所提出的极小极大值区间通过共享的变分推导,将两种主要的OPE方法——Liu等人[5]与Uehara等人[1]——统一为一个单一、连贯的框架。
  • 该区间表现出一种特殊的双重稳健性:当值函数或权重函数类之一被正确设定时,区间保持有效,且区间的宽度可量化另一部分的误设误差。
  • 该区间通常比仅基于单一方法的朴素界更紧致,因为它通过联合优化程序充分利用了所有数据成分。
  • 该框架通过适配平稳分布与吸收态的底层贝尔曼恒等式,自然地扩展至平均奖励与有限horizon MDP。
  • 在策略类上优化下界与上界,分别对应悲观主义与乐观主义原则,从而在数据覆盖不足条件下实现可靠的策略优化。
  • 通过自助法的实证验证表明,尽管理论泛化界较松,该方法仍能有效处理统计误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。