Skip to main content
QUICK REVIEW

[论文解读] Intrinsically Efficient, Stable, and Bounded Off-Policy Evaluation for Reinforcement Learning

Nathan Kallus, Masatoshi Uehara|arXiv (Cornell University)|Jun 9, 2019
Reinforcement Learning in Robotics参考文献 23被引用 8
一句话总结

本文提出了一类基于经验似然的新型离策略评估(OPE)估计器,其内在效率高于重要性采样(IS)、自归一化重要性采样(SNIS)和双重稳健(DR)方法,同时保持了SNIS的有界性和稳定性。这些估计器在上下文Bandit和强化学习设置下均实现了渐近均方误差(MSE)的改进,理论分析与实证验证均表明其在性能上持续优于现有方法。

ABSTRACT

Off-policy evaluation (OPE) in both contextual bandits and reinforcement learning allows one to evaluate novel decision policies without needing to conduct exploration, which is often costly or otherwise infeasible. The problem's importance has attracted many proposed solutions, including importance sampling (IS), self-normalized IS (SNIS), and doubly robust (DR) estimates. DR and its variants ensure semiparametric local efficiency if Q-functions are well-specified, but if they are not they can be worse than both IS and SNIS. It also does not enjoy SNIS's inherent stability and boundedness. We propose new estimators for OPE based on empirical likelihood that are always more efficient than IS, SNIS, and DR and satisfy the same stability and boundedness properties as SNIS. On the way, we categorize various properties and classify existing estimators by them. Besides the theoretical guarantees, empirical studies suggest the new estimators provide advantages.

研究动机与目标

  • 为解决现有OPE方法的局限性,例如IS的高方差、DR在Q函数误设下的不稳定性,以及DR缺乏有界性。
  • 开发在渐近MSE方面始终优于IS、SNIS和DR的估计器。
  • 确保新估计器即使在Q函数误设时,也能继承SNIS的有界性和稳定性特性。
  • 在统一的参数化框架下整合现有OPE方法(IS、SNIS、DR),以实现系统性改进。
  • 在上下文Bandit和强化学习环境中对所提估计器进行实证验证。

提出的方法

  • 提出一类由系数参数化的通用估计器,其中IS、SNIS和DR为特例。
  • 使用经验似然方法选择最优参数以最小化渐近MSE,确保内在效率。
  • 提出两种变体:基于回归的REG估计器和基于经验似然的EMP估计器,两者均实现效率提升。
  • 推导影响函数和渐近方差表达式,证明在Q函数正确设定下具有局部效率和MSE最优性。
  • 通过将估计器约束在奖励值的支持集内,确保有界性,从而实现与SNIS相似的稳定性。
  • 将该框架应用于上下文Bandit(T=1)和马尔可夫决策过程(T>1),并进行理论与实证验证。

实验结果

研究问题

  • RQ1我们能否构建出在渐近MSE方面始终优于IS、SNIS和DR的OPE估计器?
  • RQ2我们能否在实现DR的局部效率的同时,保持SNIS的有界性和稳定性?
  • RQ3是否存在一个统一框架,能将IS、SNIS和DR作为特例包含在内,并支持系统性改进?
  • RQ4所提估计器在上下文Bandit和强化学习设置下的实证表现如何?
  • RQ5与现有方法相比,Q函数误设对新估计器性能的影响如何?

主要发现

  • 所提出的EMP和REG估计器在一般条件下,其渐近MSE严格低于IS、SNIS和DR,具有内在更高的效率。
  • 即使在Q函数误设时,估计器仍保持与SNIS相似的有界性和稳定性,避免了DR的不稳定性。
  • 在上下文Bandit和强化学习环境(如Windy Gridworld、Cliff Walking、Mountain Car)中的实证结果表明,其性能持续优于基线方法。
  • 理论分析表明,当Q函数正确设定时,所提估计器的渐近MSE可达到半参数效率界。
  • 当Q函数误设时,估计器优于标准DR,避免了DR中常见的MSE性能下降。
  • 使用经验似然可实现最优加权,从而在不牺牲稳定性或有界性的前提下提升效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。