Skip to main content
QUICK REVIEW

[论文解读] Bootstrapping Statistical Inference for Off-Policy Evaluation.

Botao Hao, Xiang Ji|arXiv (Cornell University)|Feb 6, 2021
Reinforcement Learning in Robotics参考文献 43被引用 6
一句话总结

本文提出了一种用于离策略评估的自举FQE方法,可实现策略评估误差的渐近高效性和分布一致性推断。通过适应一种重采样程序,该方法在保持置信区间估计、方差估计和多个评估者之间相关性分析准确性的同时,将运行时间提高了整整一个数量级。

ABSTRACT

Bootstrapping provides a flexible and effective approach for assessing the quality of batch reinforcement learning, yet its theoretical property is less understood. In this paper, we study the use of bootstrapping in off-policy evaluation (OPE), and in particular, we focus on the fitted Q-evaluation (FQE) that is known to be minimax-optimal in the tabular and linear-model cases. We propose a bootstrapping FQE method for inferring the distribution of the policy evaluation error and show that this method is asymptotically efficient and distributionally consistent for off-policy statistical inference. To overcome the computation limit of bootstrapping, we further adapt a subsampling procedure that improves the runtime by an order of magnitude. We numerically evaluate the bootrapping method in classical RL environments for confidence interval estimation, estimating the variance of off-policy evaluator, and estimating the correlation between multiple off-policy evaluators.

研究动机与目标

  • 为解决自举法在离策略评估(OPE)中缺乏理论理解的问题。
  • 开发一种自举FQE方法,确保策略评估误差推断的渐近高效性和分布一致性。
  • 通过一种重采样适应方法,降低自举法在OPE中的计算成本,实现运行时间提高一个数量级。
  • 评估该方法在估计置信区间、离策略评估者的方差以及多个评估者之间相关性方面的性能。

提出的方法

  • 提出一种自举FQE方法,通过从批量数据中重采样,以推断策略评估误差的抽样分布。
  • 建立理论保证,表明在表格型和线性模型设置下,当FQE达到极小化极大最优性时,该方法具有渐近高效性和分布一致性。
  • 采用一种重采样程序以降低计算成本,与标准自举法相比实现十倍的速度提升。
  • 将该方法应用于估计经典强化学习环境中的置信区间、离策略评估者的方差以及多个评估者之间的成对相关性。
  • 以拟合Q评估框架作为基础估计器,利用其极小化极大最优性,确保强大的统计性能。

实验结果

研究问题

  • RQ1当使用极小化极大最优的FQE作为基础估计器时,自举法在离策略评估中是否可以得到理论上的合理解释?
  • RQ2所提出的自举FQE方法是否在策略评估误差推断中实现了渐近高效性和分布一致性?
  • RQ3如何使自举法在大规模OPE中计算上可行,同时不牺牲统计准确性?
  • RQ4该方法在估计置信区间、评估者方差以及多个离策略评估者之间相关性方面的实际表现如何?

主要发现

  • 所提出的自举FQE方法实现了渐近高效性和分布一致性,确保了策略评估误差推断的可靠性。
  • 重采样适应方法使运行时间减少了一个数量级,使自举法在大规模离策略评估中成为可行方案。
  • 实验结果表明,该方法在经典强化学习环境中均能准确估计置信区间,验证了其可靠性。
  • 该方法成功估计了离策略评估者的方差以及多个评估者之间的相关性,展示了其在实际场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。