Skip to main content
QUICK REVIEW

[论文解读] Bootstrapping Fitted Q-Evaluation for Off-Policy Inference

Botao Hao, Xiang Ji|arXiv (Cornell University)|Feb 6, 2021
Reinforcement Learning in Robotics参考文献 17被引用 10
一句话总结

本文提出了一种用于离策略推理的自举拟合Q评估(FQE)方法,能够实现策略评估误差分布、置信区间、方差和相关性的渐近一致估计。该方法建立了理论一致性与效率,并引入了一种子抽样变体,使运行时间降低一个数量级,同时保持了准确性。

ABSTRACT

Bootstrapping provides a flexible and effective approach for assessing the quality of batch reinforcement learning, yet its theoretical property is less understood. In this paper, we study the use of bootstrapping in off-policy evaluation (OPE), and in particular, we focus on the fitted Q-evaluation (FQE) that is known to be minimax-optimal in the tabular and linear-model cases. We propose a bootstrapping FQE method for inferring the distribution of the policy evaluation error and show that this method is asymptotically efficient and distributionally consistent for off-policy statistical inference. To overcome the computation limit of bootstrapping, we further adapt a subsampling procedure that improves the runtime by an order of magnitude. We numerically evaluate the bootrapping method in classical RL environments for confidence interval estimation, estimating the variance of off-policy evaluator, and estimating the correlation between multiple off-policy evaluators.

研究动机与目标

  • 为了在离策略评估(OPE)中实现超越点估计的可靠统计推断。
  • 为了从理论上证明自举FQE在估计误差分布方面具有渐近一致性和效率。
  • 为解决自举过程中的计算瓶颈,提出一种子采样程序。
  • 为了证明在依赖的轨迹数据中,相较于单个转移的自举,轨迹级别的自举是必要的。
  • 在表格型、线性及深度强化学习设置下,评估该方法在置信区间估计、方差和相关性估计方面的表现。

提出的方法

  • 提出一种自举FQE方法,通过重采样整个轨迹来估计FQE策略价值估计器的抽样分布。
  • 理论分析表明,自举FQE的误差分布具有渐近一致性,并匹配Cramér–Rao下界,意味着其具有渐近效率。
  • 引入一种子采样子自举程序,通过在每次自举迭代中采样部分轨迹,将计算成本降低一个数量级。
  • 采用轨迹级别的重采样而非单个转移的重采样,以保留时间依赖结构,避免误差估计不一致。
  • 使用线性函数逼近和神经网络,在表格型、连续控制及医疗仿真环境中验证性能。
  • 使用10,000次蒙特卡洛滚动仿真来计算真实策略价值,以评估覆盖率概率。

实验结果

研究问题

  • RQ1自举FQE在估计策略评估误差分布方面是否具有渐近一致性?
  • RQ2所提出的方法是否实现了渐近效率,即是否匹配Cramér–Rao下界?
  • RQ3子采样是否能在不牺牲估计精度的前提下,将计算成本降低一个数量级?
  • RQ4为何在依赖的轨迹数据中,轨迹级别的自举相较于转移级别的自举是必要的?
  • RQ5该方法在构建紧密置信区间以及在多个离策略评估器中估计方差和相关性方面的有效性如何?

主要发现

  • 自举FQE在估计FQE策略评估误差分布方面具有渐近一致性,且具有分布一致性的理论保证。
  • FQE的渐近方差匹配Cramér–Rao下界,证实在线性函数逼近下FQE具有渐近效率。
  • 子采样子自举将运行时间降低一个数量级,同时在置信区间覆盖率和方差估计方面保持高精度。
  • 轨迹级别的自举可获得一致的误差分布估计,而转移级别的自举由于依赖性导致方差和置信区间估计不一致。
  • 在包括Cliff Walking、MountainCar和Taxi在内的各类环境中,自举置信区间的经验覆盖率接近名义水平(如90%)。
  • 即使在有限样本量下,自举FQE的方差和相关性估计也具有低偏差和紧密区间,表现准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。