Skip to main content
QUICK REVIEW

[论文解读] Deeply-Debiased Off-Policy Interval Estimation

Chengchun Shi, Runzhe Wan|arXiv (Cornell University)|May 10, 2021
Reinforcement Learning in Robotics参考文献 55被引用 6
一句话总结

本文提出了一种深度去偏的离策略区间估计方法,可为强化学习中的离策略评估构建稳健、高效且灵活的置信区间。通过使用条件密度比迭代去偏Q函数和价值估计器,该方法实现了三重稳健性——仅需Q函数、边际密度比或条件密度比中任一估计器一致即可实现有效推断——同时在弱且实际的条件下保持半参数效率和有效覆盖。

ABSTRACT

Off-policy evaluation learns a target policy's value with a historical dataset generated by a different behavior policy. In addition to a point estimate, many applications would benefit significantly from having a confidence interval (CI) that quantifies the uncertainty of the point estimate. In this paper, we propose a novel deeply-debiasing procedure to construct an efficient, robust, and flexible CI on a target policy's value. Our method is justified by theoretical results and numerical experiments. A Python implementation of the proposed procedure is available at https://github.com/RunzheStat/D2OPE.

研究动机与目标

  • 开发一种用于离策略评估的置信区间(CI),在弱且实际的假设下保持稳健、高效且有效。
  • 解决现有方法依赖独立同分布数据或强收敛率假设的局限性,这些假设常导致无效或过宽的置信区间。
  • 通过在Q函数和边际密度比估计器均误设时仍能实现有效推断,提升离策略评估中的不确定性量化。
  • 通过基于高阶影响函数的新型去偏程序,在保持稳健性的同时实现半参数效率。
  • 为现实世界中数据有限且具有时间依赖性的应用场景,提供一种灵活且实用的离策略区间估计框架。

提出的方法

  • 提出一种深度去偏程序,通过条件密度比估计器迭代减少Q函数和价值估计器的偏差。
  • 将双重稳健估计框架与高阶影响函数结合,实现三重稳健性。
  • 使用神经网络估计Q函数、边际密度比和条件密度比,通过共享训练组件提升计算效率。
  • 采用基于U统计量的不完全估计程序计算最终的价值估计器,支持并行化与可扩展性。
  • 采用两阶段训练流程:首先通过FQE学习Q函数,然后联合训练密度比估计器并引入去偏目标。
  • 基于去偏估计器的渐近正态性推导置信区间,确保在弱依赖和最小正则性条件下具有有效覆盖。

实验结果

研究问题

  • RQ1能否构建一种用于离策略评估的置信区间,使其在数据依赖性和估计器收敛性方面仅依赖于弱且实际的假设时仍保持有效覆盖?
  • RQ2是否可能在离策略区间估计中同时实现稳健性和效率,而无需Q函数和边际密度比估计器均一致?
  • RQ3与DRL、IS及经验似然等现有方法相比,所提出的深度去偏方法在覆盖有效性与区间宽度方面表现如何?
  • RQ4在去偏过程中使用条件密度比估计器对最终置信区间的稳健性和效率有何影响?
  • RQ5该方法是否能在高维或复杂强化学习设置中,保持半参数效率的同时对模型误设具有鲁棒性?

主要发现

  • 所提方法实现了三重稳健性,仅需Q函数、边际密度比或条件密度比估计器中任一一致,即可实现有效推断。
  • 该方法保持了半参数效率,确保置信区间在非参数模型中紧致且最优。
  • 实验结果表明,当数据表现出弱依赖性时,该方法仍能生成有效置信区间,而基于经验似然的方法(如CoinDice)则无法做到。
  • 在数据有限且状态空间高维的场景下,该方法在覆盖准确性和区间宽度方面均优于现有方法。
  • 计算复杂度可控且可扩展,各估计器间共享训练组件,采样步骤支持并行化。
  • 与基线方法(如CoinDice)相比,该方法对超参数调优更具鲁棒性,后者需大量超参数调整才能实现稳定性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。