Skip to main content
QUICK REVIEW

[论文解读] A Review of Off-Policy Evaluation in Reinforcement Learning

Masatoshi Uehara, Chengchun Shi|arXiv (Cornell University)|Dec 13, 2022
Reinforcement Learning in Robotics被引用 13
一句话总结

本文对强化学习中的离策略评估(OPE)提供了全面综述,统一了统计学、计算机科学和因果推断的视角。它整合了最先进的OPE方法,分析了其统计特性、效率边界,并探讨了在长时域、部分可观察及一般因果图设置下的挑战,为基于离线数据评估策略提供了具有严格理论基础的统一框架。

ABSTRACT

Reinforcement learning (RL) is one of the most vibrant research frontiers in machine learning and has been recently applied to solve a number of challenging problems. In this paper, we primarily focus on off-policy evaluation (OPE), one of the most fundamental topics in RL. In recent years, a number of OPE methods have been developed in the statistics and computer science literature. We provide a discussion on the efficiency bound of OPE, some of the existing state-of-the-art OPE methods, their statistical properties and some other related research directions that are currently actively explored.

研究动机与目标

  • 通过统一统计学、计算机科学和经济学领域中关于离策略评估(OPE)的研究,弥合强化学习与因果推断社区之间的差距。
  • 分析OPE估计器的统计效率边界,明确非参数效率可实现的条件。
  • 研究在长时域和无限时域设置下的挑战,包括时域诅咒和离线策略学习中的分布偏移问题。
  • 调查部分可观察马尔可夫决策过程(POMDP)和一般因果有向无环图(DAG)中OPE的理论性质,尤其在未观测混杂因素下的情形。
  • 解决现有OPE方法在高维动作空间和确定性策略中的局限性,其中路径可微性不成立。

提出的方法

  • 应用半参数理论推导马尔可夫决策过程(MDPs)中OPE的高效影响函数(EIF)和效率边界,确立估计方差的理论极限。
  • 综述并比较最先进的OPE方法,如双重稳健估计、逆概率加权和Q估计,强调其统计特性和对模型误设的鲁棒性。
  • 通过利用结构假设,将无模型和基于模型的OPE技术适配到POMDP中,缓解时域诅咒问题,并实现从单条轨迹中学习。
  • 在离线策略优化中引入悲观主义原则,通过惩罚分布外动作来防止高估,确保策略学习的保守性和可靠性。
  • 提出基于核的估计器以处理连续动作空间中的确定性策略,克服此类设置下路径可微性缺失的问题。
  • 利用do-演算的识别规则将OPE推广到一般因果DAG,研究在未观测混杂因素下非参数高效估计器存在的条件。

实验结果

研究问题

  • RQ1MDPs中离策略评估的理论效率边界是什么?哪些估计器能够达到该边界?
  • RQ2如何将OPE方法适配到部分可观察MDP(POMDP)中,以克服时域诅咒并实现单轨迹学习?
  • RQ3当行为策略与目标策略显著不同时,离线策略优化面临哪些统计挑战?悲观主义如何缓解高估问题?
  • RQ4当评估策略为确定性策略或通过倾斜定义时,估计特性如何变化,特别是在连续动作空间中?
  • RQ5在存在未观测混杂因素的一般因果DAG中,非参数高效OPE估计器在何种条件下可被构造?

主要发现

  • 通过半参数理论推导出MDPs中OPE的效率边界,且在正则条件下,双重稳健估计器可达到该边界。
  • 在POMDP中,利用结构假设的无模型OPE方法可规避时域诅咒,并能从单条轨迹中一致估计策略值。
  • 在连续动作空间的确定性策略中,路径可微性不成立,但在光滑性假设下,基于核的估计器可实现一致估计。
  • 在离线策略优化中引入悲观主义原则,通过惩罚分布外动作防止高估,提升泛化能力和稳定性。
  • 在存在未观测混杂因素的一般因果DAG中,可通过do-演算实现识别,但在广泛条件下,非参数效率仍未被证明。
  • 尽管已有进展,但在高维或复杂因果图中构造非参数高效OPE估计器仍是开放问题,尤其在未观测混杂因素下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。