Skip to main content
QUICK REVIEW

[论文解读] Instance-dependent $\ell_\infty$-bounds for policy evaluation in tabular reinforcement learning

Ashwin Pananjady, Martin J. Wainwright|arXiv (Cornell University)|Sep 19, 2019
Reinforcement Learning in Robotics参考文献 61被引用 6
一句话总结

本文通过插补估计器和一种鲁棒变体,在表格化马尔可夫奖励过程(MRP)中建立了实例相关的 $π\infty$-范数误差界,利用一种新颖的留一法去耦技术。在自然 MRP 子类上证明了逼近最优性(常数因子内),并提供了依赖于未知问题实例和数据相关量的非渐近保证。

ABSTRACT

Markov reward processes (MRPs) are used to model stochastic phenomena arising in operations research, control engineering, robotics, and artificial intelligence, as well as communication and transportation networks. In many of these cases, such as in the policy evaluation problem encountered in reinforcement learning, the goal is to estimate the long-term value function of such a process without access to the underlying population transition and reward functions. Working with samples generated under the synchronous model, we study the problem of estimating the value function of an infinite-horizon, discounted MRP on finitely many states in the $\ell_\infty$-norm. We analyze both the standard plug-in approach to this problem and a more robust variant, and establish non-asymptotic bounds that depend on the (unknown) problem instance, as well as data-dependent bounds that can be evaluated based on the observations of state-transitions and rewards. We show that these approaches are minimax-optimal up to constant factors over natural sub-classes of MRPs. Our analysis makes use of a leave-one-out decoupling argument tailored to the policy evaluation problem, one which may be of independent interest.

研究动机与目标

  • 为有限horizon、折扣化的马尔可夫奖励过程(MRP)中的策略评估提供非渐近、实例相关的 $π\infty$-范数误差界。
  • 分析标准插补估计器及其鲁棒变体在生成模型(模拟器驱动)设定下的性能。
  • 在 MRP 的自然子类上建立逼近下界,以验证所提估计器的最优性。
  • 提出一种专为策略评估问题设计的新型留一法去耦论证,该方法在统计学习中可能具有独立兴趣。

提出的方法

  • 提出一种插补估计器,通过观测到的状态转移和奖励估计转移与奖励函数,进而计算估计 MRP 的值函数。
  • 引入插补估计器的鲁棒变体,以在模型误设或重尾噪声下提升稳定性。
  • 采用留一法去耦技术分析估计器的 $π\infty$-范数误差,从而实现实例相关与数据相关的边界。
  • 推导出依赖于未知问题实例(如转移结构、奖励方差)和可观测数据量的非渐近界。
  • 利用伯恩斯坦型大偏差不等式以及极值理论结果(例如二项分布随机变量的最大偏差)来界定估计误差。
  • 通过精心构造的困难实例——由 $D/3$ 个三状态 MRP 的副本组成——建立逼近下界,表明所提边界在常数因子内是紧致的。

实验结果

研究问题

  • RQ1插补估计器与鲁棒估计器在策略评估中的估计误差如何依赖于 MRP 的具体实例(如转移结构、奖励方差、折扣因子)?
  • RQ2在生成模型设定下,能否为表格化 MRP 中的策略评估推导出非渐近、实例相关的 $π\infty$-范数边界?
  • RQ3所提出的插补估计器在 MRP 的自然子类上是否为逼近最优(常数因子内)?
  • RQ4留一法去耦技术在实现更紧致、实例特定的误差分析中起到什么作用?
  • RQ5与全局最坏情况边界相比,数据相关边界在样本复杂度和实际相关性方面表现如何?

主要发现

  • 插补估计器实现了实例相关的 $π\infty$-误差界,其量级为 $\frac{\zeta \gamma}{N}$,其中 $\zeta = \|\theta^*\|_{\text{span}}$,且该界在自然 MRP 类上逼近最优(常数因子内)。
  • 鲁棒估计器提升了稳定性,并在高方差或罕见转移的场景下实现了相似的实例相关误差率。
  • 通过由 $D/3$ 个三状态 MRP 副本构成的困难实例,证明了插补估计器的 $π\infty$-误差在期望下有下界 $\frac{4}{9} \cdot \frac{\zeta \gamma}{N}$,从而验证了上界紧致性。
  • 分析表明,在 $N \succsim \frac{1}{1-\gamma}$ 的区域,主导误差项为 $\frac{\| (I - \gamma P)^{-1} \sigma(\theta^*) \|_\infty}{\sqrt{N}} \sim \frac{1}{\sqrt{N}} \left( \frac{1}{1-\gamma} \right)^{1.5 - \alpha}$,其依赖于转移矩阵的谱性质。
  • 留一法去耦技术能够更精确地控制估计器在各状态上的最大偏差,从而获得比标准大偏差不等式更紧的边界。
  • 基于观测到的转移与奖励样本推导出的数据相关边界在实践中可计算,并在有限样本情形下提供了有意义的误差控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。