Skip to main content
QUICK REVIEW

[论文解读] Nearly Horizon-Free Offline Reinforcement Learning

Tongzheng Ren, Jialian Li|arXiv (Cornell University)|Mar 25, 2021
Reinforcement Learning in Robotics参考文献 47被引用 6
一句话总结

本论文为马尔可夫决策过程(MDP)中的离线强化学习提出了近乎无时域依赖的样本复杂度边界,适用于周期性时齐MDP。对于离线策略评估(OPE),误差为$\tilde{O}\big(\sigma{1}{Kd_m}\big)$;对于离线策略优化(OPO),次优性差距为$\tilde{O}\big(\sigma{1}{Kd_m} + \frac{\min(S,d)}{Kd_m}\big)$。关键创新在于提出了一种基于递归的新型方法来控制总方差,从而在主要误差项中消除了显式的$H$依赖性。

ABSTRACT

We revisit offline reinforcement learning on episodic time-homogeneous Markov Decision Processes (MDP). For tabular MDP with $S$ states and $A$ actions, or linear MDP with anchor points and feature dimension $d$, given the collected $K$ episodes data with minimum visiting probability of (anchor) state-action pairs $d_m$, we obtain nearly horizon $H$-free sample complexity bounds for offline reinforcement learning when the total reward is upper bounded by $1$. Specifically: 1. For offline policy evaluation, we obtain an $ ilde{O}\left(\sqrt{\frac{1}{Kd_m}} ight)$ error bound for the plug-in estimator, which matches the lower bound up to logarithmic factors and does not have additional dependency on $\mathrm{poly}\left(H, S, A, d ight)$ in higher-order term. 2.For offline policy optimization, we obtain an $ ilde{O}\left(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S, d)}{Kd_m} ight)$ sub-optimality gap for the empirical optimal policy, which approaches the lower bound up to logarithmic factors and a high-order term, improving upon the best known result by \cite{cui2020plug} that has additional $\mathrm{poly}\left(H, S, d ight)$ factors in the main term. To the best of our knowledge, these are the \emph{first} set of nearly horizon-free bounds for episodic time-homogeneous offline tabular MDP and linear MDP with anchor points. Central to our analysis is a simple yet effective recursion based method to bound a "total variance" term in the offline scenarios, which could be of individual interest.

研究动机与目标

  • 解决离线强化学习中的时域诅咒问题,因为现有方法在时域$H$上存在多项式或更差的依赖性。
  • 为离线策略评估(OPE)和离线策略优化(OPO)建立几乎不依赖于$H$的样本复杂度边界。
  • 实现的边界与已知下界相比仅相差对数因子和高阶项,优于以往具有显式$\mathrm{poly}(H,S,d)$依赖性的结果。
  • 提出一种新的基于递归的方法,以控制离线RL分析中关键的“总方差”项,该方法可能具有独立的研究价值。
  • 在时齐MDP中首次建立OPE和OPO的近乎无时域依赖的保证,适用于表格型和线性MDP及其锚点结构。

提出的方法

  • 提出一种基于递归的方法,以界定了离线RL误差分析中出现的“总方差”项,该方法对控制估计误差至关重要。
  • 将此递归方法应用于推导插补估计器在离线策略评估中的有限样本误差界,表明其误差为$\tilde{O}\big(\sqrt{\frac{1}{Kd_m}}\big)$。
  • 在经验MDP上使用基于模型的规划,推导出一个策略,其次优性差距为$\tilde{O}\big(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S,d)}{Kd_m}\big)$,用于离线策略优化。
  • 利用MDP的时间齐次结构,避免主要误差分量中出现与时域相关的项。
  • 建立的边界与信息论下界相比仅相差对数因子和高阶项。
  • 证明所提方法避免了以往工作中存在的$\mathrm{poly}(H,S,A,d)$依赖性,特别是在高阶项中。

实验结果

研究问题

  • RQ1在时齐MDP中,离线强化学习能否实现几乎不依赖于时域$H$的样本复杂度边界?
  • RQ2是否存在一种几乎无显式$H$依赖的离线策略评估的最紧有限样本误差界?
  • RQ3能否使离线策略优化中的次优性差距实现近乎无时域依赖,从而改进以往具有$\mathrm{poly}(H,S,d)$因子的结果?
  • RQ4是否存在一种通用的分析技术,可控制离线RL中“总方差”项并避免时域爆炸?
  • RQ5所提方法在离线RL设置中,能在多大程度上实现近乎极小化最大风险的样本复杂度(仅相差对数因子)?

主要发现

  • 对于离线策略评估,插补估计器的误差界为$\widetilde{O}\big(\sqrt{\frac{1}{Kd_m}}\big)$,与已知下界相比仅相差对数因子,且高阶项中不包含额外的$\mathrm{poly}(H,S,A,d)$依赖。
  • 对于离线策略优化,经验最优策略的次优性差距为$\widetilde{O}\big(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S,d)}{Kd_m}\big)$,相比最优先前结果,已从主项中消除了$\mathrm{poly}(H,S,d)$因子。
  • 所提出的基于递归的总方差控制方法是实现无时域依赖边界的中心机制,其本身可能具有独立的研究价值。
  • 这是首次在具有锚点的周期性时齐表格型MDP和线性MDP中,为OPE和OPO建立近乎无时域依赖的边界。
  • 结果表明,当MDP为时齐且数据覆盖充分时,时域诅咒在离线RL中可被显著缓解。
  • 分析表明,时齐结构有助于更紧密地控制值函数估计误差,避免了在时变设置中常见的$S$因子爆炸。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。