Skip to main content
QUICK REVIEW

[论文解读] Tight Regret Bounds for Model-Based Reinforcement Learning with Greedy Policies

Yonathan Efroni, Nadav Merlis|arXiv (Cornell University)|May 27, 2019
Reinforcement Learning in Robotics参考文献 37被引用 12
一句话总结

该论文表明,在有限时域、无折扣的MDP中,仅使用1步规划(而非完整规划)的基于模型的强化学习与贪婪策略,可实现与完整规划算法相同的紧致遗憾界。关键贡献在于对实时动态规划(RTDP)的新型分析,该分析使UCRL2-GP和EULER-GP的设计成为可能,二者在将计算复杂度降低$S$倍的同时,仍保持$\tilde{O}(\sqrt{HSAT}})$的遗憾界。

ABSTRACT

State-of-the-art efficient model-based Reinforcement Learning (RL) algorithms typically act by iteratively solving empirical models, i.e., by performing \emph{full-planning} on Markov Decision Processes (MDPs) built by the gathered experience. In this paper, we focus on model-based RL in the finite-state finite-horizon MDP setting and establish that exploring with \emph{greedy policies} -- act by \emph{1-step planning} -- can achieve tight minimax performance in terms of regret, $ ilde{\mathcal{O}}(\sqrt{HSAT})$. Thus, full-planning in model-based RL can be avoided altogether without any performance degradation, and, by doing so, the computational complexity decreases by a factor of $S$. The results are based on a novel analysis of real-time dynamic programming, then extended to model-based RL. Specifically, we generalize existing algorithms that perform full-planning to such that act by 1-step planning. For these generalizations, we prove regret bounds with the same rate as their full-planning counterparts.

研究动机与目标

  • 解决基于模型的强化学习算法中完整规划带来的高计算成本问题。
  • 为使用1步规划(贪婪策略)而非完整规划的基于模型的强化学习建立遗憾保证。
  • 证明贪婪策略可在表格型有限时域MDP中实现与完整规划算法相同的最小最大遗憾。
  • 将现有完整规划算法(UCRL2、EULER)推广至使用1步规划,同时保持遗憾界不变。
  • 在不牺牲性能保证的前提下,将计算复杂度降低$S$倍。

提出的方法

  • 在已知模型下,对实时动态规划(RTDP)进行新的有限样本分析,重点关注递减有界过程。
  • 引入针对递减有界过程的集中不等式,其本身具有独立意义,并支持RTDP的分析。
  • 将UCRL2和EULER算法改造为使用贪婪策略(1步规划)替代完整规划,从而得到UCRL2-GP和EULER-GP。
  • 引入一种新颖的状态-动作访问阈值$L_k$,根据其估计访问频率对状态-动作对进行划分。
  • 在遗憾分析中,运用柯西-施瓦茨不等式与求和界,控制期望逆访问次数。
  • 证明贪婪变体的遗憾界与原始完整规划版本相比,仅相差对数因子。

实验结果

研究问题

  • RQ1基于模型的强化学习若采用1步规划(贪婪策略),是否可在有限时域MDP中实现与完整规划算法相同的遗憾界?
  • RQ2在基于模型的强化学习中,若用1步规划替代完整规划,是否仍能保持紧致的遗憾保证($\tilde{\mathcal{O}}(\sqrt{HSAT}})$)?
  • RQ3在基于模型的强化学习算法中,用1步规划替代完整规划时,计算复杂度可降低多少?
  • RQ4RTDP算法是否可在已知模型下获得有限样本保证,从而支持其在学习设置中的应用?
  • RQ5当UCRL2和EULER的规划步骤被替换为1步贪婪规划时,其遗憾界是否仍可保持?

主要发现

  • UCRL2-GP和EULER-GP(使用1步贪婪规划而非完整规划)实现了与原始完整规划版本相同的遗憾界$\tilde{\mathcal{O}}(\sqrt{HSAT}})$。
  • 通过用1步规划替代完整规划,基于模型的强化学习在时间与空间复杂度上均降低了$S$倍。
  • 在基于模型的强化学习中,实现紧致遗憾界并不需要完整规划;仅使用1步规划的贪婪策略已足够。
  • 在已知模型下对RTDP的分析,为学习设置中推导遗憾界提供了基础,并引入了关于递减有界过程的新集中结果。
  • UCRL2-GP和EULER-GP在保持与UCRL2和EULER相同遗憾率的同时,显著降低了计算开销。
  • 遗憾界$\tilde{\mathcal{O}}(\sqrt{HSAT}})$是紧致的,与表格型有限时域MDP的已知最小最大下界一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。