Skip to main content
QUICK REVIEW

[论文解读] Multiple-Step Greedy Policies in Online and Approximate Reinforcement Learning

Yonathan Efroni, Gal Dalal|arXiv (Cornell University)|May 21, 2018
Reinforcement Learning in Robotics参考文献 15被引用 7
一句话总结

本文引入并分析了用于在线和近似强化学习的多步贪婪策略——具体为 $h$- 和 $k$-贪婪策略。研究发现,与单步贪婪设置不同,使用多步贪婪策略进行软策略更新并不能保证单调性改进。为此,论文提出了在生成模型或近似策略算子下具有理论收敛保证的算法,并建立了基于近似误差和折扣因子的性能边界。

ABSTRACT

Multiple-step lookahead policies have demonstrated high empirical competence in Reinforcement Learning, via the use of Monte Carlo Tree Search or Model Predictive Control. In a recent work \cite{efroni2018beyond}, multiple-step greedy policies and their use in vanilla Policy Iteration algorithms were proposed and analyzed. In this work, we study multiple-step greedy algorithms in more practical setups. We begin by highlighting a counter-intuitive difficulty, arising with soft-policy updates: even in the absence of approximations, and contrary to the 1-step-greedy case, monotonic policy improvement is not guaranteed unless the update stepsize is sufficiently large. Taking particular care about this difficulty, we formulate and analyze online and approximate algorithms that use such a multi-step greedy operator.

研究动机与目标

  • 为解决在在线和近似学习等实际强化学习设置中多步贪婪策略缺乏理论保证的问题。
  • 识别一个关键问题:与单步贪婪情形不同,使用多步贪婪策略进行软更新无法确保策略的单调改进。
  • 设计并分析基于 $h$- 和 $k$-贪婪算子的在线和近似算法,确保收敛性和性能边界。
  • 在生成模型和近似策略假设下,建立以近似误差、折扣因子和策略更新机制为度量的性能保证。

提出的方法

  • 提出 $h$-贪婪策略,即相对于 $T^{h-1}v$ 的单步贪婪策略,通过值函数自举实现多步前瞻。
  • 通过修改后的贝尔曼算子 $T_\kappa^\pi v = (I - \kappa\gamma P^\pi)^{-1}(r^\pi + (1-\kappa)\gamma P^\pi v)$ 引入 $\kappa$-贪婪策略,实现从单步到 $h$-步策略的插值。
  • 分析在软更新下多步贪婪策略无法实现单调改进的原因,即使在无近似的情况下,也因步长不足而失败。
  • 基于 $\kappa$-贪婪算子,开发了具有生成模型或近似策略访问权限下收敛保证的在线和近似策略迭代算法。
  • 采用逐分量误差传播分析与几何级数方法,推导出以 $\delta$、$\gamma$ 和 $\kappa$ 表示的性能边界。
  • 使用算子 $D_\kappa^{\pi^*}P^{\pi^*}$ 建模策略更新动态,并应用矩阵范数与级数求和技术,对迭代过程中的累积误差进行边界控制。

实验结果

研究问题

  • RQ1为何在精确情况下,使用多步贪婪策略进行软策略更新仍无法保证单调改进?
  • RQ2基于多步贪婪策略的在线和近似强化学习算法是否仍能实现收敛与性能保证?
  • RQ3多步贪婪策略的性能边界如何依赖于近似误差 $\delta$、折扣因子 $\gamma$ 和 $\kappa$ 参数?
  • RQ4在近似设置下,更新步长对多步贪婪策略迭代收敛性有何影响?
  • RQ5$h$- 和 $\kappa$-贪婪策略在软更新下的理论稳定性与收敛性方面有何比较?

主要发现

  • 论文证明,除非步长足够大,否则使用多步贪婪策略进行软策略更新无法保证单调改进,这是与单步贪婪行为的关键差异。
  • 对于 $\kappa$-贪婪算子,论文建立了累积误差的性能边界:$\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta$,用于值函数估计。
  • 在具有生成模型的在线设置中,算法达到边界 $\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta + \xi^k \frac{R_{\max}}{1-\gamma}$,其中 $\xi < 1$。
  • 第二种边界形式允许设定 $k^* = \left\lceil \frac{(1-\kappa\gamma)\log(R_{\max}/(\delta(1-\gamma)))}{1-\gamma} \right\rceil$,使残差误差小于 $\delta$。
  • 论文表明,$\kappa$-贪婪策略等价于求解一个 $\kappa\gamma$-折扣的MDP,其奖励函数为 $r^\pi + (1-\kappa)\gamma P^\pi v$,提供了合理的解释。
  • 分析证实,$\kappa$-贪婪策略在单步与 $h$-步策略之间实现插值,提供了计算成本与前瞻深度之间的连续权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。