Skip to main content
QUICK REVIEW

[论文解读] Policy Gradient Method For Robust Reinforcement Learning

Yue Wang, Shaofeng Zou|arXiv (Cornell University)|May 15, 2022
Reinforcement Learning in Robotics被引用 10
一句话总结

本文提出了首个在模型不匹配条件下具备全局最优性和复杂度保证的稳健强化学习策略梯度方法。该方法基于Fréchet次梯度提出一种稳健策略梯度,并进一步提出一种平滑变体,实现$Ø(\epsilon^{-3})$的复杂度以达到$\epsilon$-全局最优,同时扩展至演员-评论家框架,并在表格化和无模型设置下建立了理论收敛性。

ABSTRACT

This paper develops the first policy gradient method with global optimality guarantee and complexity analysis for robust reinforcement learning under model mismatch. Robust reinforcement learning is to learn a policy robust to model mismatch between simulator and real environment. We first develop the robust policy (sub-)gradient, which is applicable for any differentiable parametric policy class. We show that the proposed robust policy gradient method converges to the global optimum asymptotically under direct policy parameterization. We further develop a smoothed robust policy gradient method and show that to achieve an $ε$-global optimum, the complexity is $\mathcal O(ε^{-3})$. We then extend our methodology to the general model-free setting and design the robust actor-critic method with differentiable parametric policy class and value function. We further characterize its asymptotic convergence and sample complexity under the tabular setting. Finally, we provide simulation results to demonstrate the robustness of our methods.

研究动机与目标

  • 解决在模型不匹配条件下,策略梯度方法在稳健强化学习中缺乏可证明的全局最优性和鲁棒性保证的问题。
  • 开发一种适用于任意可微且Lipschitz参数化策略类的稳健策略梯度方法。
  • 在直接策略参数化下,基于Polyak-Łojasiewicz(PL)条件,建立策略梯度方法渐近收敛至全局最优的理论保证。
  • 设计一种平滑的稳健策略梯度方法,量化其样本复杂度为$\mathcal{O}(\epsilon^{-3})$,以实现$\epsilon$-全局最优。
  • 通过提出一种具有理论收敛保证的稳健演员-评论家算法,将该框架扩展至无模型设置,适用于表格化条件。

提出的方法

  • 推导稳健价值函数的Fréchet次梯度,即稳健策略梯度,适用于任意可微且Lipschitz的策略类。
  • 证明在直接参数化策略参数化下,稳健价值函数满足Polyak-Łojasiewicz(PL)条件,从而保证策略梯度方法的全局收敛性。
  • 通过稳健价值函数的平滑近似引入一种平滑的稳健策略梯度方法,以处理不可微性问题,从而支持收敛速率分析。
  • 设计一种基于可微策略和价值函数近似的无模型稳健演员-评论家算法,训练样本来自不确定性集的中心点。
  • 利用$R$-污染不确定性集模型定义最坏情况MDP,并针对最坏情况转移核优化策略。
  • 运用子梯度分析、PL条件及集中不等式等理论工具,建立收敛性和复杂度边界。

实验结果

研究问题

  • RQ1能否为稳健强化学习开发一种策略梯度方法,使其在模型不匹配条件下保证全局最优性?
  • RQ2如何有效优化不可微的稳健价值函数,其可达到的收敛速率是什么?
  • RQ3在稳健强化学习中,平滑策略梯度方法实现$\epsilon$-全局最优的样本复杂度是多少?
  • RQ4稳健策略梯度框架能否扩展至具有函数逼近的无模型设置?
  • RQ5所提出的稳健演员-评论家方法在直接策略参数化下的表格化设置中是否能达到全局最优?

主要发现

  • 由于稳健价值函数满足Polyak-Łojasiewicz(PL)条件,稳健策略梯度方法在直接策略参数化下以几乎必然收敛至全局最优。
  • 平滑的稳健策略梯度方法实现了$\epsilon$-全局最优,样本复杂度为$\mathcal{O}(\epsilon^{-3})$。
  • 在直接策略参数化下,稳健演员-评论家算法在表格化设置中实现全局收敛,前提是具备完美梯度知识。
  • 在Garnet问题上的实验结果表明,稳健策略梯度和演员-评论家方法在模型不匹配下的最坏情况性能上优于其非稳健基线方法。
  • 在多个环境和不确定性水平下,稳健演员-评论家方法获得的最坏情况折扣累积奖励高于标准演员-评论家方法。
  • 理论分析证实,$R$-污染不确定性下稳健价值函数的结构支持通过基于梯度的方法实现稳定且最优的策略学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。