Skip to main content
QUICK REVIEW

[论文解读] Actor-Critic Reinforcement Learning for Control with Stability Guarantee

Minghao Han, Lixian Zhang|arXiv (Cornell University)|Apr 29, 2020
Reinforcement Learning in Robotics参考文献 42被引用 9
一句话总结

本文提出了一种新颖的演员-评论家强化学习框架,通过将李雅普诺夫稳定性理论嵌入评论家组件,确保机器人控制任务中的闭环稳定性。通过制定仅需单一期望不等式的基于数据的稳定性条件,该方法实现了稳定策略的样本高效学习,在多个控制基准测试中,对扰动和参数变化的鲁棒性优于当前最先进方法。

ABSTRACT

Reinforcement Learning (RL) and its integration with deep learning have achieved impressive performance in various robotic control tasks, ranging from motion planning and navigation to end-to-end visual manipulation. However, stability is not guaranteed in model-free RL by solely using data. From a control-theoretic perspective, stability is the most important property for any control system, since it is closely related to safety, robustness, and reliability of robotic systems. In this paper, we propose an actor-critic RL framework for control which can guarantee closed-loop stability by employing the classic Lyapunov's method in control theory. First of all, a data-based stability theorem is proposed for stochastic nonlinear systems modeled by Markov decision process. Then we show that the stability condition could be exploited as the critic in the actor-critic RL to learn a controller/policy. At last, the effectiveness of our approach is evaluated on several well-known 3-dimensional robot control tasks and a synthetic biology gene network tracking task in three different popular physics simulation platforms. As an empirical evaluation on the advantage of stability, we show that the learned policies can enable the systems to recover to the equilibrium or way-points when interfered by uncertainties such as system parametric variations and external disturbances to a certain extent.

研究动机与目标

  • 解决模型无关深度强化学习在机器人控制系统中缺乏稳定性保证的问题。
  • 通过将李雅普诺夫方法嵌入数据驱动学习框架,弥合控制理论与深度强化学习之间的鸿沟。
  • 开发一种样本高效的演员-评论家算法,通过可学习的李雅普诺夫评论家确保渐近稳定性。
  • 通过实证验证在模型不确定性与外部扰动下所学策略的鲁棒性。
  • 展示稳定策略在非线性和随机控制任务中对未见参考信号的泛化能力。

提出的方法

  • 为建模为马尔可夫决策过程的随机非线性系统提出一种基于数据的稳定性定理,将无限的李雅普诺夫差分条件简化为状态空间上的单一期望不等式。
  • 使用深度神经网络参数化李雅普诺夫函数和策略,实现端到端学习,其中评论家负责强制执行稳定性。
  • 推导稳定性条件的样本近似,以构建确保李雅普诺夫函数期望变化为负的评论家损失函数。
  • 将具备稳定性意识的评论家集成到演员-评论家强化学习框架中,其中演员被更新以最小化控制代价,同时满足李雅普诺夫条件。
  • 采用可定义于有限或无限时间范围的李雅普诺夫候选函数,其中无限时域情形等价于价值函数。
  • 使用离策略回放和基于梯度的优化方法,联合训练演员和李雅普诺夫评论家,确保训练和推理过程中的稳定性。

实验结果

研究问题

  • RQ1能否在无模型强化学习设置下,为随机非线性系统推导出基于数据的稳定性条件?
  • RQ2李雅普诺夫稳定性条件能否有效用作演员-评论家强化学习框架中的评论家,以确保闭环稳定性?
  • RQ3所提出的方法所生成的策略是否比标准强化学习算法对扰动和参数不确定性具有更强的鲁棒性?
  • RQ4所学策略能否在非线性控制和合成生物学任务中对未见的参考信号实现良好泛化?
  • RQ5李雅普诺夫候选函数的选择(例如,有限时域与无限时域)如何影响所学控制器的鲁棒性和性能?

主要发现

  • 所提出的LAC(李雅普诺夫正则化演员-评论家)方法在CartPole和GRN任务中,相较于SAC和LQR,实现了更低的死亡率和累积成本,表现出更优的稳定性和性能。
  • 在HalfCheetah任务中,LAC在强外部扰动下仍保持鲁棒性,而SAC在强扰动下失效。
  • 在FetchReach任务中,LAC和SAC在所有扰动水平下均表现可靠,但LAC展现出更高的稳定性和更低的方差。
  • 在GRN任务中,LAC策略能很好地泛化到未见的参考信号(例如周期为150、400的正弦信号以及幅值为8、16的常数信号),实现低方差和高精度跟踪。
  • SAC在跟踪某些参考信号(如周期150的正弦信号)时表现困难,且方差高于LAC,即使在类似信号上进行训练也是如此。
  • 李雅普诺夫候选函数的选择显著影响鲁棒性:使用较短时域(N=5–10)训练的控制器对脉冲扰动更具鲁棒性,而使用较长时域(N=15–20)的控制器鲁棒性较差;此外,LQR在突然受力下仍比SAC更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。