Skip to main content
QUICK REVIEW

[论文解读] Stabilizing Dynamical Systems via Policy Gradient Methods

Juan C. Perdomo, Jack Umenberger|arXiv (Cornell University)|Oct 13, 2021
Reinforcement Learning in Robotics参考文献 41被引用 13
一句话总结

该论文提出折扣退火(discount annealing),一种无需模型的策略梯度方法,通过在一系列无限时域LQR问题中逐步增加折扣因子,稳定未知的线性与平滑非线性动力系统。该方法可证明地以多项式样本复杂度恢复稳定控制器,无需预先存在稳定策略,并在线性和局部线性化非线性系统中实现近似最优性能。

ABSTRACT

Stabilizing an unknown control system is one of the most fundamental problems in control systems engineering. In this paper, we provide a simple, model-free algorithm for stabilizing fully observed dynamical systems. While model-free methods have become increasingly popular in practice due to their simplicity and flexibility, stabilization via direct policy search has received surprisingly little attention. Our algorithm proceeds by solving a series of discounted LQR problems, where the discount factor is gradually increased. We prove that this method efficiently recovers a stabilizing controller for linear systems, and for smooth, nonlinear systems within a neighborhood of their equilibria. Our approach overcomes a significant limitation of prior work, namely the need for a pre-given stabilizing control policy. We empirically evaluate the effectiveness of our approach on common control benchmarks.

研究动机与目标

  • 解决在无需预设稳定控制器的前提下稳定未知动力系统的基本挑战。
  • 开发一种无需模型、样本高效的策略梯度优化方法,用于稳定线性和平滑非线性系统。
  • 克服先前工作中假设可访问初始稳定控制器或稳定动力学的局限性。
  • 仅通过模拟器访问,为非线性系统在平衡点邻域内提供稳定性的理论保证。
  • 在标准控制基准上实证验证该方法,表明其性能与H∞综合等成熟鲁棒控制方法具有竞争力。

提出的方法

  • 该方法使用一系列折扣因子γ逐渐增大的无限时域LQR问题,从较小的γ开始,逐步增加至接近1。
  • 在每一步中,应用策略梯度优化以最小化折扣LQR代价,利用模拟器生成的有限时域轨迹来估计梯度和代价。
  • 该算法通过逐步增加γ实现一种“退火”过程,使策略收敛至未折扣LQR问题的稳定控制器。
  • 对于非线性系统,方法在平衡点附近对动力学进行线性化,并对雅可比矩阵应用相同过程,确保局部指数稳定。
  • 该方法依赖标准策略梯度更新,采用轨迹采样从模拟器实现不精确的梯度和代价评估。
  • 理论分析表明,所需梯度和代价评估次数随问题参数和逆容差ε呈多项式增长。

实验结果

研究问题

  • RQ1无模型的策略梯度方法是否能在不依赖初始稳定控制器的前提下稳定未知的线性动力系统?
  • RQ2所提出的折扣退火过程是否能为平滑非线性系统在平衡点邻域内生成稳定控制器?
  • RQ3该算法的样本复杂度(以模拟器查询次数和误差容差表示)如何?
  • RQ4策略梯度控制器的性能与线性化系统最优LQR控制器相比如何?
  • RQ5该方法是否能在基准非线性系统上实现与H∞综合等成熟鲁棒控制技术相媲美的性能?

主要发现

  • 折扣退火方法可证明地恢复线性系统的稳定状态反馈控制器,且该控制器对未折扣LQR问题也接近最优。
  • 该算法所需的梯度和代价评估次数在问题参数和容差ε下仅呈多项式增长,确保高效实现。
  • 对于平滑非线性系统,该方法生成的控制器可确保在平衡点邻域内实现指数稳定。
  • 在非线性倒立摆环境中的实证结果表明,尽管理论保证为局部,该控制器性能仍与H∞综合方法具有竞争力。
  • 策略梯度解与最优LQR控制器之间的误差随初始状态球半径增大而增加,表明对初始状态范围敏感。
  • 该方法在无需预先掌握稳定策略知识的情况下成功稳定系统,解决了Fazel等人(2018)提出的一个开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。