Skip to main content
QUICK REVIEW

[论文解读] KCRL: Krasovskii-Constrained Reinforcement Learning with Guaranteed Stability in Nonlinear Dynamical Systems

Sahin Lale, Yuanyuan Shi|arXiv (Cornell University)|Jun 3, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

KCRL 提出了一种基于模型的强化学习框架,通过将克拉斯诺夫斯基的李雅普诺夫函数构造嵌入为策略优化中的线性矩阵不等式约束,确保了对未知非线性动力系统的渐近稳定性。利用随机傅里叶特征(RFF)学习系统动力学,并采用原始-对偶算法施加稳定性约束,KCRL 实现了有限时间内的稳定化,其样本复杂度上界为 $\mathcal{\tilde{O}}\left(\left(\frac{2\bar{G}\|M\|(1+L_{u})+\|M\|(1+L_{u})^{2}}{\bar{\epsilon}-\epsilon_{pd}}\right)^{3}\right)$,确保在 $D^2$ 个样本后获得稳定策略。

ABSTRACT

Learning a dynamical system requires stabilizing the unknown dynamics to avoid state blow-ups. However, current reinforcement learning (RL) methods lack stabilization guarantees, which limits their applicability for the control of safety-critical systems. We propose a model-based RL framework with formal stability guarantees, Krasovskii Constrained RL (KCRL), that adopts Krasovskii's family of Lyapunov functions as a stability constraint. The proposed method learns the system dynamics up to a confidence interval using feature representation, e.g. Random Fourier Features. It then solves a constrained policy optimization problem with a stability constraint based on Krasovskii's method using a primal-dual approach to recover a stabilizing policy. We show that KCRL is guaranteed to learn a stabilizing policy in a finite number of interactions with the underlying unknown system. We also derive the sample complexity upper bound for stabilization of unknown nonlinear dynamical systems via the KCRL framework.

研究动机与目标

  • 解决安全关键型非线性系统中模型无关强化学习缺乏正式稳定性保证的问题。
  • 通过利用克拉斯诺夫斯基方法进行李雅普诺夫函数构造,将控制理论中的稳定性分析整合到在线强化学习中。
  • 为在未知非线性动力系统中学习稳定策略提供有限时间样本复杂度上界。
  • 通过基于学习的雅可比估计约束策略优化,确保在模型不确定性下稳定性得以保持。

提出的方法

  • KCRL 使用随机傅里叶特征(RFF)在置信区间内表示并学习未知系统动力学。
  • 它将一个带约束的策略优化问题形式化,其中稳定性约束源自克拉斯诺夫斯基方法,以闭合环路系统雅可比矩阵上的线性矩阵不等式形式表达。
  • 该框架采用原始-对偶优化方法求解约束问题,确保在收敛时满足稳定性约束。
  • 该方法保证:若估计的雅可比矩阵保持在真实雅可比矩阵的有界误差范围内,则所学策略可稳定真实系统。
  • 它利用填充距离和近似误差界,确保稳定性条件在整个状态空间上成立。
  • 该算法以周期运行,周期长度设为 $D^2$,其中 $D$ 为模型表示中使用的 RFF 数量。

实验结果

研究问题

  • RQ1基于模型的强化学习框架是否能在不依赖稳定化预言机的情况下,保证对未知非线性动力系统的有限时间稳定化?
  • RQ2如何将克拉斯诺夫斯基方法用于李雅普诺夫函数构造,整合进基于学习的策略优化框架以确保稳定性?
  • RQ3使用基于 RFF 的动力学估计与约束优化,学习稳定策略所需的样本复杂度是多少?
  • RQ4模型不确定性如何影响所学策略的稳定性?是否可以对其进行有界控制以确保鲁棒性?

主要发现

  • 只要模型估计误差有界,KCRL 就能保证在 $D^2$ 个样本后,闭环系统在平衡集 $S_e$ 附近实现渐近稳定。
  • 稳定化的样本复杂度上界为 $\mathcal{\tilde{O}}\left(\left(\frac{2\bar{G}\|M\|(1+L_{u})+\|M\|(1+L_{u})^{2}}{\bar{\epsilon}-\epsilon_{pd}}\right)^{3}\right)$,其中 $\bar{\epsilon}$ 为真实稳定性裕度,$\epsilon_{pd}$ 为近似误差界。
  • 原始-对偶方法确保在收敛时满足克拉斯诺夫斯基稳定性约束,即使在使用学习到的动力学模型时亦成立。
  • 在 $D^2$ 个样本后,雅可比矩阵的估计误差 $\varepsilon_J$ 被界定为 $\mathcal{\tilde{O}}(D^{-1/3})$,当 $\epsilon_i \leq \bar{\epsilon} - \epsilon_{pd}$ 时可确保稳定性。
  • 通过要求填充距离 $h$ 满足 $\bar{\epsilon} - \epsilon_{pd} > 0$,且 $\epsilon_{pd} = 2\bar{G}\|M\|M_G h$,该框架确保在整个状态空间上保持稳定性。
  • 当周期长度设为 $D^2$ 时,KCRL 可在单个周期内实现稳定化,且后续周期因估计误差不增加而维持稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。