Skip to main content
QUICK REVIEW

[论文解读] Deep Model Predictive Control with Stability Guarantees

Prabhat K. Mishra, Mateus V. Gasparino|arXiv (Cornell University)|Apr 15, 2021
Advanced Control Systems Optimization参考文献 46被引用 4
一句话总结

本文提出了一种用于具有非结构化有界不确定性、非线性且控制仿射的离散时间系统的深度学习增强型模型预测控制(deep-MPC)框架。通过结合双时间尺度神经网络自适应与基于通道的MPC,该方法在可验证条件下确保了输入-状态稳定性、递归可行性以及收敛至原点,同时在学习瞬态过程中保持了约束满足。

ABSTRACT

This paper presents a deep learning based model predictive control algorithm for control affine nonlinear discrete time systems with matched and bounded state dependent uncertainties of unknown structure. Since the structure of uncertainties is not known, a deep learning based adaptive mechanism is utilized to mitigate disturbances. In order to avoid any unwanted behavior during the learning phase, a tube based model predictive controller is employed, which ensures satisfaction of constraints and input-to-state stability of the closed-loop states. In addition, the proposed approach guarantees the convergence of states to origin under certain verifiable conditions. To ensure stability and undesirable learning transients, a dual-timescale adaptation mechanism is proposed, where the weights of the last layer of the neural network are updated each time instant while the inner layers are trained on a slower timescale using training data collected online and selectively stored in a buffer on the basis of singular value maximization criterion. Our results are validated through numerical experiments on wing-rock dynamics. These results indicate that the proposed deep-MPC architecture is effective in learning to control safety critical systems without suffering instability drawbacks.

研究动机与目标

  • 解决在安全关键系统中基于深度学习的控制方法于在线学习瞬态期间确保稳定性和约束满足的挑战。
  • 克服纯数据驱动控制器在自适应过程中可能导致的不稳定或约束违反的局限性。
  • 将深度神经网络(DNN)与模型预测控制(MPC)相结合,以利用函数逼近与实时优化能力,同时保持安全性。
  • 开发一种双时间尺度自适应机制,将快速输出层学习与较慢的隐层训练解耦,实现实时可实施性。
  • 通过李雅普诺夫分析与具备扰动抑制能力的基于通道的MPC公式,保证渐近稳定性和递归可行性。

提出的方法

  • 采用隐藏层固定、输出层权重可调的深度神经网络(DNN),以逼近未知且非结构化的系统不确定性。
  • 实施双时间尺度自适应:输出层权重在每个时间步使用离散自适应律进行更新,而隐层权重则通过存储在缓冲区中的在线数据缓慢更新。
  • 采用奇异值最大化准则,选择性地将训练数据存入缓冲区,以提高样本效率与学习质量。
  • 将DNN的扰动估计结果整合进基于通道的MPC框架,以确保闭环系统的递归可行性和输入-状态稳定性(ISS)。
  • 构建一个结合MPC代价函数与DNN权重误差的李雅普诺夫函数,以证明收敛性与稳定性,并为整个系统使用复合李雅普诺夫函数。
  • 通过在名义轨迹周围设置鲁棒通道来强制执行约束,其中通道大小受DNN近似误差与系统不确定性界所限制。

实验结果

研究问题

  • RQ1能否将基于深度学习的控制器与MPC结合,以确保在具有非结构化不确定性的非线性系统中在线学习过程的稳定性与约束满足?
  • RQ2如何将学习过程与实时控制解耦,以避免在安全关键系统中出现不稳定现象并确保可实施性?
  • RQ3在何种条件下可保证闭环状态收敛至原点,同时维持递归可行性与输入-状态稳定性?
  • RQ4如何高效地选择与存储在线训练数据,以提升DNN泛化能力而不损害安全性?
  • RQ5能否设计一种可证明稳定且安全的控制架构,用于具有匹配的、有界的、与状态相关的不确定性系统,通过深度学习与MPC协同实现?

主要发现

  • 所提出的deep-MPC框架在有界且非结构化的不确定性下,确保了闭环系统的输入-状态稳定性(ISS)。
  • 通过考虑DNN扰动估计误差的基于通道的公式,保证了MPC优化的递归可行性。
  • 系统状态渐近收敛至原点,该结论由复合李雅普诺夫函数证明,其显示了状态范数的指数衰减。
  • 双时间尺度自适应机制通过在每个时间步更新输出层权重,同时使用经筛选的在线数据缓冲区缓慢训练隐层权重,实现了实时实施。
  • 在机翼滚转动力学上的数值实验表明,该方法能有效学习复杂的非线性动力学,且未出现不稳定或约束违反现象。
  • 理论分析确认,在时间上对状态范数四次方的总和是有界的,这意味着在所推导的稳定性条件下,系统状态将渐近收敛至原点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。