Skip to main content
QUICK REVIEW

[论文解读] Model predictive control design for dynamical systems learned by Long Short-Term Memory Networks

Enrico Terzi, Bonassi, Fabio|arXiv (Cornell University)|Oct 9, 2019
Advanced Control Systems Optimization参考文献 47被引用 7
一句话总结

本文提出一种基于学习的模型预测控制(MPC)框架,采用长短期记忆(LSTM)网络作为系统模型,建立了LSTM的输入-状态稳定性(ISS)和增量ISS(δ-ISS)条件。该框架集成了具有保证收敛性的状态观测器,并设计了一种带有终端代价但无终端约束的稳定MPC,证明了渐近稳定性,并在pH反应器仿真器上验证了其有效性。

ABSTRACT

This paper analyzes the stability-related properties of Long Short-Term Memory (LSTM) networks and investigates their use as the model of the plant in the design of Model Predictive Controllers (MPC). First, sufficient conditions guaranteeing the Input-to-State stability (ISS) and Incremental Input-to-State stability (dISS) of LSTM are derived. These properties are then exploited to design an observer with guaranteed convergence of the state estimate to the true one. Such observer is then embedded in a MPC scheme solving the tracking problem. The resulting closed-loop scheme is proved to be asymptotically stable. The training algorithm and control scheme are tested numerically on the simulator of a pH reactor, and the reported results confirm the effectiveness of the proposed approach.

研究动机与目标

  • 建立长短期记忆(LSTM)网络在控制应用中理论稳定性条件——输入-状态稳定性(ISS)和增量ISS(δ-ISS)。
  • 设计一种基于LSTM模型的状态观测器,确保状态估计值渐近收敛至真实状态,利用δ-ISS特性。
  • 基于训练好的LSTM模型与观测器,设计一种模型预测控制(MPC)方案,以在输入约束下求解跟踪问题。
  • 仅通过终端代价和权重函数的合理调参,确保MPC方案的闭环渐近稳定性,而无需引入终端约束。
  • 利用概率性场景方法估计模型-被控对象失配,以支持在模型不确定性存在下的鲁棒性。

提出的方法

  • 推导出LSTM权重的充分条件,以保证ISS与δ-ISS,明确依赖于网络参数,且可在训练过程中实现。
  • 基于δ-ISS设计状态观测器,确保在所推导的稳定性条件下,估计误差渐近收敛至零。
  • 利用LSTM模型与观测器构建MPC控制器,以求解带输入约束的输出跟踪问题。
  • 在MPC代价函数中引入终端代价,并调参状态与控制权重函数,以确保平衡点的渐近稳定性。
  • 应用场景方法估计模型-被控对象失配的上界,从而在不确定性存在时实现鲁棒性。
  • 采用递归误差传播分析,以界定预测轨迹与实际系统轨迹之间的差异,确保MPC代价函数的收敛性。

实验结果

研究问题

  • RQ1在何种LSTM网络参数条件下,网络可实现输入-状态稳定(ISS)?
  • RQ2是否可为LSTM保证增量输入-状态稳定(δ-ISS),以及如何在训练过程中实现?
  • RQ3能否为LSTM模型设计一种状态观测器,使得估计误差渐近收敛至零?
  • RQ4所提出的结合观测器与终端代价的MPC方案是否可在不依赖终端约束的情况下实现渐近稳定性?
  • RQ5如何以概率方式界定模型-被控对象失配,以支持鲁棒MPC设计?

主要发现

  • 本文推导出LSTM权重的显式条件,可保证输入-状态稳定(ISS)与增量ISS(δ-ISS),且可在训练过程中实现。
  • 基于δ-ISS设计了状态观测器,确保估计误差渐近收敛至零,且收敛速率取决于观测器调参。
  • 带有终端代价的MPC控制器可在不引入终端约束的情况下,实现平衡点的渐近稳定性,简化了调参过程。
  • 在所提出的MPC与观测器设计下,闭环系统被证明具有渐近稳定性,且代价函数随时间递减。
  • 场景方法提供了模型-被控对象失配的上界概率估计,支持控制设计中的鲁棒性。
  • 在pH反应器仿真器上的数值结果验证了训练后LSTM的建模精度,以及整体控制方案在跟踪参考信号方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。