Skip to main content
QUICK REVIEW

[論文レビュー] Deep Model Predictive Control with Stability Guarantees

Prabhat K. Mishra, Mateus V. Gasparino|arXiv (Cornell University)|Apr 15, 2021
Advanced Control Systems Optimization参考文献 46被引用数 4
ひとこと要約

本稿では、非線形で制御アフィンな離散時間システム、かつ未構造的で有界な不確実性を有する場合に、深層学習を活用したモデル予測制御(deep-MPC)フレームワークを提案する。二重時間スケールのニューラルネットワーク適応とチューブベースのMPCを統合することで、検証可能な条件下で入力-状態安定性(ISS)、再帰的実行可能性、および原点への収束を保証するとともに、学習の遷移期にも制約を満たす。

ABSTRACT

This paper presents a deep learning based model predictive control algorithm for control affine nonlinear discrete time systems with matched and bounded state dependent uncertainties of unknown structure. Since the structure of uncertainties is not known, a deep learning based adaptive mechanism is utilized to mitigate disturbances. In order to avoid any unwanted behavior during the learning phase, a tube based model predictive controller is employed, which ensures satisfaction of constraints and input-to-state stability of the closed-loop states. In addition, the proposed approach guarantees the convergence of states to origin under certain verifiable conditions. To ensure stability and undesirable learning transients, a dual-timescale adaptation mechanism is proposed, where the weights of the last layer of the neural network are updated each time instant while the inner layers are trained on a slower timescale using training data collected online and selectively stored in a buffer on the basis of singular value maximization criterion. Our results are validated through numerical experiments on wing-rock dynamics. These results indicate that the proposed deep-MPC architecture is effective in learning to control safety critical systems without suffering instability drawbacks.

研究の動機と目的

  • 安全性が求められるシステムにおける、深層学習ベース制御の学習遷移期における安定性と制約満たしの課題に対処する。
  • 適応過程で不安定化や制約違反を引き起こす可能性がある純粋なデータ駆動型制御器の限界を克服する。
  • 関数近似とリアルタイム最適化の利点を活かしつつ安全性を維持するため、深層ニューラルネットワーク(DNN)とモデル予測制御(MPC)を統合する。
  • 高速出力層学習と遅い隠れ層学習を分離する二重時間スケールの適応機構を開発し、リアルタイム実装可能性を実現する。
  • リャプノフ解析と不確実性の抑圧能力を有するチューブベースのMPC定式化を用いて、漸近的安定性と再帰的実行可能性を保証する。

提案手法

  • 未知の未構造的システム不確実性を近似するために、固定された隠れ層と適応可能な出力層重みを持つ深層ニューラルネットワーク(DNN)を採用する。
  • 二重時間スケールの適応を実装:出力層重みは各時刻で離散的適応則に従って更新され、隠れ層重みはバッファに保存されたオンラインデータを用いてゆっくりと更新される。
  • 訓練データをバッファに格納するための特異値最大化基準を用い、サンプル効率と学習品質を向上させる。
  • DNNの不確実性推定値をチューブベースのMPCフレームワークに統合し、再帰的実行可能性と閉ループ系の入力-状態安定性(ISS)を保証する。
  • MPCコストとDNN重み誤差を組み合わせたリャプノフ関数を定式化し、収束性と安定性を証明する。全系のための合成リャプノフ関数を用いる。
  • 制約を、名目軌道のまわりのロバストなチューブによって強制し、チューブの大きさをDNNの近似誤差とシステム不確実性の境界で有界化する。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの制御器をMPCと統合することで、未構造的不確実性を有する非線形システムにおけるオンライン学習期に安定性と制約満たしを保証できるか?
  • RQ2学習プロセスをリアルタイム制御から分離することで、不安定化を回避し、安全性が求められるシステムにおける実装可能性を確保できるか?
  • RQ3閉ループ状態が原点に漸近的に収束するための条件は何か? また、再帰的実行可能性と入力-状態安定性(ISS)を維持できるか?
  • RQ4オンライン学習データを効率的に選別・格納することで、DNNの一般化性能を向上させつつ安全性を損なわないか?
  • RQ5一致する有界な状態依存不確実性を有するシステムに対して、深層学習とMPCを併用することで、証明可能な安定性と安全性を有する制御アーキテクチャを設計できるか?

主な発見

  • 提案されたdeep-MPCフレームワークは、有界で未構造的な不確実性下でも、閉ループ系の入力-状態安定性(ISS)を保証する。
  • DNNの不確実性推定誤差を考慮したチューブベースの定式化により、MPC最適化の再帰的実行可能性が保証される。
  • 合成リャプノフ関数により、状態ノルムの指数的減衰を示し、システム状態が原点に漸近的に収束することが証明された。
  • 二重時間スケールの適応機構により、出力層重みを各時刻で更新しながら、オンラインデータの選別済みバッファを用いて隠れ層重みをゆっくりと学習することで、リアルタイム実装が可能になった。
  • ウイングロックダイナミクスに対する数値実験により、不安定化や制約違反を伴わず、複雑な非線形ダイナミクスの学習が有効に行われた。
  • 理論的解析により、時間にわたる状態ノルムの4乗和が有界であることが確認され、導出された安定性条件のもとで原点への漸近的収束が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。