Skip to main content
QUICK REVIEW

[論文レビュー] Neural Lyapunov Model Predictive Control

Mayank Mittal, Marco Gallieri|arXiv (Cornell University)|May 4, 2021
Advanced Control Systems Optimization被引用数 9
ひとこと要約

本論文は、専門家のデモから深層ニューラルネットワークのリャプノフ関数としての端末コストを学習するデータ駆動型ニューラルリャプノフモデル予測制御(MPC)フレームワークを提案する。MPCパラメータとリャプノフに基づく端末コストを繰り返し精緻化することで、初期デモのものと同等以上に大きな吸引域を保証し、モデル不確実性下でも理論的安定性を確保するとともに、ソフト制約を伴う非線形連続制御タスクで性能が向上する。

ABSTRACT

With a growing interest in data-driven control techniques, Model Predictive Control (MPC) provides a significant opportunity to exploit the surplus of data reliably, particularly while taking safety and stability into account. In this paper, we aim to infer the terminal cost of an MPC controller from transitions generated by an initial \emph{unknown} demonstrator. We propose an algorithm to alternatively learn the terminal cost and update the MPC parameters according to a stability metric. We design the terminal cost as a Lyapunov function neural network and theoretically show that, under limited approximation error, our proposed approach guarantees that the size of the stability region (region of attraction) is greater than or equal to the one from the initial demonstrator. We also present theorems that characterize the stability and performance of the learned MPC in the presence of model uncertainties and sub-optimality due to function approximation. Empirically, we demonstrate the efficacy of the proposed algorithm on non-linear continuous control tasks with soft constraints. Our results show that the proposed approach can improve upon the initial demonstrator also in practice and achieve better task performance than other learning-based baselines.

研究の動機と目的

  • システムの動力学の事前知識がなくても、専門家のデモから安定化端末コストを学習するデータ駆動型MPCフレームワークの開発。
  • リャプノフ関数としての端末コストを構築することで、理論的安定性保証の実現。
  • モデル不確実性や近似誤差が存在する中でも、初期デモを上回る吸引域と制御性能の向上。
  • 制約違反や摂動が生じる状況でも、デモデータのみを用いて安全で安定した制御を実現。
  • 安定性指標を用いて、端末コストとMPCパラメータを交互に最適化する学習アルゴリズムの提供。

提案手法

  • MPCにおける端末コストを、安定性を保証するリャプノフ関数として機能する深層ニューラルネットワークとしてパラメータ化する。
  • リャプノフ理論に由来する安定性指標を用いて、ニューラルネットワークの端末コストとMPCパラメータを交互に最適化するアルゴリズムを採用する。
  • 理論的分析により、近似誤差が有界である限り、学習済みMPCが初期デモのものと同等以上に大きな吸引域を保証することが示された。
  • 関数近似による非最適性とモデル不確実性の下でも、安定性と性能の保証を統合する。
  • 未知のデモから得られる遷移データを用いて学習することで、安定で高性能なMPC制御器のエンドツーエンド学習を可能にする。
  • 摂動や制約違反が生じる状況でも妥当な解が得られるように、ソフト制約をMPC定式化に統合する。

実験結果

リサーチクエスチョン

  • RQ1専門家のデモからニューラルネットワークベースの端末コスト関数を学習することで、システムの事前知識なしにMPCにおける安定性を確保できるか?
  • RQ2提案された学習アルゴリズムは、初期デモのものと同等以上に大きな吸引域を保証するか?
  • RQ3リャプノフ関数における近似誤差やモデル不確実性が存在する状況でも、本手法はどのように性能を示すか?
  • RQ4非線形制御タスクにおいて、学習済みMPC制御器は初期デモおよび他の学習ベースのベースラインを上回る性能を発揮するか?
  • RQ5ニューラルネットワークとしてのリャプノフ関数を端末コストに用いることで、MPCの安定性と性能にどのような影響を与えるか?

主な発見

  • 提案手法は、近似誤差が有界である限り、学習済みMPCの吸引域が初期デモのものと同等以上であることを保証する。
  • 理論的分析により、モデル不確実性や関数近似による非最適性が存在する中でも、学習済みMPCの安定性と性能の境界が確認された。
  • 実験的結果から、ソフト制約を伴う非線形連続制御タスクにおいて、初期デモを上回るタスク性能が得られた。
  • シミュレーションにおいて、他の学習ベースのMPCベースラインと比較して、安定性と制御性能の両面で優れた性能を示した。
  • ニューラルネットワークのリャプノフ関数は、デモデータからシステムの安定性特性を効果的に捉えており、安全で信頼性の高い制御を可能にした。
  • 交互最適化プロセスは、安定性と性能のバランスをうまくとることができ、実際の応用において収束性とロバストネスの向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。