Skip to main content
QUICK REVIEW

[論文レビュー] Safe and Near-Optimal Policy Learning for Model Predictive Control using Primal-Dual Neural Networks

Xiaojing Zhang, Monimoy Bujarbaruah|arXiv (Cornell University)|Jun 19, 2019
Advanced Control Systems Optimization参考文献 33被引用数 6
ひとこと要約

本論文は、線形パrameter変動系における安全で近似的最適なモデル予測制御(MPC)則を学習するためのプライマル・デュアルニューラルネットワークフレームワークを提案する。プライマル制御則とサブオプティマルティー証明のためのデュアル則を同時に学習することにより、確率的検証を用いたオンラインの実行可能性および最適性保証のもとで、リアルタイムかつ計算効率の高い制御が可能となり、最良のソルバーと比較して最大100倍の高速化を達成しながら、性能損失を最小限に抑える。

ABSTRACT

In this paper, we propose a novel framework for approximating the explicit MPC law for linear parameter-varying systems using supervised learning. In contrast to most existing approaches, we not only learn the control policy, but also a "certificate policy", that allows us to estimate the sub-optimality of the learned control policy online, during execution-time. We learn both these policies from data using supervised learning techniques, and also provide a randomized method that allows us to guarantee the quality of each learned policy, measured in terms of feasibility and optimality. This in turn allows us to bound the probability of the learned control policy of being infeasible or suboptimal, where the check is performed by the certificate policy. Since our algorithm does not require the solution of an optimization problem during run-time, it can be deployed even on resource-constrained systems. We illustrate the efficacy of the proposed framework on a vehicle dynamics control problem where we demonstrate a speedup of up to two orders of magnitude compared to online optimization with minimal performance degradation.

研究の動機と目的

  • リソース制約のあるシステムへのMPCの導入を課題とする。オンライン最適化を高速で学習されたポリシーに置き換えることで実現する。
  • 学習された制御ポリシーの安全性と性能を、高価なオンライン最適化やトレーニング中の制限的制約強制に依存せずに保証する。
  • 実行時における実行不能性またはサブオプティマルティーの確率的確率を制限するための確率的検証フレームワークを提供する。
  • 明示的MPCの近似を、最適性保証付きの関数近似を用いて線形パrameter変動(LPV)系へ拡張する。
  • 高価な最適化を実行時処理から分離することで、組み込みプラットフォームへのMPCのデプロイを可能にする。

提案手法

  • オフラインで生成されたデータを用いた教師あり学習により、プリミティブなニューラルネットワークポリシーを訓練し、明示的MPC制御則を近似する。
  • デュアルニューラルネットワークポリシーを訓練し、双対ギャップを推定することで、プライマルポリシー出力のサブオプティマルティーバランスと実行可能性のオンライン境界を提供する。
  • 集中不等式から導かれるサンプルサイズの境界を用いた確率的検証を実施し、有限サンプルサイズのもとで両ポリシーの品質を確率的に保証する。
  • 凸最適化からの双対性理論を応用し、デュアルポリシーを最適コストの推定器として定義することで、リアルタイムでのパフォーマンス監視を可能にする。
  • 実行時において訓練済みのプライマル・デュアルネットワークペアをデプロイする:プライマルポリシーが制御入力を出力し、デュアルポリシーがその品質を検証する。検証に失敗した場合、バックアップコントローラーが起動される。
  • ReLUベースの深層ニューラルネットワークを関数近似に用い、任意の微分可能アーキテクチャと互換性を持たせ、複雑なシステムへスケーラブルに拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1学習されたMPC制御ポリシーは、実行時に評価が高速でありながら、同時に保証された安全性と近似的最適性を有することができるか?
  • RQ2デュアルニューラルネットワークを、プライマル制御ポリシーのサブオプティマルティーおよび実行可能性に関するオンラインでデータ駆動の証明を提供できるように訓練できるか?
  • RQ3有限サンプルサイズを用いた確率的検証によって、学習されたMPCポリシーのパフォーマンスを高い確率で保証できるか?
  • RQ4提案されたプライマル・デュアル学習フレームワークは、オンライン最適化と比較して、オーダー・オブ・マグニチュードの高速化を実現しながらも、近似的最適なパフォーマンスを維持できるか?
  • RQ5このフレームワークは、システム行列が時間変動パラメータに依存する線形パラメータ変動系へ拡張可能か?

主な発見

  • Gurobiと比較して平均65倍以上の高速化、Mosekと比較して100倍以上の高速化を達成した(2016年モデルMacBook上)。DNN-ReLUポリシーの平均推論時間は0.023 msであった。
  • 100,000件のテストパラメータにおける中央値の双対ギャップ(サブオプティマルティー指標)は0.00083、最悪ケースの双対ギャップは1.2732であり、強い近似的最適性を示している。
  • 双対ギャップがしきい値γ=1を超える確率的違反確率は0.005%にとどまり、目標のε=1%をはるかに下回っており、理論的サンプルサイズ境界の保守的性質が裏付けられた。
  • デュアルポリシーはリアルタイムでサブ最適または実行不能な制御入力を的確に検出でき、必要に応じてバックアップコントローラーに切り替えられる。
  • DNN推論時間の標準偏差がわずか0.0023 msと非常に安定しており、Gurobi や Mosek よりも性能のばらつきが小さく、優れた一貫性を示した。
  • 本手法は汎用的であり、深層ニューラルネットワークを含む任意の関数近似器に適用可能で、オンライン最適化を必要とせず、組み込みシステムへのMPCの安全なデプロイを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。