Skip to main content
QUICK REVIEW

[論文レビュー] Near-Optimal Rapid MPC using Neural Networks: A Primal-Dual Policy Learning Framework

Xiaojing Zhang, Monimoy Bujarbaruah|arXiv (Cornell University)|Dec 9, 2019
Advanced Control Systems Optimization参考文献 64被引用数 7
ひとこと要約

本稿では、線形パrameter変動系の明示的Model Predictive Control (MPC)則を、深層ニューラルネットワークを用いて近似する、原状・双対ポリシー学習フレームワークを提案する。この手法により、高い確率で実行可能性と近似的最適性を保証する。原状制御ポリシーと双対最適性証明を同時に学習することで、推論時にリアルタイムでサブオプティマル性を検証可能となり、デスクトップ上で最大62倍、自動車用ECUでは10倍の高速化を達成した。実験では、バックアップコントローラーのアクティベートがゼロで、近似的最適性能を維持した。

ABSTRACT

In this paper, we propose a novel framework for approximating the explicit MPC policy for linear parameter-varying systems using supervised learning. Our learning scheme guarantees feasibility and near-optimality of the approximated MPC policy with high probability. Furthermore, in contrast to most existing approaches that only learn the MPC policy, we also learn the "dual policy", which enables us to keep a check on the approximated MPC's optimality online during the control process. If the check deems the control input from the approximated MPC policy safe and near-optimal, then it is applied to the plant, otherwise a backup controller is invoked, thus filtering out (severely) suboptimal control inputs. The backup controller is only invoked with a bounded (low) probability, where the exact probability level can be chosen by the user. Since our framework does not require solving any optimization problem during the control process, it enables the deployment of MPC on resource-constrained systems. Specifically, we illustrate the utility of the proposed framework on a vehicle dynamics control problem. Compared to online optimization methods, we demonstrate a speedup of up to 62x on a desktop computer and 10x on an automotive-grade electronic control unit, while maintaining a high control performance.

研究の動機と目的

  • リソース制約のある組み込みシステム、特に自動車用ECUに計算コストの高いMPCを導入する課題に対処すること。
  • 既存の関数近似手法の限界を克服し、高い確率で実行可能性と近似的最適性を保証する学習ベースのMPC近似を構築すること。
  • 原状ポリシーのサブオプティマル性をリアルタイムでオンラインで検証できる双対ポリシーを導入し、導入時の安全性を保証すること。
  • オンライン最適化を排除することで実行時の計算オーバーヘッドを低減し、低消費電力ハードウェアでもリアルタイム制御を可能にすること。
  • 高速かつ高精度を要する実世界の車両動力学制御応用において、フレームワークの有効性を実証すること。

提案手法

  • フレームワークは、明示的MPCからの状態-制御ペアのトレーニングデータに基づき、原状・双対ポリシー学習を確率的最適化問題として定式化する。
  • 統計的学習理論とシナリオ最適化を活用し、高い確率で学習されたポリシーの実行可能性と近似的最適性を保証するためのサンプルサイズの境界を導出する。
  • 双対ポリシーはMPC最適化問題の双対変数から導出され、原状ポリシー出力のサブオプティマル性のリアルタイム証明として機能する。
  • 双対ポリシーは計算が軽量であり、オンライン検証が可能である:サブオプティマル性がユーザーが定めたしきい値を上回れば、バックアップコントローラーが起動する。
  • 原状ポリシーは、オフラインのMPC解に基づく教師あり学習により訓練された深層ニューラルネットワーク(DNN)または基底関数の線形結合として実装される。
  • この手法により、バックアップコントローラーのアクティベート確率が有界であり、ユーザーが調整可能であることが保証され、速度を犠牲にすることなく安全な運用が可能になる。

実験結果

リサーチクエスチョン

  • RQ1明示的MPCのニューラルネットワークベースの近似は、高い確率で実行可能かつ近似的最適であると保証できるか?
  • RQ2最適化問題を解かずに、原状ポリシーのサブオプティマル性をリアルタイムでオンラインで検証できる双対ポリシーを学習できるか?
  • RQ3提案されたフレームワークは、組み込みシステムで顕著な高速化を達成できるか、かつ高い制御性能を維持できるか?
  • RQ4実際の運用において、双対ポリシーの検証機能はバックアップコントローラーへの依存度をどの程度低減できるか?
  • RQ5リアルタイムMPCのデプロイにおいて、近似精度、計算効率、メモリ使用量のトレードオフはどのように変化するか?

主な発見

  • 提案されたフレームワークは、デスクトップコンピュータでCVXGENソルバーより最大62倍、自動車用ECUでは10倍の高速化を達成した。
  • ECU上でのDNN-ReLUコントローラーの平均計算時間は1.8 msであり、100 Hzでのリアルタイム動作が可能だった。一方、CVXGENは18.7 msを要した。
  • DNN-ReLUコントローラーは平均相対原状サブオプティマル性がわずか1.1%にとどまり、実際の近似的最適性が確認された。
  • バークレー自動走行車での12秒間の全走行実験において、バックアップコントローラーは一度もアクティベートされなかった。これは、高い信頼性と安全性を示している。
  • DNN-ReLUモデルのメモリ使用量は114 KBにまで低減され、CVXGENの322 KBよりも顕著に小さく、組み込みデプロイに適した。
  • 理論的分析により、バックアップコントローラーのアクティベート確率が有界であり、ユーザーが調整可能であることが示された。これにより、高い信頼性で安全性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。