[論文レビュー] Learning Constrained Adaptive Differentiable Predictive Control Policies With Guarantees
本論文では、自動微分を用いて微分可能な閉ループダイナミクスモデルを通じて直接のポリシー勾配を計算することで、線形システムの制約付きニューラル制御ポリシーを学習する、微分可能予測制御(DPC)を提案する。この手法により、教師なしのオフライン学習が可能となり、安定で制約を満たすポリシーが確率的性能保証とともに得られ、インプリシット・エクスプロイシット・近似MPCに比べ、スケーラビリティ、サンプル効率、計算速度の面で優れている。また、専門家のデモンストレーションを一切必要としない。
We present differentiable predictive control (DPC), a method for learning constrained neural control policies for linear systems with probabilistic performance guarantees. We employ automatic differentiation to obtain direct policy gradients by backpropagating the model predictive control (MPC) loss function and constraints penalties through a differentiable closed-loop system dynamics model. We demonstrate that the proposed method can learn parametric constrained control policies to stabilize systems with unstable dynamics, track time-varying references, and satisfy nonlinear state and input constraints. In contrast with imitation learning-based approaches, our method does not depend on a supervisory controller. Most importantly, we demonstrate that, without losing performance, our method is scalable and computationally more efficient than implicit, explicit, and approximate MPC. Under review at IEEE Transactions on Automatic Control.
研究の動機と目的
- 教師のデモンストレーションやオンライン最適化を必要とせず、スケーラブルで微分可能な明示的かつ制約付き制御ポリシーを学習するための手法を開発すること。
- 学習されたニューラル制御ポリシーの閉ループ安定性および制約満たしに関する確率的保証を提供すること。
- 従来のMPCの計算制限と、モデルフリー強化学習のデータ非効率性を、制約付き制御設定において克服すること。
- 自動微分を用いて、システムダイナミクスと制御ポリシーの両方をエンドツーエンドで学習できること。
- インプリシット・エクスプロイシット・近似MPC手法と比較して、サンプル効率・訓練速度・実行時間の面で優れた性能を示すこと。
提案手法
- 自動微分(AD)を用いて、モデル予測制御(MPC)問題を微分可能な計算グラフとして定式化し、MPC損失および制約ペナルティを逆伝播可能にする。
- 予測ホライズンにわたるシステムロールアウトから得られる直接のポリシー勾配を用いて、確率的勾配降下法によりオフラインでニューラル制御ポリシーを訓練する。
- 閉ループシステムダイナミクスを微分可能なニューラルネットワークとしてモデル化し、制御ポリシーおよびシステムモデルをエンドツーエンドで逆伝播可能にする。
- サンプルされたシステムロールアウトに基づき、Hoeffdingの不等式を用いて安定性および制約満たしに関する確率的保証を導出する。
- 線形システムにニューラルネットワークポリシーを適用した場合、収縮条件およびBanachの不動点定理を用いて安定性を保証する。
- オンライン最適化を回避するため、明示的かつ閉形式の制御ポリシーを学習することで、高速な推論とメモリ使用量の削減を実現する。
実験結果
リサーチクエスチョン
- RQ1微分可能プログラミングを用いて、監視制御器を必要とせず、線形システムの明示的かつ制約付き制御ポリシーを学習可能か?
- RQ2提案手法が、プラント・モデル一致に依存せずに、閉ループ安定性および制約満たしに関する確率的保証を提供可能か?
- RQ3DPCのサンプル効率および訓練速度は、モデルフリー強化学習および模倣学習に基づく近似MPCと比較してどうか?
- RQ4多パラメータプログラミングに基づくエクスプロイシットMPCと比較して、DPCはより効率的にスケーリング可能か?
- RQ5インプリシットMPCと比較して、DPCは計算およびメモリのオーバーヘッドを削減しながらも性能を維持できるか?
主な発見
- DPCは、限られたデータでもLQRやMPCと同等の性能を示す、不安定な線形システムの安定化ニューラル制御ポリシーを学習した。
- DPCは、モデルフリー深層強化学習よりも高いサンプル効率を達成し、最適性能に収束するための訓練サンプル数を削減した。
- DPCは、模倣学習に基づく近似MPCよりも訓練時間が短く、ポリシー品質を維持または向上させた。
- DPCは、リアルタイム最適化ソルバに依存するインプリシットMPCよりも高速な実行速度を示した。
- DPCは、エクスプロイシットMPCよりも顕著に少ないメモリを要し、より大きなシステムへのスケーラビリティを実現した。
- 制約満たしおよび安定性に関する確率的保証は、経験的リスク評価により検証され、DPCは5,000件の訓練サンプルで平均97.9%の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。