Skip to main content
QUICK REVIEW

[論文レビュー] Learning Stochastic Parametric Differentiable Predictive Control Policies

Ján Drgoňa, Sayak Mukherjee|arXiv (Cornell University)|Mar 2, 2022
Advanced Control Systems Optimization被引用数 6
ひとこと要約

本稿では、加法的不確実性および非線形確率制約を有する線形システムにおける確率的モデル予測制御(MPC)のスケーラブルでオフライン学習可能な手法、Stochastic Parametric Differentiable Predictive Control(SP-DPC)を提案する。確率的最適制御問題の決定的近似を定式化し、閉ループロールアウトを通じた自動微分を活用することで、ニューラルネットワークによる効率的で微分可能なポリシー最適化を可能にし、オンライン非線形MPCよりも最大10倍速いオンライン推論を実現しながら、安定性および制約満たしの確率的保証を維持する。

ABSTRACT

The problem of synthesizing stochastic explicit model predictive control policies is known to be quickly intractable even for systems of modest complexity when using classical control-theoretic methods. To address this challenge, we present a scalable alternative called stochastic parametric differentiable predictive control (SP-DPC) for unsupervised learning of neural control policies governing stochastic linear systems subject to nonlinear chance constraints. SP-DPC is formulated as a deterministic approximation to the stochastic parametric constrained optimal control problem. This formulation allows us to directly compute the policy gradients via automatic differentiation of the problem's value function, evaluated over sampled parameters and uncertainties. In particular, the computed expectation of the SP-DPC problem's value function is backpropagated through the closed-loop system rollouts parametrized by a known nominal system dynamics model and neural control policy which allows for direct model-based policy optimization. We provide theoretical probabilistic guarantees for policies learned via the SP-DPC method on closed-loop stability and chance constraints satisfaction. Furthermore, we demonstrate the computational efficiency and scalability of the proposed policy optimization algorithm in three numerical examples, including systems with a large number of states or subject to nonlinear constraints.

研究の動機と目的

  • 中程度の複雑性と不確実性を有するシステムにおいて、古典的な確率的明示MPCの取り扱いが困難である問題に対処すること。
  • 非線形確率制約と加法的システム不確実性を扱える、スケーラブルでオフライン学習ベースの確率的パrametric制御ポリシーの開発。
  • デプロイメント時にオンラインソルバーユーザーに依存せず、微分プログラミングと自動微分を用いた効率的ポリシー最適化の実現。
  • 学習済みポリシーに対する閉ループ安定性および確率制約満たしの理論的確率的保証の提供。
  • 古典的パラメトリックプログラミングおよびオンライン非線形MPCソルバーよりも、計算効率とスケーラビリティの面で優れる性能の実証。

提案手法

  • SP-DPCは、不確実性のシナリオとパラメータ変動のサンプリングを通じて、確率的パラメトリック最適制御問題の決定的近似を定式化する。
  • この手法は、SP-DPC問題の価値関数の期待値を、ニューラル制御ポリシーおよびシステムダイナミクスを介してバックプロパゲートするために自動微分を用いる。
  • 既知のノーマルダイナミクスモデルとニューラルポリシーを用いて閉ループシステムのロールアウトをシミュレートし、微分可能プログラミングによる勾配計算を可能にする。
  • 最適化はアルゴリズム1を用いてオフラインで実行され、1000のパラメトリックシナリオと1シナリオあたり100の不確実性実現をサンプリングし、合計10万のシナリオを対象とする。
  • 4層のReLUニューラルネットワークポリシー(35,140パラメータ)を訓練し、システム状態とリファレンス軌道から制御入力をマッピングする。
  • 目的関数には、状態および入力の偏差、制御効率、制約違反に対する二次ペナルティが含まれ、確率制約はサンプルシナリオを用いて強制される。

実験結果

リサーチクエスチョン

  • RQ1微分可能でオフライン学習可能なフレームワークは、加法的不確実性および非線形制約を有するシステムへの確率的モデル予測制御を、スケーラブルに効果的に拡張できるか?
  • RQ2オンライン推論時間の観点から、学習済みSP-DPCニューラルポリシーの計算効率は、オンライン非線形MPCソルバーよりもどのように異なるか?
  • RQ3SP-DPC手法は、教師データに依存せず、学習済みポリシーに対する閉ループ安定性および確率制約満たしのきめ細やかな確率的保証を提供できるか?
  • RQ4SP-DPCは、不安定なシステムの安定化、確率的リファレンス追従、不確実性下での非線形制約を伴う障害物回避といった複雑な制御タスクをどの程度処理できるか?
  • RQ5サンプリング戦略およびシナリオ数の選択は、SP-DPCポリシー最適化の性能とスケーラビリティにどのような影響を及ぼすか?

主な発見

  • SP-DPCニューラルポリシーの平均オンライン推論時間は2.555 msであり、オンライン非線形MPCソルバーよりも1桁速く、平均28.362 msを上回る。
  • 最悪ケースにおいても、SP-DPCポリシーはオンラインMPCソルバーより5倍速く、最大推論時間は10.144 ms(対象は53.340 ms)であった。
  • アルゴリズム1による学習プロセスは1000エポックで17.47分を要し、大規模なシナリオサンプリングを伴うオフライン最適化の実現可能性を示した。
  • この手法は、不安定なシステムの安定化、確率的リファレンス追従、不確実性下でのパラメトリック障害物回避(非線形制約を伴う)を成功裏に実現した。
  • 理論的に導出された確率的保証がシミュレーションで検証され、制約満たしおよび閉ループ安定性の両方を維持した。
  • 本手法は古典的パラメトリックプログラミングソルバーよりもスケーラブルであり、リアルタイム性能においてオンラインソルバーより優れており、高次元または複雑なシステムに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。