Skip to main content
QUICK REVIEW

[論文レビュー] Primal-dual Learning for the Model-free Risk-constrained Linear Quadratic Regulator

Feiran Zhao, Keyou You|arXiv (Cornell University)|Nov 22, 2020
Advanced Control Systems Optimization参考文献 36被引用数 5
ひとこと要約

本稿では、状態予測分散制約下での安定化アフィンフィードバック制御則(u = -Kx + l)を用いて、システムモデルが未知であるにもかかわらず、リスク制約付き線形二次調節器(LQR)制御のモデルフリーなプリマル・デュアル学習フレームワークを提案する。非凸性にもかかわらず、局所的勾配優位性と強い双対性を活用することで、ゼロ双対ギャップを証明し、既知のシステムモデルがなくても効率的なポリシー最適化が可能となるグローバル収束を達成する。

ABSTRACT

Risk-aware control, though with promise to tackle unexpected events, requires a known exact dynamical model. In this work, we propose a model-free framework to learn a risk-aware controller with a focus on the linear system. We formulate it as a discrete-time infinite-horizon LQR problem with a state predictive variance constraint. To solve it, we parameterize the policy with a feedback gain pair and leverage primal-dual methods to optimize it by solely using data. We first study the optimization landscape of the Lagrangian function and establish the strong duality in spite of its non-convex nature. Alongside, we find that the Lagrangian function enjoys an important local gradient dominance property, which is then exploited to develop a convergent random search algorithm to learn the dual function. Furthermore, we propose a primal-dual algorithm with global convergence to learn the optimal policy-multiplier pair. Finally, we validate our results via simulations.

研究の動機と目的

  • 未知のダイナミクスを有する線形システムにおけるリスク感受性制御のためのモデルフリー強化学習フレームワークの開発。
  • 既知のシステムモデルを必要としない状態分散リスク制約下での制約付き最適制御の課題に対処すること。
  • 非凸なリスク制約付きLQR設定におけるポリシー最適化の理論的保証の確立。
  • アフィンフィードバック制御則の非凸かつ制約付き最適化の枠組みにおいて、強い双対性とゼロ双対ギャップを証明すること。
  • 最適ポリシー・乗数ペアを学習するためのグローバル収束を有するプリマル・デュアルアルゴリズムの設計。

提案手法

  • リスク制約付きLQRを、1ステップ先の状態予測分散制約を含む無限時間ホライズン制約付き最適化問題として定式化する。
  • 最適ポリシーをアフィンフィードバックとして表現:u∗(x) = −Kx + l とし、ゲインペア (K, l) を同時に最適化する。
  • リスク制約にマルチプライヤーを導入したラグランジュ関数を定義し、安定化ポリシー集合上でのラグランジュ関数の局所的勾配優位性およびリプシッツ連続性を証明する。
  • スレイターの条件を満たす限り、非凸な目的関数・制約・ポリシー集合に対しても、強い双対性とゼロ双対ギャップが成立することを確立する。
  • ポリシー学習にはゼロオーダー最適化、乗数更新には投影勾配降下法を組み合わせたプリマル・デュアルアルゴリズムを提案する。
  • 有界な勾配推定値を用いたランダムサーチと、射影に基づく更新を用いることで、グローバル収束を保証する。

実験結果

リサーチクエスチョン

  • RQ1アフィンフィードバック制御則を用いる非凸かつリスク制約付きLQR問題において、強い双対性が成立するか?
  • RQ2安定化アフィンポリシー集合上でのラグランジュ関数が勾配優位性およびリプシッツ連続性を示すか?
  • RQ3モデルフリーかつリスク制約付きLQR設定において、プリマル・デュアルアルゴリズムがグローバル収束を達成できるか?
  • RQ4ダイナミクスモデルが未知であり最適化が非凸である状況でも、ゼロ双対ギャップが達成可能か?
  • RQ5システムモデルの知識が欠如する状況で、理論的収束保証のもとでポリシーと乗数を同時に最適化する方法は何か?

主な発見

  • 安定化アフィンポリシー集合上でのラグランジュ関数は、局所的勾配優位性およびリプシッツ連続性を示し、収束保証を可能にする。
  • スレイターの条件を満たす限り、非凸性にもかかわらず強い双対性が成立し、ゼロ双対ギャップが達成される。
  • 提案されたプリマル・デュアルアルゴリズムは、システムの軌道データのみを用いて、最適ポリシー・乗数ペアへのグローバル収束を達成する。
  • 有界なノイズ下では、ランダムサーチ法における勾配推定値が一様に有界であり、収束安定性を保証する。
  • 射影に基づく勾配降下法による乗数更新は、減少するステップサイズを用いることで収束し、サブ線形収束レートを達成する。
  • 本手法は、システムのダイナミクスAとBの事前知識がなくても、リスク感受性制御則を効果的に学習できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。