Skip to main content
QUICK REVIEW

[論文レビュー] Learning Stabilizing Controllers of Linear Systems via Discount Policy Gradient

Feiran Zhao, Xingyun Fu|arXiv (Cornell University)|Dec 17, 2021
Model Reduction and Neural Networks被引用数 4
ひとこと要約

本稿では、未知の線形システムの安定化を図るために、モデルフリーな割引政策勾配法を提案する。この手法は、安定化領域へ向かうように政策を誘導する割引因子を適応的に調整することで、安定性を向上させる。リャプノフ理論とデータ駆動型の更新則を活用することで、精度εにおける収束がO(log(1/ε))の軌道数で達成され、従来の手法と比較して、サンプル数とシミュレーションコストを顕著に削減する。

ABSTRACT

Stability is one of the most fundamental requirements for systems synthesis. In this paper, we address the stabilization problem for unknown linear systems via policy gradient (PG) methods. We leverage a key feature of PG for Linear Quadratic Regulator (LQR), i.e., it drives the policy away from the boundary of the unstabilizing region along the descent direction, provided with an initial policy with finite cost. To this end, we discount the LQR cost with a factor, by adaptively increasing which gradient leads the policy to the stabilizing set while maintaining a finite cost. Based on the Lyapunov theory, we design an update rule for the discount factor which can be directly computed from data, rendering our method purely model-free. Compared to recent work \citep{perdomo2021stabilizing}, our algorithm allows the policy to be updated only once for each discount factor. Moreover, the number of sampled trajectories and simulation time for gradient descent is significantly reduced to $\mathcal{O}(\log(1/ε))$ for the desired accuracy $ε$. Finally, we conduct simulations on both small-scale and large-scale examples to show the efficiency of our discount PG method.

研究の動機と目的

  • 未知の線形システムのモデルフリー強化学習を用いた安定化を目的とする。
  • 政策勾配法における収束に要するサンプル軌道数とシミュレーション時間の低減を目的とする。
  • 最適化中に有限のコストを維持しつつ、政策が安定化領域にとどまるように保証することを目的とする。
  • リャプノフ理論を用いて、データから直接計算可能な、完全にデータ駆動型の割引因子の更新則を開発することを目的とする。
  • 割引因子の値ごとに1ステップの政策更新を可能にすることで、最近の手法を上回ることを目的とする。

提案手法

  • 本手法は、安定化集合へ向かうように政策を誘導する適応的割引因子を備えた割引LQRコスト関数を導入する。
  • システムモデルの知識なしにデータから直接計算可能な、リャプノフに基づく割引因子の更新則を導出する。
  • 割引コストを用いたオンポリシーのロールアウトにより政策勾配を計算し、安定化コントローラーへ向かう降下を保証する。
  • 政策が安定化領域にとどまり、有限のコストを維持する条件に基づき、割引因子を反復的に更新する。
  • 本アルゴリズムは、割引因子の値ごとに1回の政策更新しか行わず、サンプル効率を向上させる。
  • 本手法は完全にモデルフリーであり、勾配推定と割引因子の適応に、すべてが観測された軌道に依存する。

実験結果

リサーチクエスチョン

  • RQ1システム同定を必要とせずに、モデルフリーな政策勾配法が未知の線形システムを安定化できるか?
  • RQ2有限のコストを維持しつつ、安定化領域へ向かうように割引因子を適応的に調整する方法は何か?
  • RQ3所望の精度εを達成するための、提案手法のサンプル複雑度は何か?
  • RQ4提案手法は、perdomo2021stabilizingのような先行研究と比較して、サンプル効率に優れているか?
  • RQ5リャプノフ理論を用いて、データから直接計算可能な割引因子の更新則は可能か?

主な発見

  • 提案手法は、所望の精度εを達成するための収束にO(log(1/ε))のサンプル軌道数を要し、従来手法と比較してサンプル複雑度を顕著に低減する。
  • アルゴリズムは、割引因子の値ごとに1回の政策更新が可能であり、計算効率が向上する。
  • 割引因子の更新則はリャプノフ理論に基づき、データから直接計算可能であり、政策が安定化領域にとどまることを保証する。
  • 最適化の全過程で有限のコストを維持し、学習中の不安定性を回避する。
  • 小規模および大規模システムにおけるシミュレーションにより、提案手法の効率性とロバスト性が確認された。
  • 提案手法は、perdomo2021stabilizingのような最近の研究と比較して、サンプルおよびシミュレーション効率に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。