Skip to main content
QUICK REVIEW

[論文レビュー] Robust Policy Iteration for Continuous-time Linear Quadratic Regulation

Bo Pang, Tao Bian|arXiv (Cornell University)|May 19, 2020
Adaptive Dynamic Programming Control参考文献 28被引用数 4
ひとこと要約

本稿は、小さな有界な摂動下でも連続時間線形二次調節(LQR)のKleinmanの政策反復法のロバスト性を確立する。政策反復を離散時間非線形システムとしてモデル化することで、局所的入力-状態安定性(ISS)を証明し、摂動が小さい場合に解が最適解の小さな近傍に保たれ、収束することを保証する。この結果により、モデル不確実性下でのオフポリシーのデータ駆動LQRアルゴリズムに対するロバスト性保証が可能になる。

ABSTRACT

This paper studies the robustness of policy iteration in the context of continuous-time infinite-horizon linear quadratic regulation (LQR) problem. It is shown that Kleinman's policy iteration algorithm is inherently robust to small disturbances and enjoys local input-to-state stability in the sense of Sontag. More precisely, whenever the disturbance-induced input term in each iteration is bounded and small, the solutions of the policy iteration algorithm are also bounded and enter a small neighborhood of the optimal solution of the LQR problem. Based on this result, an off-policy data-driven policy iteration algorithm for the LQR problem is shown to be robust when the system dynamics are subjected to small additive unknown bounded disturbances. The theoretical results are validated by a numerical example.

研究の動機と目的

  • 連続時間LQRのKleinmanの政策反復アルゴリズムが小さな摂動下でロバストであるかを分析すること。
  • 摂動が有界かつ小さい場合に、政策反復プロセスの局所的入力-状態安定性(ISS)を確立すること。
  • 初期の安定化制御ゲインと小さな誤差が存在する場合でも、アルゴリズムが最適解の小さな近傍に収束することを示すこと。
  • 導出された安定性結果を応用して、オフポリシーのデータ駆動政策反復のロバスト性を検証すること。

提案手法

  • 摂動を入力とする離散時間非線形システムとして政策反復プロセスをモデル化すること。
  • リャプノフ解析を用いて、誤差なしの場合の最適解の局所的指数的安定性を証明すること。
  • 入力-状態安定性(ISS)理論を適用し、有界かつ小さな摂動が最適解からの有界かつ小さなずれをもたらすことを示すこと。
  • グロワンデルの不等式と行列ノルム解析を用いて、正確な反復と摂動付き反復との差を評価すること。
  • リカッチ作用素の収縮性と、政策更新ステップにおける線形作用素の可逆性を活用すること。
  • 有界な摂動下での収束を示す数値例を用いて理論的考察を検証すること。

実験結果

リサーチクエスチョン

  • RQ1連続時間LQRのKleinmanの政策反復アルゴリズムは、システムダイナミクスまたは政策評価における小さな有界な摂動に対してロバストか?
  • RQ2摂動が存在する場合でも、政策反復プロセスは有界であり、最適解の小さな近傍に収束するか?
  • RQ3モデルベースの政策反復の理論的ロバスト性を、オフポリシーのデータ駆動政策反復アルゴリズムに拡張可能か?
  • RQ4摂動が存在する状況下で、政策反復アルゴリズムが局所的入力-状態安定性を維持する条件は何か?
  • RQ5システムダイナミクスや関数近似の誤差は、連続時間LQRにおける政策反復の収束行動にどのように影響するか?

主な発見

  • 連続時間LQR問題の最適解は、誤差なしの政策反復プロセスの局所的指数的安定な平衡点である。
  • 摂動が小さく有界である場合、政策反復アルゴリズムは局所的入力-状態安定性(ISS)を示し、最適解からの有界かつ小さなずれを保証する。
  • 任意の初期安定化制御ゲインに対して、摂動が十分に小さい限り、アルゴリズムは最適解の小さな近傍に収束する。
  • 文献[11]のオフポリシーのデータ駆動政策反復アルゴリズムは、システムダイナミクスにおける小さな加法的かつ有界な摂動下でもロバストであることが証明された。
  • グロワンデルの不等式と行列ノルム解析を用いて、正確な反復と摂動付き反復との間の誤差の理論的境界が導出された。
  • 数値的検証により、有界な摂動下でもアルゴリズムが安定し、最適解の小さな近傍に収束することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。