Skip to main content
QUICK REVIEW

[論文レビュー] Stabilizing Dynamical Systems via Policy Gradient Methods

Juan C. Perdomo, Jack Umenberger|arXiv (Cornell University)|Oct 13, 2021
Reinforcement Learning in Robotics参考文献 41被引用数 13
ひとこと要約

本稿では、無知な線形および滑らかな非線形力学系を安定化するため、無モデルのポリシー勾配法である割引アニーリングを提案する。この手法は、無限時間ホライズンLQR問題における割引率を段階的に増加させることで、安定化を達成する。理論的に、多項式的サンプル複雑性のもとで安定化コントローラーを回復可能であり、事前にある安定化ポリシーを必要とせず、線形および局所線形化された非線形系においてほぼ最適な性能を達成する。

ABSTRACT

Stabilizing an unknown control system is one of the most fundamental problems in control systems engineering. In this paper, we provide a simple, model-free algorithm for stabilizing fully observed dynamical systems. While model-free methods have become increasingly popular in practice due to their simplicity and flexibility, stabilization via direct policy search has received surprisingly little attention. Our algorithm proceeds by solving a series of discounted LQR problems, where the discount factor is gradually increased. We prove that this method efficiently recovers a stabilizing controller for linear systems, and for smooth, nonlinear systems within a neighborhood of their equilibria. Our approach overcomes a significant limitation of prior work, namely the need for a pre-given stabilizing control policy. We empirically evaluate the effectiveness of our approach on common control benchmarks.

研究の動機と目的

  • 事前にある安定化コントローラーを必要としない、未知の力学系を安定化するという根本的な課題に取り組む。
  • 線形および滑らかな非線形系の両方を、ポリシー勾配最適化を用いて無モデルかつサンプル効率的に安定化する方法を開発する。
  • 先行研究の制限を克服する。先行研究では、初期安定化コントローラーまたは安定な力学系へのアクセスを仮定している。
  • シミュレータへのアクセスのみを用いて、非線形系の平衡点の近傍における安定化に対する理論的保証を提供する。
  • 標準的な制御ベンチマーク上で実験的にこの手法を検証し、H∞合成のような確立されたロバスト制御手法と同等の性能を示す。

提案手法

  • 本手法は、割引率γを段階的に増加させる一連の割引付き無限時間ホライズンLQR問題を用いる。γは小さい値から始め、1に近づけていく。
  • 各ステップで、シミュレータからの有限時間ホライズンのロールアウトを用いて勾配とコストを推定し、割引付きLQRコストを最小化するためのポリシー勾配最適化を適用する。
  • アルゴリズムは、γを段階的に増加させるという形で「アニーリング」を行う。これにより、ポリシーは未割引LQR問題の安定化コントローラーに収束する。
  • 非線形系の場合、動的システムを平衡点まわりで線形化し、ヤコビ行列に対して同じ手順を適用することで、局所的指数的安定化を保証する。
  • 本手法は、不正確な勾配およびコスト評価を用いた標準的なポリシー勾配更新に依存しており、これらはシミュレータからの軌道サンプリングによって実装される。
  • 理論的分析により、必要な勾配およびコスト評価の回数が、問題パラメータおよび逆耐性εの多項式的スケーリングに従うことが示された。

実験結果

リサーチクエスチョン

  • RQ1無モデルのポリシー勾配法は、初期安定化コントローラーを必要とせずに、未知の線形力学系を安定化できるか?
  • RQ2提案された割引アニーリング手順は、滑らかで非線形なシステムがその平衡点の近傍で安定化コントローラーを生成できるか?
  • RQ3アルゴリズムのサンプル複雑性(シミュレータクエリ数および誤差許容度)はどのようになるか?
  • RQ4ポリシー勾配コントローラーの性能は、線形化されたシステムの最適LQRコントローラーと比べてどうか?
  • RQ5本手法は、ベンチマーク非線形システムにおいて、H∞合成のような確立されたロバスト制御技術と同等の性能を達成できるか?

主な発見

  • 割引アニーリング手法は、線形系に対して安定化状態フィードバックコントローラーを理論的に回復可能であり、未割引LQR問題においてもほぼ最適な性能を達成する。
  • アルゴリズムは、問題パラメータおよび許容誤差εの多項式的スケーリングのもとで、勾配およびコスト評価の回数が限界に抑えられ、効率的な実装が可能である。
  • 滑らかで非線形なシステムに対しては、本手法は平衡点の近傍で指数的安定化を保証するコントローラーを生成する。
  • 非線形カート・ポール環境における実験結果から、H∞合成と同等の性能を示すが、理論的保証は局所的である。
  • ポリシー勾配解と最適LQRコントローラーとの誤差は、初期状態の球の半径が大きくなるにつれて増加する傾向にあり、初期状態の範囲に敏感であることが示された。
  • Fazelら(2018)が提起した未解決問題を、安定化ポリシーの事前知識がなくてもシステムを安定化できることで解決した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。