[論文レビュー] Reinforcement Learning with Fast Stabilization in Linear Dynamical Systems
本稿では、初期安定化コントローラーを必要とせず、$˜{O}(√{T})$のレグレットを達成する安定化可能線形力学系向けのモデルベース強化学習アルゴリズムStabLを提案する。楽観的探索と等方的摂動を組み合わせることで、学習中もシステムの安定性を保証しつつ、問題次元に対して多項式的依存を維持し、従来の指数的レグレット境界を持つ手法に比べ顕著な改善を達成する。
In this work, we study model-based reinforcement learning (RL) in unknown stabilizable linear dynamical systems. When learning a dynamical system, one needs to stabilize the unknown dynamics in order to avoid system blow-ups. We propose an algorithm that certifies fast stabilization of the underlying system by effectively exploring the environment with an improved exploration strategy. We show that the proposed algorithm attains $ ilde{\mathcal{O}}(\sqrt{T})$ regret after $T$ time steps of agent-environment interaction. We also show that the regret of the proposed algorithm has only a polynomial dependence in the problem dimensions, which gives an exponential improvement over the prior methods. Our improved exploration method is simple, yet efficient, and it combines a sophisticated exploration policy in RL with an isotropic exploration strategy to achieve fast stabilization and improved regret. We empirically demonstrate that the proposed algorithm outperforms other popular methods in several adaptive control tasks.
研究の動機と目的
- 未知の安定化可能線形力学系において、初期安定化コントローラーにアクセスできない状況での学習の課題に対処すること。
- オンライン学習中にレグレットを最小限に抑えながら、高速なシステム安定化を実現する探索戦略の設計。
- システム次元に対して多項式的依存のみを有するレグレットを達成し、先行研究における指数的依存を克服すること。
- 一般の安定化可能LQR設定(特に可制御または収縮的ケースに限らない)において、安定性と性能の理論的・実験的保証を提供すること。
- 無人航空機(UAV)制御および可制御でないが安定化可能なシステムにおいて、優れた実験的性能を示すこと。
提案手法
- 不確実性に対する楽観的(OFU)と等方的探索を統合したStabLアルゴリズムを提案し、探索と活用のバランスを図る。
- 初期学習段階での安定性を保証するために、減衰するか固定の摂動を用いた新しい探索戦略を採用し、システムダイナミクスを能動的に探査する。
- 最小二乗推定を用いてシステムパラメータの信頼領域を構築し、候補コントローラーの安定性を検証する安定性証明を適用する。
- 時間に依存する探索スケジュールを採用し、不確実性が高く影響力の大きい状態・行動ペアを優先することで、学習と安定化を加速する。
- 導入前に候補コントローラーがシステムを安定化可能かどうかを検証する安定性認証メカニズムを導入する。
- モデルベース学習とレグレット最小化を統合し、初期段階では線形コストを支払うが、全体として非線形レグレットを達成するように設計する。
実験結果
リサーチクエスチョン
- RQ1未知の安定化可能線形システムを初期安定化コントローラーなしで安定化できる強化学習アルゴリズムを設計できるか?
- RQ2安定化可能LQRにおいて、システム次元に対して多項式的依存のみを有する$\tilde{\mathcal{O}}(\sqrt{T})$のレグレットを達成できるか?
- RQ3改善された探索戦略は、OFUベース手法と比較して、安定化速度とレグレット性能にどのように影響を与えるか?
- RQ4可制御でないが安定化可能なシステムにおいて、提案手法が従来手法に比べ優れた性能を示せるか?
- RQ5安定化可能LQRにおいて、初期探索コストと長期的レグレットのトレードオフはどのようなものか?
主な発見
- StabLは問題次元に対して多項式的依存のみを有する$\tilde{\mathcal{O}}(\sqrt{T})$のレグレットを達成し、従来の指数的レグレット境界を持つ手法に比べて指数的改善を実現した。
- UAV制御タスクにおいて、200ステップ経過後、StabLは平均で$1.53 \times 10^5$のレグレットを達成し、OFULQ($5.06 \times 10^7$)やCECバージョンを上回った。
- UAVタスクにおいて、StabLは平均で最大状態ノルムを$8.46 \times 10^1$に抑えることができ、OFULQの$5.61 \times 10^2$と比べ顕著に低い水準を維持し、優れた安定性を示した。
- 可制御でないが安定化可能なシステムでは、StabLは平均で$1.68 \times 10^6$のレグレットを達成したが、OFULQは$5.20 \times 10^{12}$のレグレットを記録し、崩壊的な失敗を示した。
- StabLは最悪状態ノルムを$2.51 \times 10^2$(最悪5%)にまで低減したのに対し、OFULQは$6.35 \times 10^3$であった。これにより、強力なロバストネスが確認された。
- 複数回の実行において、レグレットと状態ノルムのばらつきが小さく、結果の四分位数標準偏差帯から安定した性能が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。