[論文レビュー] KCRL: Krasovskii-Constrained Reinforcement Learning with Guaranteed Stability in Nonlinear Dynamical Systems
KCRLは、ポリシー最適化における線形計画法の制約としてクラソフスキーのリャプノフ関数構成を埋め込むことで、未知の非線形力学系に対して漸近的安定性を保証するモデルベース強化学習フレームワークを提案する。システムの動的特性を学習するためにランダムフォーリエ特徴(RFF)を用い、安定性を確保するための原対双対アルゴリズムを採用することで、KCRLは有限時間内に安定化を達成し、サンプル複雑度の上界として$ olimits\left(\left(\frac{2\bar{G}\|M\|(1+L_{u})+\|M\|(1+L_{u})^{2}}{\bar{\epsilon}-\epsilon_{pd}}\right)^{3}\right)$を達成する。これにより、$D^2$サンプル後に安定化ポリシーが保証される。
Learning a dynamical system requires stabilizing the unknown dynamics to avoid state blow-ups. However, current reinforcement learning (RL) methods lack stabilization guarantees, which limits their applicability for the control of safety-critical systems. We propose a model-based RL framework with formal stability guarantees, Krasovskii Constrained RL (KCRL), that adopts Krasovskii's family of Lyapunov functions as a stability constraint. The proposed method learns the system dynamics up to a confidence interval using feature representation, e.g. Random Fourier Features. It then solves a constrained policy optimization problem with a stability constraint based on Krasovskii's method using a primal-dual approach to recover a stabilizing policy. We show that KCRL is guaranteed to learn a stabilizing policy in a finite number of interactions with the underlying unknown system. We also derive the sample complexity upper bound for stabilization of unknown nonlinear dynamical systems via the KCRL framework.
研究の動機と目的
- 安全で重要な非線形システムにおけるモデルフリー強化学習の正式な安定性保証の欠如に対処すること。
- クラソフスキーの手法を用いてリャプノフ関数を構築することで、制御理論的安定性解析をオンライン強化学習に統合すること。
- 未知の非線形力学系において安定化ポリシーを学習するための有限時間サンプル複雑度の上界を提供すること。
- モデルの不確実性に対しても安定性が保たれるように、学習されたヤコビ行列推定値によるポリシー最適化の制約を課すこと。
提案手法
- KCRLは、未知のシステム動的特性を信頼区間内で表現・学習するためにランダムフォーリエ特徴(RFF)を用いる。
- 安定性制約がクラソフスキーの手法に基づき、閉ループ系のヤコビ行列に関する線形計画法の不等式として表現される制約付きポリシー最適化問題を定式化する。
- 制約付き問題を解くために原対双対最適化アプローチを採用し、収束時に安定性制約が満たされることを保証する。
- 推定されたヤコビ行列が真のヤコビ行列の有界な誤差範囲内にあれば、学習されたポリシーが真のシステムを安定化することを保証する。
- 充填距離と近似誤差の上限を用いて、状態空間全体にわたる安定性条件が成り立つことを保証する。
- アルゴリズムはエポック単位で動作し、エポック長は$D^2$と設定される。ここで$D$はモデル表現に用いられるRFFの数である。
実験結果
リサーチクエスチョン
- RQ1安定化オракルを必要とせず、未知の非線形力学系に対して有限時間内に安定化を保証できるモデルベース強化学習フレームワークは存在するか?
- RQ2リャプノフ関数構築のためのクラソフスキーの手法は、学習ベースのポリシー最適化フレームワークにどのように統合可能か?
- RQ3RFFに基づく動的特性推定と制約付き最適化を用いた場合、安定化ポリシーを学習するのに必要なサンプル複雑度はどの程度か?
- RQ4モデルの不確実性は学習されたポリシーの安定性にどのように影響するか? そして、その影響を束縛することでロバストネスを確保できるか?
主な発見
- KCRLは、モデル推定誤差が有界であれば、$D^2$サンプル後に均衡集合$S_e$の周囲で閉ループ系の漸近的安定性を保証する。
- 安定化のためのサンプル複雑度の上界は$\mathcal{\tilde{O}}\left(\left(\frac{2\bar{G}\|M\|(1+L_{u})+\|M\|(1+L_{u})^{2}}{\bar{\epsilon}-\epsilon_{pd}}\right)^{3}\right)$であり、ここで$\bar{\epsilon}$は真の安定性マージン、$\epsilon_{pd}$は近似誤差の上限である。
- 原対双対法により、学習済みの動的特性に対してもクラソフスキーの安定性制約が収束時に満たされることが保証される。
- D^2$サンプル後にヤコビ行列の推定誤差$\varepsilon_J$は$\mathcal{\tilde{O}}(D^{-1/3})$に有界となり、$\epsilon_i \leq \bar{\epsilon} - \epsilon_{pd}$の条件下で安定性が保証される。
- 充填距離$h$が$\bar{\epsilon} - \epsilon_{pd} > 0$を満たすように要求されることで、状態空間全体にわたる安定性が保証される。ここで$\epsilon_{pd} = 2\bar{G}\|M\|M_G h$である。
- エポック長を$D^2$に設定すれば、KCRLは1エポックで安定化を達成し、その後のエポックでは推定誤差が増加しないことから安定性が維持される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。