[論文レビュー] Global Convergence of Policy Gradient Primal-dual Methods for Risk-constrained LQRs
本稿では、リスク制約付き線形二次調節器(RC-LQR)に対するポリシー勾配プライマルデュアル法を提案し、モデルベースおよびサンプルベースの両設定においてグローバル収束を確立している。RC-LQRに内在する非凸で制約付きの最適化の性質にかかわらず、強い双対性、強制性、局所的勾配優位性、およびラグランジュ関数のリプシッツ連続勾配を証明することで、グローバル収束を達成している。
While the techniques in optimal control theory are often model-based, the policy optimization (PO) approach directly optimizes the performance metric of interest. Even though it has been an essential approach for reinforcement learning problems, there is little theoretical understanding on its performance. In this paper, we focus on the risk-constrained linear quadratic regulator (RC-LQR) problem via the PO approach, which requires addressing a challenging non-convex constrained optimization problem. To solve it, we first build on our earlier result that an optimal policy has a time-invariant affine structure to show that the associated Lagrangian function is coercive, locally gradient dominated and has local Lipschitz continuous gradient, based on which we establish strong duality. Then, we design policy gradient primal-dual methods with global convergence guarantees in both model-based and sample-based settings. Finally, we use samples of system trajectories in simulations to validate our methods.
研究の動機と目的
- リスク制約付きLQRにおけるポリシー最適化の理論的収束保証の欠如に対処すること。
- 二次コスト関数を伴う連続的で非凸な制約付きマルコフ決定過程(CMDP)における強い双対性を確立すること。
- 無限ホライズンのRC-LQR問題に対してグローバル収束を達成するプライマルデュアル法を設計すること。
- シミュレーションにおいてサンプルされたシステム軌道を用いて手法を検証すること。
- 非凸な分散類似制約によるグローバル勾配優位性の欠如を克服すること。
提案手法
- RC-LQRにおける最適ポリシーのアフィン構造を活用し、ゲイン行列とバイアスベクトルのパrameter化に基づいて問題を再定式化すること。
- ラグランジュ関数が強制的であり、局所的に勾配優位であり、局所的にリプシッツ連続勾配を持つことを証明すること。
- 二次コスト関数を伴う連続的CMDPクラスに対して強い双対性を確立し、非凸設定下で初めての結果を達成すること。
- プライマル変数(ポリシー)とデュアル変数(乗数)を交互に更新するプライマルデュアルアルゴリズムを設計し、ポリシー勾配とデュアル上昇を用いること。
- モデルベース設定では正確な勾配を、サンプルベース設定ではサンプルに基づく勾配推定器を用いること。
- ジェンセンの不等式と和分の議論を適用して、デュアル関数の収束速度を導出すること。
実験結果
リサーチクエスチョン
- RQ1非凸性と制約付き最適化に起因するリスク制約付きLQRに対して、ポリシー勾配プライマルデュアル法がグローバル収束を達成できるか?
- RQ2無限ホライズンで連続的で、二次コスト関数および分散類似制約を伴うCMDPにおいて、強い双対性が成立するか?
- RQ3アフィンポリシーパラメータ化下で、RC-LQR問題のラグランジュ関数がグローバルに勾配優位または強制的か?
- RQ4これらの条件下で、モデルベースおよびサンプルベースの両設定においてグローバル収束を保証できるか?
- RQ5サンプルベース設定において、デュアル関数にどの程度の収束速度を確立できるか?
主な発見
- RC-LQRのラグランジュ関数は強制的であり、局所的にリプシッツ連続勾配を持つため、グローバル収束保証が可能である。
- 二次コスト関数を伴う連続的CMDPクラスに対して強い双対性が形式的に証明され、非凸設定下で初めての結果である。
- ポリシー勾配プライマルデュアル法は、モデルベースおよびサンプルベースの両設定でグローバル収束を達成する。
- サンプルベース設定では、デュアル関数はO(1/√k)の速度で収束し、デュアルギャップはO(1/√k) + O(1/k)の項で有界である。
- サンプルされたシステム軌道を用いたシミュレーションにより、提案手法の有効性と収束性が検証された。
- 強制性とラグランジュ関数の局所的勾配優位性を活用することで、グローバル勾配優位性の欠如を克服した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。