[論文レビュー] Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
本稿では、制約付きマルコフ決定過程(CMDP)に対して、二つのシングルタイムスケールのポリシー勾配プライマルデュアルアルゴリズム—正則化ポリシー勾配プライマルデュアル(RPG-PD)と楽観的ポリシー勾配プライマルデュアル(OPG-PD)—を提案する。エントロピーおよび二次正則化を活用し、楽観的勾配更新を適用することで、最適な制約付きポリシーへの非漸近的で部分線形の最後の反復収束を達成する。これは、CMDPにおけるシングルタイムスケールアルゴリズムで初めての結果である。
We study the problem of computing an optimal policy of an infinite-horizon discounted constrained Markov decision process (constrained MDP). Despite the popularity of Lagrangian-based policy search methods used in practice, the oscillation of policy iterates in these methods has not been fully understood, bringing out issues such as violation of constraints and sensitivity to hyper-parameters. To fill this gap, we employ the Lagrangian method to cast a constrained MDP into a constrained saddle-point problem in which max/min players correspond to primal/dual variables, respectively, and develop two single-time-scale policy-based primal-dual algorithms with non-asymptotic convergence of their policy iterates to an optimal constrained policy. Specifically, we first propose a regularized policy gradient primal-dual (RPG-PD) method that updates the policy using an entropy-regularized policy gradient, and the dual variable via a quadratic-regularized gradient ascent, simultaneously. We prove that the policy primal-dual iterates of RPG-PD converge to a regularized saddle point with a sublinear rate, while the policy iterates converge sublinearly to an optimal constrained policy. We further instantiate RPG-PD in large state or action spaces by including function approximation in policy parametrization, and establish similar sublinear last-iterate policy convergence. Second, we propose an optimistic policy gradient primal-dual (OPG-PD) method that employs the optimistic gradient method to update primal/dual variables, simultaneously. We prove that the policy primal-dual iterates of OPG-PD converge to a saddle point that contains an optimal constrained policy, with a linear rate. To the best of our knowledge, this work appears to be the first non-asymptotic policy last-iterate convergence result for single-time-scale algorithms in constrained MDPs.
研究の動機と目的
- 制約付きMDPにおけるシングルタイムスケールのポリシーに基づくプライマルデュアル手法に、非漸近的かつ最後の反復収束保証が欠如している問題に対処すること。
- 二つのタイムスケールまたは漸近的収束仮定に基づく既存のラグランジュベースのポリシー探索手法における、振動および制約違反問題を克服すること。
- 単一タイムスケール更新スキーム下で、最適な制約付きポリシーへの収束を保証する部分線形レートを有するアルゴリズムを開発すること。
- 有界な近似誤差を持つ関数近似を用いて、大規模な状態・行動空間への収束保証を拡張すること。
- 同一フレームワーク下で、新規の楽観的勾配ベース手法に対して線形収束を確立すること。
提案手法
- エントロピー正則化ポリシー勾配をプライマル更新に、二次正則化勾配上昇をデュアル更新に用いる、シングルタイムスケールのアルゴリズムRPG-PDを提案する。
- ラグランジュ法を用いて制約付きMDPの正則化されたサドルポイント定式化を導出し、問題をミニマックス最適化タスクに変換する。
- プライマルおよびデュアル変数の両方に楽観的勾配更新を適用することで、最適ポリシーを含むサドルポイントへの線形収束を達成するOPG-PDを導入する。
- ブレグマンダイバージェンスおよびパフォーマンス差分補題を用いて、ポリシー価値の向上と収束レートを分析する。
- ポリシーパラメータ化に関数近似を統合し、近似誤差の範囲内で収束を証明する。
- KLダイバージェンスおよびソフトマックスパラメータ化の性質を活用して、ポリシー更新の正確な勾配表現を導出する。
![Figure 1: Convergence performance of RPG-PD, OPG-PD, and primal-dual methods. Learning curves of our RPG-PD ( – – ) and OPG-PD ( — ), and NPG-PD [ 23 ] ( – $\cdot$ – ) and PID Lagrangian [ 29 ] ( $\cdot$ $\cdot$ $\cdot$ $\cdot$ ) methods. The horizontal axes mean the policy iterations $\{\pi_{t}\}_{](https://ar5iv.labs.arxiv.org/html/2306.11700/assets/NPG_primal_dual_comparison_reward.png)
実験結果
リサーチクエスチョン
- RQ1シングルタイムスケールのポリシーに基づくプライマルデュアル手法は、CMDPにおいて非漸近的かつ最後の反復収束を最適な制約付きポリシーに達成できるか?
- RQ2プライマルおよびデュアル更新における正則化は、ポリシー反復の安定化と制約違反の防止に寄与するか?
- RQ3シングルタイムスケールスキーム下で楽観的勾配更新を適用することで、制約付きMDPにおいて線形収束レートを達成できるか?
- RQ4関数近似は、大規模なCMDPにおけるポリシー反復の収束にどのように影響するか?
- RQ5ポリシーパラメータ化における関数近似を用いる際、収束レートと近似誤差のトレードオフは何か?
主な発見
- RPG-PDは、最適な制約付きポリシーへのポリシー反復の部分線形収束をO(1/√T)のレートで達成し、対応する正則化サドルポイントへの収束レートも部分線形である。
- OPG-PDは、適切な条件下で、最適ポリシーを含むサドルポイントへの線形収束を達成し、収束レートはO(ρ^T)(ρ ∈ (0,1))である。
- RPG-PDの収束保証は、関数近似設定へも拡張可能であり、ポリシー反復は近似誤差の範囲内で部分線形に収束する。
- 本稿で提案された手法は、制約付きMDPにおけるシングルタイムスケールプライマルデュアルアルゴリズムで、非漸近的かつ最後の反復収束を確立した最初の研究である。
- 計算実験により、ベースライン手法と比較して制約違反の低減と収束安定性の向上が有効であることが検証された。
- 理論的分析により、OPG-PDにおける楽観的更新メカニズムが、反復の安定性と標準的勾配ベース手法よりも速い収束を保証することが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。