Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Primal-Dual Approach

Qinbo Bai, Amrit Singh Bedi|arXiv (Cornell University)|Sep 13, 2021
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、制約付き強化学習における保守的確率的プライマルデュアルアルゴリズム(CSPDA)を提案し、新たなデュアルドメインにおける保守的制約アプローチを用いて、ゼロの制約違反を伴いながら$Ø$-最適な累積報酬を達成する。サンプル複雑度は$Ø\left(1/\epsilon^{2}\right)$を達成し、モデルフリーのCMDPにおけるゼロ違反ポリシーの先行研究$Ø\left(1/\epsilon^{5}\right)$と比べて顕著に向上している。

ABSTRACT

Reinforcement learning is widely used in applications where one needs to perform sequential decisions while interacting with the environment. The problem becomes more challenging when the decision requirement includes satisfying some safety constraints. The problem is mathematically formulated as constrained Markov decision process (CMDP). In the literature, various algorithms are available to solve CMDP problems in a model-free manner to achieve $ε$-optimal cumulative reward with $ε$ feasible policies. An $ε$-feasible policy implies that it suffers from constraint violation. An important question here is whether we can achieve $ε$-optimal cumulative reward with zero constraint violations or not. To achieve that, we advocate the use of randomized primal-dual approach to solve the CMDP problems and propose a conservative stochastic primal-dual algorithm (CSPDA) which is shown to exhibit $ ilde{\mathcal{O}}\left(1/ε^2 ight)$ sample complexity to achieve $ε$-optimal cumulative reward with zero constraint violations. In the prior works, the best available sample complexity for the $ε$-optimal policy with zero constraint violation is $ ilde{\mathcal{O}}\left(1/ε^5 ight)$. Hence, the proposed algorithm provides a significant improvement as compared to the state of the art.

研究の動機と目的

  • モデルフリーの制約付き強化学習において、制約違反が全くない最適なポリシー性能を達成するという重要な課題に取り組むこと。
  • 自律走行や電力システムなど、制約違反が破綻を招く応用分野において、理論的最適性と実用的安定性のギャップを埋めること。
  • 制約付きマーカフ決定過程(CMDP)において、$Ø$-最適な累積報酬を達成しながら、ゼロの制約違反を保証するサンプル効率の高いアルゴリズムを開発すること。
  • $Ø$-可能ポリシーではあるが、非ゼロの制約違反を許容する従来手法の限界を克服すること。
  • 保守的デュアル制約とKLダイバージェンスに基づくデュアル更新を用いて、CMDPにおけるプライマルデュアル手法の新しい理論的基盤を確立すること。

提案手法

  • 提案されたCSPDAアルゴリズムは、プライマル・デュアルフレームワークを採用し、デュアルドメインにおける保守的制約戦略を用いてデュアル変数を更新することで、プライマルポリシーにおけるゼロの制約違反を強制する。
  • 適応的状態-行動ペアサンプリングを導入し、確率的勾配の2次モーメントが無限大に発散する状況を引き起こすため、標準的手法とは異なる分析が不可欠となる。
  • デュアル更新にはKLダイバージェンスを性能指標として用い、勾配分散が無限大であっても安定した収束を可能にし、Zhangら(2021)の研究にインspiredされている。
  • デュアルドメインにおける制約違反とプライマルドメインにおける妥当性の関係を結ぶ、新たな理論的分析を活用し、最終的なポリシーがゼロの違反を達成することを保証する。
  • 定数$C_1$および$C_2$を用いた保守的デュアル更新により、デュアル最適解$\|\mathbf{y}^*\|_1$および$\|\mathbf{z}^*\|_\infty$に比例してスケーリングされ、タイトなプライマル妥当性バインドを保証する。
  • モデルフリー学習を想定しており、遷移確率に関する事前知識を一切不要としており、実世界の環境に適した設計である。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーなアルゴリズムを用いて、制約付き強化学習においてゼロの制約違反を伴いながら$Ø$-最適な累積報酬を達成できるか?
  • RQ2環境の遷移ダイナミクスの事前知識なしに、CMDPにおけるゼロ違反ポリシーを達成するための最適なサンプル複雑度は何か?
  • RQ3保守的デュアル制約をどのように活用すれば、最適ポリシーへの収束を保ちながらプライマル制約違反をゼロに保てるか?
  • RQ4適応的サンプリングに起因する勾配推定値の無限大に発散する2次モーメントを、プライマルデュアルRLフレームワークで効果的に扱えるか?
  • RQ5CMDPにおけるゼロ違反ポリシーに対して、$\tilde{\mathcal{O}}(1/\epsilon^5)$を下回るサンプル複雑度を達成することは可能か?

主な発見

  • 提案されたCSPDAアルゴリズムは、ゼロの制約違反を伴いながら$Ø$-最適な累積報酬を達成し、$\tilde{\mathcal{O}}(1/\epsilon^2)$という新たな最良のサンプル複雑度を確立した。
  • これは、モデルフリーのCMDPにおけるゼロ違反ポリシーの先行研究$\tilde{\mathcal{O}}(1/\epsilon^5)$と比べて顕著な改善を示している。
  • 制約違反は$\|\mathbf{g}(\tilde{\mathbf{x}})_+\|_\infty \leq 2\delta / C_1$および$\|\mathbf{A}\tilde{\mathbf{x}} + \mathbf{b}\|_1 \leq 2\delta / C_2$で有界であり、$C_1 \geq 2\|\mathbf{y}^*\|_1$および$C_2 \geq 2\|\mathbf{z}^*\|_\infty$を満たす。
  • 理論的分析により、プライマル目的関数ギャップが$\delta$で有界であり、制約違反が$\delta / C_1$および$\delta / C_2$の速度で減少することが証明され、極限ではゼロの違反が保証される。
  • KLダイバージェンスに基づくデュアル更新により、勾配推定値の2次モーメントが無限大に発散する状況でも、標準的なサドルポイント法が失敗する状況においても収束を可能にした。
  • 概念実証実験により理論的予測が妥当であることが検証され、アルゴリズムがゼロの制約違反を維持しながらほぼ最適な性能を達成できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。