Skip to main content
QUICK REVIEW

[論文レビュー] A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes

Honghao Wei, Xin Liu|arXiv (Cornell University)|Jun 3, 2021
Reinforcement Learning in Robotics参考文献 33被引用数 6
ひとこと要約

本稿では、証明可能なサブライン形式のレグレットとゼロの制約違反を備えた、最初のモデルフリーかつシミュレータフリーな強化学習アルゴリズムであるTriple-Qを提案する。制約付きマルコフ決定過程(CMDP)に対して適用可能で、報酬Q値、制約効用Q値、累積違反を表す仮想キューの3つの構成要素を組み合わせた擬似Q値を用いて、探索と安全性のバランスを図る。その結果、$\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$のレグレットと、大きな$K$における正確な制約満足が達成される。

ABSTRACT

This paper presents the first model-free, simulator-free reinforcement learning algorithm for Constrained Markov Decision Processes (CMDPs) with sublinear regret and zero constraint violation. The algorithm is named Triple-Q because it includes three key components: a Q-function (also called action-value function) for the cumulative reward, a Q-function for the cumulative utility for the constraint, and a virtual-Queue that (over)-estimates the cumulative constraint violation. Under Triple-Q, at each step, an action is chosen based on the pseudo-Q-value that is a combination of the three "Q" values. The algorithm updates the reward and utility Q-values with learning rates that depend on the visit counts to the corresponding (state, action) pairs and are periodically reset. In the episodic CMDP setting, Triple-Q achieves $ ilde{\cal O}\left(\frac{1 }δH^4 S^{\frac{1}{2}}A^{\frac{1}{2}}K^{\frac{4}{5}} ight)$ regret, where $K$ is the total number of episodes, $H$ is the number of steps in each episode, $S$ is the number of states, $A$ is the number of actions, and $δ$ is Slater's constant. Furthermore, Triple-Q guarantees zero constraint violation, both on expectation and with a high probability, when $K$ is sufficiently large. Finally, the computational complexity of Triple-Q is similar to SARSA for unconstrained MDPs and is computationally efficient.

研究の動機と目的

  • 強力な理論的保証を備えた、モデルフリーかつシミュレータフリーなCMDP用強化学習アルゴリズムの不足を解消すること。
  • 衝突回避や予算制限といった制約を厳密に守らなければならない実世界の応用分野における安全な強化学習を可能にすること。
  • 環境シミュレータや既知のモデルに依存せずに、サブライン形式のレグレットとゼロの制約違反を達成すること。
  • 深層強化学習におけるニューラルネットワークとの統合が可能な、計算的に効率的なアルゴリズムを設計すること。
  • 単一および複数制約を含むCMDPに対して、統一された最適化構造を用いて、証明可能な効率性を提供するフレームワークを構築すること。

提案手法

  • エピソード型CMDPにおけるモデルフリーなアルゴリズムとしてTriple-Qを導入。報酬Q関数$Q_h(x,a)$、制約効用Q関数$C_h(x,a)$、累積制約違反を過大評価する仮想キュー$Z$という3つの構成要素を維持する。
  • 各ステップで、擬似Q値を最大化する行動を選択する:$\arg\max_a \big(Q_h(x,a) + \frac{Z}{\eta} C_h(x,a)\big)$、ここで$\eta$は制約ペナルティのスケーリング定数である。
  • 訪問回数に依存する学習率とボーナスを用いたUCBベースの探索を実装し、各エピソードの開始時に学習率を定期的にリセットする。
  • 訪問回数に応じて減少する時間変動型学習率を用いて、時系列差分学習により報酬および効用Q関数を更新する。
  • 仮想キュー$Z$をゆっくりと更新して、制約違反を追跡・ペナルティ化し、長期的な制約遵守を保証する。
  • 共有ハイパーパramータと周期的な仮想キュー更新を用いたアクター・クリティックネットワークを用いて、Deep Triple-Qとして深層強化学習に拡張する。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーかつシミュレータフリーな強化学習アルゴリズムは、エピソード型CMDPでサブライン形式のレグレットを達成できるか?
  • RQ2シミュレータに依存せず、期待値および高確率においてゼロの制約違反を保証することは可能か?
  • RQ3オンライン相互作用のみを用いて、CMDPにおける安全な探索と活用のトレードオフをどのように維持できるか?
  • RQ4関数近似を用いて、連続的状態空間および行動空間に効率的にスケーリングできるか?
  • RQ5仮想キューと二重Q関数の統合は、先行手法と比較して制約処理をどのように改善するか?

主な発見

  • Triple-Qは、$\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$のレグレットを達成し、エピソード数$K$に関してサブライン形式である。この結果は、ホライズン$H$、状態空間サイズ$S$、行動空間サイズ$A$、およびスレイター定数$\delta$に明示的な依存関係を示す。
  • 十分に大きな$K$において、期待値および高確率の両方でゼロの制約違反が保証される。これは、制限付き違反を許容する先行手法と比較して顕著な改善である。
  • 表形式のグリッドワールド環境では、Triple-Qは約20,000エピソードで安全で高い報酬を得る方策を学習し、学習終了後も効果的である(Triple-Q-stop)ため、近似的最適定常方策への収束が示された。
  • 連続的制御のDynamic Gymベンチマークでは、Deep Triple-Qが約0.45百万ステップで安全で高い報酬を得る方策を達成し、WCSACが450万ステップを要したのに対し、優れた性能を発揮した。
  • Triple-Qの計算複雑度はSARSAと同等であり、実世界への実装に実用的である。
  • 複数の制約に対しては、各制約ごとに別個の仮想キューと効用Q関数を維持し、すべての制約Q値の重み付き和による行動選択により、一般化が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。