Skip to main content
QUICK REVIEW

[論文レビュー] Learning Policies with Zero or Bounded Constraint Violation for Constrained MDPs

Tao Liu, Ruida Zhou|arXiv (Cornell University)|Jun 4, 2021
Reinforcement Learning in Robotics参考文献 15被引用数 16
ひとこと要約

本稿では、制約付きマルコフ決定過程(CMDP)に対する二つの新しい強化学習アルゴリズムを提案する。これらのアルゴリズムは、任意の高い確率で $Ó(\sqrt{K})$ のレグレットを達成し、制約違反がゼロまたは有界となる。手法は、不確実性の面前における楽観的・懐疑的態度(OPFU)を採用し、探索を促進する楽観主義と、安全を確保する懐疑的態度を併せ持つ。これにより、厳密な安全方策の事前知識がなくても、学習中に保証された安全性を達成できる。

ABSTRACT

We address the issue of safety in reinforcement learning. We pose the problem in an episodic framework of a constrained Markov decision process. Existing results have shown that it is possible to achieve a reward regret of $ ilde{\mathcal{O}}(\sqrt{K})$ while allowing an $ ilde{\mathcal{O}}(\sqrt{K})$ constraint violation in $K$ episodes. A critical question that arises is whether it is possible to keep the constraint violation even smaller. We show that when a strictly safe policy is known, then one can confine the system to zero constraint violation with arbitrarily high probability while keeping the reward regret of order $ ilde{\mathcal{O}}(\sqrt{K})$. The algorithm which does so employs the principle of optimistic pessimism in the face of uncertainty to achieve safe exploration. When no strictly safe policy is known, though one is known to exist, then it is possible to restrict the system to bounded constraint violation with arbitrarily high probability. This is shown to be realized by a primal-dual algorithm with an optimistic primal estimate and a pessimistic dual update.

研究の動機と目的

  • 訓練中にゼロまたは有界な制約違反を保証するアルゴリズムを設計することで、強化学習における安全性という重要な課題に取り組む。
  • 安全を維持しつつ $\tilde{\mathcal{O}}(\sqrt{K})$ のレグレットを達成し、従来の手法で一般的に見られる $\tilde{\mathcal{O}}(\sqrt{K})$ の制約違反を克服する。
  • 動的特性、報酬、コストが未知の状況下で、表形式のエピソード的CMDPにおいて安全性とパフォーマンスの理論的保証を提供する。
  • 不確実性の面前における楽観的・懐疑的態度(OPFU)の原則を、バンドイットから順序的な意思決定へと拡張するための新しいOPFUフレームワークを構築する。

提案手法

  • 提案された OptPess-LP アルゴリズムは、楽観的なプライマル推定と懐疑的なデュアル更新を用い、厳密な安全方策が既知である場合に制約違反がゼロとなることを保証する。
  • OptPess-PrimalDual アルゴリズムは、楽観的なプライマル推定と懐疑的なデュアル更新を組み合わせたプライマル・デュアル構造を採用し、厳密な安全方策が存在しない場合に制約違反を有界に抑える。
  • 両アルゴリズムとも、不確実性の面前における楽観的・懐疑的態度(OPFU)の原則を適用しており、楽観主義が探索を促進し、懐疑主義が危険な行動を抑制する。
  • 値関数と制約に対する高確率的信頼区間を、Hoeffdingの不等式と集中不等式を用いて導出する。
  • リャプノフのドリフト解析を用いて安定性と収束性を証明し、制約違反が高確率で有界であることを保証する。
  • $c^0$ が未知の場合、アルゴリズムは方策のロールアウトを用いてそれを推定し、安全を維持するために懐疑的な上界を用いる。

実験結果

リサーチクエスチョン

  • RQ1エピソード的CMDPにおいて、$\tilde{\mathcal{O}}(\sqrt{K})$ のレグレットを達成しつつ、制約違反がゼロとなることは可能か?
  • RQ2厳密な安全方策が存在しない場合でも、高確率で有界な制約違反を維持することは可能か?
  • RQ3不確実性の面前における楽観的・懐疑的態度(OPFU)の原則を、制約付きの順序的な意思決定に効果的に適用することは可能か?
  • RQ4OPFUに基づくアルゴリズムのパフォーマンスは、従来のOFUに基づく手法と比較して、レグレットと安全性の面でどのように異なるか?

主な発見

  • 厳密な安全方策が既知である場合、OptPess-LP アルゴリズムは、任意の高い確率で $\tilde{\mathcal{O}}(\sqrt{K})$ のレグレットとゼロの制約違反を達成する。
  • 厳密な安全方策が未知だが存在する場合、OptPess-PrimalDual アルゴリズムは、$\tilde{\mathcal{O}}(\sqrt{K})$ のレグレットと、$K$ に依存しない有界な制約違反を達成する。
  • 有界な場合の制約違反は $\mathcal{O}(C''H + H^2\sqrt{|Σ|^3|α|C''\log(C''/\delta')})$ であり、エピソード数 $K$ に依存しない。
  • レグレットの上限は $\tilde{\mathcal{O}}(H^3/(τ - c^0)\sqrt{|Σ|^3|α|K})$ に比例し、$c^0$ は既知の安全方策のコスト、$\tau$ は制約の閾値を表す。
  • アルゴリズムは、探索を促進する楽観主義と、制約回避を促す懐疑主義のバランスを保つことで、高確率で安全な行動を確保する。
  • $c^0$ が未知の場合、$K'' = \mathcal{O}(\log K / H(\tau - c^0)^2)$ のロールアウトを用いてそれを推定し、$1/(τ - c^{0'}) \leq 2/(τ - c^0)$ を満たすように保証することで、同じオーダーのレグレットを達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。