Skip to main content
QUICK REVIEW

[論文レビュー] Learning with Safety Constraints: Sample Complexity of Reinforcement Learning for Constrained MDPs

Aria HasanzadeZonuzy, Archana Bura|arXiv (Cornell University)|Aug 1, 2020
Reinforcement Learning in Robotics被引用数 11
ひとこと要約

本稿は、動的システムが未知である制約付きマルコフ決定過程(CMDP)に対して、生成的およびオンライン学習アプローチを用いて安全性と最適性を保証するモデルベース強化学習アルゴリズムを提案する。サンプル複雑性が制約数に対して対数的にしか増加しないことを示しており、多数の安全制約を有する実世界のサイバーフィジカルシステムにおける制約付き強化学習の実用性を裏付けている。

ABSTRACT

Many physical systems have underlying safety considerations that require that the policy employed ensures the satisfaction of a set of constraints. The analytical formulation usually takes the form of a Constrained Markov Decision Process (CMDP). We focus on the case where the CMDP is unknown, and RL algorithms obtain samples to discover the model and compute an optimal constrained policy. Our goal is to characterize the relationship between safety constraints and the number of samples needed to ensure a desired level of accuracy -- both objective maximization and constraint satisfaction -- in a PAC sense. We explore two classes of RL algorithms, namely, (i) a generative model based approach, wherein samples are taken initially to estimate a model, and (ii) an online approach, wherein the model is updated as samples are obtained. Our main finding is that compared to the best known bounds of the unconstrained regime, the sample complexity of constrained RL algorithms are increased by a factor that is logarithmic in the number of constraints, which suggests that the approach may be easily utilized in real systems.

研究の動機と目的

  • モデル不確実性下での制約付きMDP(CMDP)に対して、サンプル効率の良い強化学習アルゴリズムを開発し、目的関数の最大化と制約の満たしを両立すること。
  • 確率的近似的正しさ(PAC)学習フレームワークにおいて、安全性制約とサンプル複雑性のトレードオフを定量化すること。
  • 限られた相互作用からの正確なモデルの学習を継続的に維持しつつ、実行可能性と楽観性を保つアルゴリズムを設計すること。
  • 性能と制約遵守の両方において所望の精度に達するためのサンプル数の理論的境界を提供すること。
  • 制約数の増加が、特に大規模なサイバーフィジカルシステムにおいて学習の難易度を著しく上昇させるかどうかを評価すること。

提案手法

  • 初期サンプルを収集してMDPモデルを推定した後、線形計画法(LP)を用いてCMDPを解く生成的モデルベースのアプローチを提案する。
  • 新しいデータが到着するたびにモデルと方策を段階的に更新するオンライン学習バージョンを導入し、推定値の信頼球を通じて実行可能性を維持する。
  • モデル推定値の信頼球を用いることで、推定モデルが不正確であっても実行可能解が存在することを保証する。
  • 標準的なLP定式化を拡張し、モデルの信頼球全体を探索することで、方策選択における楽観性と実行可能性を保証する。
  • PACスタイルの解析を用いて、価値と制約遵守の両方において所望の精度に達するためのサンプル数の上限を導出する。
  • 濃度不等式と状態行動ペアおよび制約の誤差伝播解析を組み合わせることで、サンプル複雑性の境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1複数の安全制約が存在する場合、制約なしMDPと比較してCMDPにおける学習のサンプル複雑性にどのように影響を与えるか?
  • RQ2CMDP用のモデルベース強化学習アルゴリズムは、学習中に制約違反を最小限に抑えながら、実行可能性と楽観性を維持できるか?
  • RQ3PAC学習フレームワークにおいて、サンプル複雑性は制約数および状態空間のサイズに対してどのようにスケーリングされるか?
  • RQ4生成的アプローチとオンラインアプローチは、サンプル効率性および制約遵守保証の観点でどのように比較できるか?
  • RQ5制約によるサンプル複雑性の増加は、許容できないほど大きいか、それとも有益にスケーリングされる(例えば、対数的に)か?

主な発見

  • 制約付き強化学習のサンプル複雑性は、制約なし強化学習と比較して制約数に対して対数的要因に比例して増加する。これは、追加コストが管理可能であることを示している。
  • 提案されたアルゴリズムは、学習済み方策が高確率で近似的最適な目的関数値を達成し、すべての制約を満たすことを保証する。
  • 生成的およびオンラインアプローチの両方とも、サンプル複雑性が |S|H²/ε² に比例し、制約数および状態空間の対数的要因を含むPAC境界を達成する。
  • 非最適なエピソード数は O(|S|²|A|H²/ε²) の対数的項で有界であり、有限エピソード内での収束を保証する。
  • 制約数に対する対数的依存性は、多数の安全制約が存在する場合でも、手法が実用的であることを示唆している。
  • 濃度不等式と状態行動ペアおよび制約インデックスの和集合不等式を用いた理論的境界により、不確実性下でも頑健性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。