Skip to main content
QUICK REVIEW

[論文レビュー] A Simple Reward-free Approach to Constrained Reinforcement Learning

Sobhan Miryoosefi, Chi Jin|arXiv (Cornell University)|Jul 12, 2021
Reinforcement Learning in Robotics参考文献 37被引用数 5
ひとこと要約

本論文は、報酬なし強化学習(RL)オラクルを活用して、追加のサンプルコストを最小限に抑えることで制約付きRL問題を解くメタアルゴリズムを提案する。動的システムの学習と制約処理を分離することで、表形式MDPおよび線形MDPにおいて最先端のサンプル複雑性を達成し、ホライズン依存要因を除き、既存の最良結果と一致する。さらに、一般の凸制約を伴う線形MDP設定においては、初めてのサンプル効率の良い解決策を提供する。

ABSTRACT

In constrained reinforcement learning (RL), a learning agent seeks to not only optimize the overall reward but also satisfy the additional safety, diversity, or budget constraints. Consequently, existing constrained RL solutions require several new algorithmic ingredients that are notably different from standard RL. On the other hand, reward-free RL is independently developed in the unconstrained literature, which learns the transition dynamics without using the reward information, and thus naturally capable of addressing RL with multiple objectives under the common dynamics. This paper bridges reward-free RL and constrained RL. Particularly, we propose a simple meta-algorithm such that given any reward-free RL oracle, the approachability and constrained RL problems can be directly solved with negligible overheads in sample complexity. Utilizing the existing reward-free RL solvers, our framework provides sharp sample complexity results for constrained RL in the tabular MDP setting, matching the best existing results up to a factor of horizon dependence; our framework directly extends to a setting of tabular two-player Markov games, and gives a new result for constrained RL with linear function approximation.

研究の動機と目的

  • 報酬なしRLと制約付きRLを結びつけるために、制約満たしを動的システム学習から分離する。
  • 任意の報酬なしRLオラクルを用いて、アプローチ可能性および制約付きMDP問題を、最小限のサンプルコストで解くメタアルゴリズムを開発する。
  • 表形式および線形MDPにおける制約付きRLの鋭いサンプル複雑性バウンドを達成し、既存の結果を上回るか同等にする。
  • 2人ゼロサムマルコフゲームに、ベクトル値制約を伴うフレームワークを拡張し、低レジリッド保証を提供する。

提案手法

  • メタアルゴリズムは、報酬の監視なしに、報酬なしRLオラクルを用いて事前に軌道を収集し、MDPの動的システムを学習する。
  • その後、制約満たしを価値関数学習とは別個の最適化問題として定式化し、動的システム学習から分離する。
  • 制約は、経験的モデルに基づくパラメータ化された方策最適化によって強制される、双対最適化フレームワークを採用する。
  • Q値およびV値関数の信頼区間を用いて不確実性バウンドを導入し、再帰的不確実性伝播機構によって制御する。
  • 経験的モデルにおける推定誤差に対してロバスト性を確保するため、方策パラメータのミニマックス戦略を用いる。
  • Hoeffding型の集中不等式を適用して、高確率事象における推定誤差をバウンドし、一般化を保証する。

実験結果

リサーチクエスチョン

  • RQ1報酬なしRLを、追加のサンプルコストを最小限に抑えて制約付きRL問題を解く基盤的要素として利用可能か?
  • RQ2制約付きMDPにおける動的システム学習および価値関数最適化から、制約満たしをどのように分離できるか?
  • RQ3このメタアルゴリズムを用いて、表形式および線形MDPにおける制約付きRLのサンプル複雑性バウンドはどの程度達成可能か?
  • RQ42人ゼロサムマルコフゲームに、ベクトル値制約を伴うフレームワークを拡張し、依然として低レジリッドを達成可能か?
  • RQ5提案手法におけるホライズン依存性が最終的なサンプル複雑性に与える影響は何か?

主な発見

  • 表形式MDPでは、3つのタスク(ベクトル値MDPの報酬なしRL、アプローチ可能性、制約付きMDP)において、$\tilde{\mathcal{O}}(\min\{d,S\}H^{4}SA/\epsilon^{2})$ のサンプル複雑性を達成する。
  • 線形MDPでは、3つのタスクにおいて、$\tilde{\mathcal{O}}(d_{\text{lin}}^{3}H^{6}/\epsilon^{2})$ のサンプル複雑性を達成し、初めてのサンプル効率の良い結果を提供する。
  • 表形式MDPにおいては、ホライズン依存要因を除き、既存の最良結果と一致する。
  • 2人ゼロサムマルコフゲーム設定では、レジリッドバウンド $\alpha(T) = \mathcal{O}(\epsilon/2 + \sqrt{H^{2}\iota/T})$ を達成し、$\mathcal{O}(\epsilon)$ のバイアスを有する。
  • 報酬なしRL分野の進展を、制約付きRLに直接翻訳可能にし、アルゴリズム再設計の必要性を低減する。
  • 集中不等式および再帰的不確実性バウンドを用いて、高確率で理論的保証を確立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。