Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Reinforcement Learning in Factored MDPs with Application to Constrained RL

Xiaoyu Chen, Jiachen Hu|arXiv (Cornell University)|Aug 30, 2020
Reinforcement Learning in Robotics参考文献 27被引用数 6
ひとこと要約

本稿では、要因分解されたマルコフ決定過程(FMDP)における効率的な強化学習アルゴリズムFMDP-BFを提案する。このアルゴリズムは、非要因分解MDPアルゴリズムと比較して、後悔のスケーリングを指数的に改善する。要因分解された状態と行動の構造を活用することで、先行研究と比較して後悔を $\sqrt{nH|\mathcal{S}_i|}$ 倍低減する。さらに、本フレームワークは、 knapsack 制約付き強化学習という新しい制約付きRL設定に応用され、近似的に最適な後悔バウンドを達成する。

ABSTRACT

Reinforcement learning (RL) in episodic, factored Markov decision processes (FMDPs) is studied. We propose an algorithm called FMDP-BF, which leverages the factorization structure of FMDP. The regret of FMDP-BF is shown to be exponentially smaller than that of optimal algorithms designed for non-factored MDPs, and improves on the best previous result for FMDPs~\\citep{osband2014near} by a factored of $\\sqrt{H|\\mathcal{S}_i|}$, where $|\\mathcal{S}_i|$ is the cardinality of the factored state subspace and $H$ is the planning horizon. To show the optimality of our bounds, we also provide a lower bound for FMDP, which indicates that our algorithm is near-optimal w.r.t. timestep $T$, horizon $H$ and factored state-action subspace cardinality. Finally, as an application, we study a new formulation of constrained RL, known as RL with knapsack constraints (RLwK), and provides the first sample-efficient algorithm based on FMDP-BF.

研究の動機と目的

  • エピソード的要因分解MDP(FMDP)に対して、サンプルおよび計算の両面で効率的であり、証明可能な改善された後悔バウンドを達成するRLアルゴリズムの開発。
  • FMDPにおける後悔の理論的下界を確立し、提案されたアルゴリズムの近似的最適性を示す。
  • FMDP-BFフレームワークを、実世界の応用に適した新しい制約付きRL定式化—knapsack 制約付き強化学習(RLwK)—に拡張する。
  • 時間枠 $H$、要因分解された状態・行動部分空間の基数 $|\mathcal{S}_i|$、および遷移回数 $n$ に対して、FMDP-BFの後悔がどのようにスケーリングするかを示す。
  • 連続的なコスト分布における非滑らかな価値関数の課題に対処し、緩和された制約またはソフトペナルティを介して有効な拡張を提案する。

提案手法

  • FMDP-BFは、不確実性に対する楽観的原則(OFU)を、要因分解された状態・行動部分空間に適用する。価値関数の上界と下界を維持する。
  • 要因分解された状態・行動部分空間におけるネストされたベルマンバックアップを用い、探索と活用のバランスを $\sqrt{\log(T)/N(s,a)}$ にスケーリングされた信頼区間で実現する。
  • 各状態と予算 $\bm{b}$ に対して、別個の上界 $\overline{V}_{k,h}(s,\bm{b})$ と下界 $\underline{V}_{k,h}(s,\bm{b})$ を維持することで、不確実性下での強力なポリシー選択を可能にする。
  • knapsack 制約付きRL設定では、予算制約 $\bm{b}$ を価値関数とポリシーに統合し、推定されたコスト分布と信頼区間に基づいた更新を実施する。
  • すべての可能な予算 $\bm{b}$ と状態・行動ペアに対する和集合を用い、過大評価リスクを制御するための対数的ペナルティ項 $\log(Bm)$ を導入する。
  • 連続的なコスト分布に対処するため、緩和された $\epsilon$-ネットアプローチまたは線形ペナルティを用いたソフト制約を導入し、滑らかさと取り扱いやすさを確保する。

実験結果

リサーチクエスチョン

  • RQ1要因分解MDP用のRLアルゴリズムを設計できるか。その場合、従来の非要因分解MDPアルゴリズムと比較して、著しく優れた後悔性能を達成できるか。
  • RQ2Osband & Van Roy (2014b) との比較において、$\sqrt{nH|\mathcal{S}_i|}$ の改善はタイトな後悔バウンドであるか。あるいは、下界によって近似的最適性が裏付けられるか。
  • RQ3FMDP-BFフレームワークは、knapsack スタイルのリソース制約を持つ制約付きRL問題に拡張可能か。
  • RQ4連続的コスト分布は、制約付きFMDPにおける後悔とポリシーの滑らかさにどのように影響するか。また、それらは効率的に扱えるか。
  • RQ5連続的予算空間において、後悔効率を維持するためには、MDP定式化にどのような修正(例:ソフト制約)が必要か。

主な発見

  • FMDP-BFは、最適非要因分解MDPアルゴリズムの後悔バウンドと比較して、指数的に小さい後悔バウンドを達成し、Osband & Van Roy (2014b) と比較して $\sqrt{nH|\mathcal{S}_i|}$ 倍の改善を達成する。
  • 本稿ではFMDPにおける後悔の下界を確立し、提案されたアルゴリズムの後悔が $T$、$H$、$|\mathcal{S}_i|$ の観点で近似的に最適であることを示している。
  • 新規のRLwK定式化において、FMDP-BFは、$T$、$S$、$A$、$H$ に関して近似的に最適な後悔バウンドを達成する最初のサンプル効率の良いアルゴリズムを提供する。
  • アルゴリズムは、すべての可能な予算状態 $\bm{b}$ に対する信頼区間を維持しており、予算構成の和集合による影響により、後悔バウンドに $\log(Bm)$ 項が現れる。
  • 連続的コスト設定では、残りの予算に関する価値関数の非滑らかさが、直接的な推定を不可能にする。本稿では、緩和された $\epsilon$-ネットまたはソフト制約を有効な代替手段として提案する。
  • 理論的分析により、OFU原則が要因分解構造に適用されると、計算効率を損なうことなく、顕著な後悔低減が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。