[論文レビュー] On the Sample Complexity of Reinforcement Learning with Policy Space Generalization
本稿では、ポリシー空間の一般化を伴う強化学習の内在的複雑性を特徴付けるために、ポリシー空間に対する新しいエルーダー次元の概念を導入する。この論文は、エルーダー次元に線形に依存する近似的に最適なサンプル複雑性を達成するスタックベースの探索アルゴリズムを提案する。シミュレータが利用可能な状況では、$\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$ のバウンドが得られ、決定的システムでは $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$ のレグレットが得られる。
We study the optimal sample complexity in large-scale Reinforcement Learning (RL) problems with policy space generalization, i.e. the agent has a prior knowledge that the optimal policy lies in a known policy space. Existing results show that without a generalization model, the sample complexity of an RL algorithm will inevitably depend on the cardinalities of state space and action space, which are intractably large in many practical problems. To avoid such undesirable dependence on the state and action space sizes, this paper proposes a new notion of eluder dimension for the policy space, which characterizes the intrinsic complexity of policy learning in an arbitrary Markov Decision Process (MDP). Using a simulator oracle, we prove a near-optimal sample complexity upper bound that only depends linearly on the eluder dimension. We further prove a similar regret bound in deterministic systems without the simulator.
研究の動機と目的
- 巨大な状態空間および行動空間に起因する大規模強化学習における高いサンプル複雑性の課題に対処すること。
- 最適ポリシーが既知のポリシークラスに属する場合のポリシー学習の内在的複雑性を特徴付ける理論的枠組みを構築すること。
- 時間枠に指数的依存を避けるサンプル効率の良い探索戦略をポリシー学習に設計すること。
- 新しいポリシー空間の複雑性測度を用いて、サンプル複雑性およびレグレットのタイトな上界と下界を確立すること。
提案手法
- マークフ・決定過程におけるポリシークラスに特化した、新しいエルーダー次元 $\mathrm{dim}_E(\Theta)$ の概念を提案する。
- 独立な状態-行動ペアを追跡することで、効率的な探索を促進するスタックベースの探索アルゴリズムを導入する。
- 最適 $Q$-関数に $\Delta$-分離性を満たす一般の MDP において、効率的なポリシー評価と探索を可能にするシミュレータオракルを活用する。
- エルーダー次元を用いて、独立な探索ステップの数をバウンドし、状態空間サイズに依存しない複雑性への線形依存を保証する。
- 再帰的スタック操作と状態-行動ペアの系列における独立性の議論を用いて、レグレットとサンプル複雑性のバウンドを証明する。
- ポリシー空間のリトルスタイン次元に基づくミニマックス下界を確立し、上界のタイトさを示す。
実験結果
リサーチクエスチョン
- RQ1ポリシー空間の内在的複雑性測度は、ポリシー空間一般化を伴う強化学習のサンプル複雑性を特徴付けることができるか?
- RQ2最適ポリシーが既知で構造的なポリシークラスに属する場合、大規模 MDP における探索をどのようにサンプル効率にできるか?
- RQ3サンプル複雑性およびレグレットの最適な依存関係は、状態空間および行動空間サイズに依存しないポリシー空間の複雑性に対してどのようになるか?
- RQ4バンディットや価値関数学習におけるエルーダー次元の概念を、MDP におけるポリシー学習に一般化できるか?
- RQ5ポリシー空間一般化を伴うポリシー学習のミニマックス下界は何か? そして、既存の組合せ的複雑性測度とどのように関係するか?
主な発見
- シミュレータが利用可能な一般の MDP において、$\varepsilon$-最適ポリシーを求めるサンプル複雑性は、$\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$ で上界が与えられ、エルーダー次元に線形に依存する。
- 決定的システムでは、提案されたアルゴリズムが $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$ のレグレットバウンドを達成し、時間枠や状態空間サイズに依存しない。
- ミニマックスレグレットは、ポリシー空間のリトルスタイン次元に比例する量によって下界が与えられ、根本的な限界を示している。
- ポリシー空間のエルーダー次元がサンプル複雑性を決定づける主要因であることが示され、状態空間や行動空間の濃度には依存しない。
- スタックベースの探索機構により、非最適ポリシー更新回数が $O((H+1)\mathrm{dim}_E(\Theta))$ でバウンドされ、効率的な学習が可能になる。
- 本研究は、時間枠や状態空間サイズに依存せず、ポリシー空間の内在的複雑性測度にのみ依存する、初めてのモデルフリーなサンプル複雑性バウンドを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。