Skip to main content
QUICK REVIEW

[論文レビュー] Nearly Minimax Optimal Reward-free Reinforcement Learning

Zihan Zhang, Simon S. Du|arXiv (Cornell University)|Oct 12, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 10
ひとこと要約

本稿では、計画時間 H に対して対数的に依存するようにスケーリングすることで、最小最大最適に近いサンプル複雑度を達成する、報酬フリー強化学習の新規アルゴリズム SSTP を提案する。これは、根本的な下界まで対数的要因の差異を除き一致する。本手法は段階的サンプリングとソフト・トレントレーテッド計画を用い、最小限のデータで任意の報酬関数に対して効率的に探索と計画を実行し、報酬フリー RL における上界と下界の長年のギャップを解消する。

ABSTRACT

We study the reward-free reinforcement learning framework, which is particularly suitable for batch reinforcement learning and scenarios where one needs policies for multiple reward functions. This framework has two phases. In the exploration phase, the agent collects trajectories by interacting with the environment without using any reward signal. In the planning phase, the agent needs to return a near-optimal policy for arbitrary reward functions. We give a new efficient algorithm, extbf{S}taged extbf{S}ampling + extbf{T}runcated extbf{P}lanning (\algoname), which interacts with the environment at most $O\left( \frac{S^2A}{ε^2} ext{poly}\log\left(\frac{SAH}ε ight) ight)$ episodes in the exploration phase, and guarantees to output a near-optimal policy for arbitrary reward functions in the planning phase. Here, $S$ is the size of state space, $A$ is the size of action space, $H$ is the planning horizon, and $ε$ is the target accuracy relative to the total reward. Notably, our sample complexity scales only \emph{logarithmically} with $H$, in contrast to all existing results which scale \emph{polynomially} with $H$. Furthermore, this bound matches the minimax lower bound $Ω\left(\frac{S^2A}{ε^2} ight)$ up to logarithmic factors. Our results rely on three new techniques : 1) A new sufficient condition for the dataset to plan for an $ε$-suboptimal policy; 2) A new way to plan efficiently under the proposed condition using soft-truncated planning; 3) Constructing extended MDP to maximize the truncated accumulative rewards efficiently.

研究の動機と目的

  • 報酬フリー強化学習における既存の上界と最小最大下界の根本的ギャップ、特に計画時間 H に多項式的に依存する点を解消すること。
  • 理論的最小値に近いサンプル複雑度を達成するアルゴリズムの開発、特に Ω(S²A/ε²) の下界まで対数的要因を除き一致させること。
  • 長時間スケジューリング環境におけるスケーラビリティを妨げてきた、サンプル複雑度における多項式的 H 依存性の排除。
  • 一様に有界な報酬の仮定を緩和し、全有界性(total boundedness)にまで緩和することで、実世界のシナリオへの適用範囲を拡大すること。
  • 切断価値関数を用いた新たな理論枠組みを提供し、不確実性下でのデータセットの十分性と効率的計画を実現すること。

提案手法

  • 状態行動訪問カバレッジと信頼区間に基づく、ε-最適方策の計画を可能にするデータセットの新たな十分条件を導入する。
  • 高いカバレッジを持つ状態行動ペアを優先しつつ、切断報酬による過大評価の上限を設定する、ソフト・トレントレーテッド計画メカニズムを設計する。
  • 切断累積報酬を最大化する拡張 MDP を構築し、不確実性下での効率的探索と計画を可能にする。
  • 段階的サンプリングと適応的エピソードスケジューリングを実装し、各段階で状態行動ペアの最小訪問閾値を増加させる。
  • Hoeffding 型不等式から導かれる境界を用いた、信頼区間に基づく探索戦略を採用し、カバレッジと推定精度のバランスを取る。
  • 価値関数差分の再帰的分解を活用し、訪問重み付き信頼区間で表されるサブオプティマルギャップをバインドする。

実験結果

リサーチクエスチョン

  • RQ1報酬フリー RL のサンプル複雑度を、対数的スケーリングを越えて計画時間 H に依存させないことは可能か?
  • RQ2報酬関数の仮定を緩和しつつ、報酬フリー RL で最小最大最適性を達成することは可能か?
  • RQ3どのようなデータセットの条件が、任意の報酬関数に対して ε-最適方策の計画を可能にするか?
  • RQ4報酬信号なしにデータ収集が行われた場合、不確実性下で計画をどのように効率的かつロバストに実行できるか?
  • RQ51つのデータセットが、最小限のサンプルオーバーヘッドで複数の任意の報酬関数に対して近似的に最適な方策をサポートできるか?

主な発見

  • 提案された SSTP アルゴリズムは、高確率で O((SA/ε²)(S + log(1/δ)) · polylog(SAH/ε)) のサンプル複雑度を達成し、最小最大下界 Ω(S²A/ε²) まで対数的要因を除き一致する。
  • サンプル複雑度は計画時間 H に対して対数的に依存するが、先行研究が多項式的(例:H³ または H⁵)に依存するのとは対照的に、指数的改善を実現する。
  • 報酬フィードバックなしにデータ収集が行われた後でも、非負で全有界性(1未満)を満たす任意の報酬関数に対して、ε-最適方策を保証する。
  • 一様有界性の仮定を排除し、実際の状況に適した全有界性のみを要件とする点で、先行研究を改善する。
  • 理論的分析により、アルゴリズムのサブオプティマルギャップが O(K²ε) でバインドされ、提案された信頼区間フレームワーク下でタイトであることが確認された。
  • ソフト・トレントレーテッド計画メカニズムにより、価値関数推定における過大評価に対するロバスト性が確保され、1つのデータセットから安定的かつ効率的な方策導出が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。