Skip to main content
QUICK REVIEW

[論文レビュー] Pessimistic Model-based Offline RL: PAC Bounds and Posterior Sampling under Partial Coverage

Masatoshi Uehara, W. Sun|arXiv (Cornell University)|Jul 13, 2021
Advanced Bandit Algorithms Research参考文献 62被引用数 6
ひとこと要約

本稿では、一般関数クラスにおける制約を用いて懐疑的価値推定を強制するモデルベースのオフライン強化学習アルゴリズムである制約付き懐疑的方策最適化(CPPO)を提案する。これにより、部分的カバレッジ下でもサンプル効率の高い学習が可能になる。さらに、明示的な懐疑的価値推定を回避するベイジアン事後分布サンプリング手法(PS-PO)を導入し、部分的カバレッジ下で期待値として多項式的サンプル複雑性を達成する。

ABSTRACT

We study model-based offline Reinforcement Learning with general function approximation. We present an algorithm named Constrained Pessimistic Policy Optimization (CPPO) which leverages a general function class and uses a constraint to encode pessimism. Under the assumption that the ground truth model belongs to our function class, CPPO can learn with the offline data only providing partial coverage, i.e., it can learn a policy that completes against any policy that is covered by the offline data, in polynomial sample complexity with respect to the statistical complexity of the function class. We then demonstrate that this algorithmic framework can be applied to many specialized Markov Decision Processes where the additional structural assumptions can further refine the concept of partial coverage. One notable example is low-rank MDP with representation learning where the partial coverage is defined using the concept of relative condition number measured by the underlying unknown ground truth feature representation. Finally, we introduce and study the Bayesian setting in offline RL. The key benefit of Bayesian offline RL is that algorithmically, we do not need to explicitly construct pessimism or reward penalty which could be hard beyond models with linear structures. We present a posterior sampling-based incremental policy optimization algorithm (PS-PO) which proceeds by iteratively sampling a model from the posterior distribution and performing one-step incremental policy optimization inside the sampled model. Theoretically, in expectation with respect to the prior distribution, PS-PO can learn a near optimal policy under partial coverage with polynomial sample complexity.

研究の動機と目的

  • 一般関数近似を用いて部分的カバレッジ下でもサンプル効率の高い学習を保証するモデルベースのオフライン強化学習アルゴリズムの開発。
  • 線形構造や明示的な報酬ペナルティに依存せずに、関数クラス内での懐疑的価値推定を制約によって形式化すること。
  • 表現学習と相対的条件数を用いて、低ランクMDPなどの特殊なMDPにフレームワークを拡張し、部分的カバレッジを洗練すること。
  • 明示的な懐疑的価値推定やペナルティ項を排除するベイジアンオフライン強化学習フレームワークの確立。
  • 部分的カバレッジ下で、頻度的およびベイジアンバージョンの両方に対してサンプル複雑性に関する理論的保証を提供すること。

提案手法

  • CPPOを提案。モデルクラス内の信頼領域に制限することで、方策更新に懐疑的価値推定を組み込む制約付き最適化フレームワーク。
  • 環境モデルを一般関数クラスで表現し、部分的カバレッジ下での懐疑的計画を保証するための制約を適用。
  • 未知の特徴表現を有する低ランクMDPに適用する際、部分的カバレッジを相対的条件数を用いて定式化。
  • 事後分布からモデルを繰り返しサンプリングし、その中で1ステップ分の方策最適化を実行するPS-POを導入。
  • ベイジアン推論を用いて懐疑的価値推定を暗黙的に表現し、明示的な報酬形状やペナルティ項を回避。
  • 事前分布の期待値として、CPPOおよびPS-POの両方の多項式的サンプル複雑性の境界を確立。

実験結果

リサーチクエスチョン

  • RQ1一般関数近似を用いて部分的カバレッジ下でもサンプル効率の高い学習を達成できるモデルベースのオフライン強化学習アルゴリズムは存在するか?
  • RQ2明示的な報酬ペナルティに依存せずに、非線形関数クラスに効果的に懐疑的価値推定を組み込む方法は何か?
  • RQ3低ランクMDPなどの構造的仮定(例:低ランクMDP)は、部分的カバレッジの概念をどのように洗練させ、サンプル効率を向上させ得るか?
  • RQ4ベイジアン推論を活用して、明示的な正則化を回避しつつ、オフライン強化学習で懐疑的価値推定を暗黙的に強制できるか?
  • RQ5頻度的およびベイジアンバージョンの両方に対して、部分的カバレッジ下でサンプル複雑性に関する理論的保証を提供できるか?

主な発見

  • CPPOは、真のモデルが関数クラスに含まれるという仮定の下で、任意のオフラインデータにカバーされる方策と競争可能な性能を達成する多項式的サンプル複雑性を達成する。
  • 未知の特徴表現の相対的条件数を用いて部分的カバレッジを定式化することで、低ランクMDPに一般化され、サンプル効率が向上する。
  • PS-POは、明示的な懐疑的価値推定や報酬ペナルティを回避するベイジアン代替手法として機能し、部分的カバレッジ下でほぼ最適な性能を達成する。
  • 理論的解析により、PS-POは事前分布の期待値として、近似的に最適な方策を多項式的サンプル複雑性で学習可能であることが示された。
  • CPPOおよびPS-POは、オフラインデータがすべての状態行動ペアをカバーしない場合でも、部分的カバレッジ下で理論的にサンプル効率が保証される。
  • メソドロジーのフレームワークは一般関数近似をサポートしており、線形モデルを超える多様なMDP構造に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。