Skip to main content
QUICK REVIEW

[論文レビュー] Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage

Masatoshi Uehara, W. Sun|arXiv (Cornell University)|Jul 13, 2021
Advanced Bandit Algorithms Research参考文献 65被引用数 6
ひとこと要約

本稿では、制約を用いて懐疑的学習を強制することで、部分的カバレッジのオフラインデータ下でも近似的に最適な性能を達成するモデルベースのオフライン強化学習アルゴリズムである制約付き懐疑的方策最適化(CPPO)を提案する。真のモデルが一般関数クラスに属する場合、および比較方策がオフラインデータ分布にカバーされている場合に、多項式的サンプル複雑性の保証が得られる。

ABSTRACT

We study model-based offline Reinforcement Learning with general function approximation without a full coverage assumption on the offline data distribution. We present an algorithm named Constrained Pessimistic Policy Optimization (CPPO)which leverages a general function class and uses a constraint over the model class to encode pessimism. Under the assumption that the ground truth model belongs to our function class (i.e., realizability in the function class), CPPO has a PAC guarantee with offline data only providing partial coverage, i.e., it can learn a policy that competes against any policy that is covered by the offline data. We then demonstrate that this algorithmic framework can be applied to many specialized Markov Decision Processes where additional structural assumptions can further refine the concept of partial coverage. Two notable examples are: (1) low-rank MDP with representation learning where the partial coverage condition is defined using a relative condition number measured by the unknown ground truth feature representation; (2) factored MDP where the partial coverage condition is defined using density ratio based concentrability coefficients associated with individual factors.

研究の動機と目的

  • 非探索的行動方策を伴う現実世界のシナリオにおいて適用範囲が制限される、オフライン強化学習における完全なデータカバレッジの制限を克服すること。
  • 従来のオフライン強化学習手法が強いベルマン完備性および完全カバレッジの仮定に依存するのを緩和し、部分的カバレッジを持つデータセットからの学習を可能にすること。
  • マルコフ的でない、または履歴依存の任意の方策に対しても、オフラインデータ分布にカバーされる方策と競合できる一般化されたアルゴリズムフレームワークの構築。
  • 懐疑的学習の明示的構築を回避するため、事後分布サンプリングを用いることでベイジアンオフライン強化学習へのフレームワークの拡張。
  • 真のモデルが一般関数クラスに実現可能であり、部分的カバレッジ下でも多項式的サンプル複雑性の理論的保証を提供すること。

提案手法

  • 行動方策の低カバレッジの行動を避けるために、方策更新を制約することで懐疑的学習を強制する、制約付き最適化フレームワークであるCPPOを提案する。
  • モデルに一般関数クラスを用い、オフラインデータ分布における密度が低い行動に対してペナルティを課す制約を適用する。
  • 低ランクMDPにおける表現学習において、部分的カバレッジを特徴表現の相対的条件数を用いて定式化する。
  • 繰り返し事後分布からモデルをサンプリングし、段階的方策最適化を実行する、ベイジアンオフライン強化学習のための後続サンプリングベースのアルゴリズムPS-POを導入する。
  • 一般化誤差を部分的カバレッジ下で制御するため、関数型ベルンシュタイン不等式と分布シフト補題を用いて理論的バインディングを確立する。
  • 行列濃度不等式とSVD分解を用いて、比較方策と行動方策間の状態行動分布シフト比を分析する。

実験結果

リサーチクエスチョン

  • RQ1完全なデータカバレッジを必要とせず、オフラインデータ分布にカバーされる任意の方策と競合できる方策を学習することは可能か?
  • RQ2明示的な報酬形状付けを用いずに、制約を用いてモデルベースのオフライン強化学習における懐疑的学習を効果的に表現できるか?
  • RQ3アルゴリズムフレームワークは、明示的な懐疑的構築を回避するため、ベイジアンオフライン強化学習に拡張可能か?
  • RQ4真のモデルが一般関数クラスに実現可能である場合、部分的カバレッジ下での学習のサンプル複雑性はどの程度か?
  • RQ5低ランクMDPのような構造的仮定は、部分的カバレッジの概念をどのように精緻化し、一般化性能を向上させるか?

主な発見

  • CPPOは、モデル実現可能性と部分的カバレッジ下で、オフラインデータにカバーされる任意の比較方策と競合する方策の学習において、多項式的サンプル複雑性を達成する。
  • ベイジアン設定下では、明示的な懐疑的学習や報酬ペナルティを必要とせず、事前分布に関する期待値で近似的に最適な性能を保証する。
  • 低ランクMDPでは、部分的カバレッジが未知の真の特徴表現の相対的条件数を用いて定式化され、よりタイトな一般化バインディングが可能になる。
  • 理論的分析により、比較方策と行動方策間の分布シフト比が特徴表現の条件数によって有界であることが示され、安定性が保証される。
  • PS-POにおける事後分布サンプリングの使用により、明示的な懐疑的構築の必要性が回避され、線形モデルを超えるアルゴリズム設計が簡素化される。
  • 関数型ベルンシュタイン不等式と分布シフト補題を用いて一般化誤差をバインドし、部分的カバレッジ下でも収束を保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。