Skip to main content
QUICK REVIEW

[論文レビュー] A Variant of the Wang-Foster-Kakade Lower Bound for the Discounted Setting

Philip Amortila, Nan Jiang|arXiv (Cornell University)|Nov 2, 2020
Reinforcement Learning in Robotics参考文献 1被引用数 9
ひとこと要約

本稿は、割引設定下でのバッチ強化学習において、線形的実現可能な価値関数と良好な特徴量カバレッジがあるにもかかわらず、無限のサンプル複雑性を示す単純化された2状態、1次元特徴のMDPを提示する。この構成により、未観測の状態-行動ペアのため、無限のデータがあっても最適方策の学習が根本的になされないことが示され、バッチRLにおける仮定が揺るがされる。

ABSTRACT

Recently, Wang et al. (2020) showed a highly intriguing hardness result for batch reinforcement learning (RL) with linearly realizable value function and good feature coverage in the finite-horizon case. In this note we show that once adapted to the discounted setting, the construction can be simplified to a 2-state MDP with 1-dimensional features, such that learning is impossible even with an infinite amount of data.

研究の動機と目的

  • 割引設定下でのバッチ強化学習において、線形的実現可能な価値関数がある場合でも、無限のサンプル複雑性を示すことを目的とする。
  • Wangら(2020年)の有限ホライズン下界構成を、割引設定下の最小限の2状態、1次元特徴MDPに簡略化することを目的とする。
  • 割引設定下のバッチ強化学習において、良好な特徴量カバレッジと価値関数の実現可能性が学習可能性を保証しないことを示すこと。
  • 有限ホライズンと割引設定の強化学習設定が構造的に類似しているという一般的な信念に挑戦すること。

提案手法

  • 2つの状態 s_A と s_B を持つ決定的MDPを構築:s_A は報酬0で s_B に遷移し、s_B は自己ループで報酬 r を得る。
  • φ(s_A) = γ および φ(s_B) = 1 となる1次元特徴マップを定義し、価値関数の線形的実現可能性を保証する。
  • データ分布が s_A の遷移のみをサンプリングするバッチデータ分布を用いるため、s_B は観測されない。
  • データ分布下での特徴共分散行列が固有値 γ² > 0 を持つことを証明し、カバレッジ仮定を満たすことを示す。
  • 真の報酬 r が学習者にとって未知であるため、無限のデータがあってもQ値推定が不可能であることを示す。
  • d次元特徴および複数の行動を有する制御可能な設定にこの構成を拡張し、結果を一般化する。

実験結果

リサーチクエスチョン

  • RQ1最小限のMDP構成が、割引設定下でのバッチ強化学習における無限のサンプル複雑性を示せるか?
  • RQ2線形的実現可能性と良好な特徴量カバレッジがあっても、割引設定下では依然として学習可能性が保証されないか?
  • RQ3Wang ら(2020年)の有限ホライズン下界構成は、割引設定下で簡略化可能であり、同時に下界の硬さを失わないか?
  • RQ4構造的類似性があるにもかかわらず、有限ホライズンと割引設定の強化学習設定は根本的に異なる学習複雑性を示すか?
  • RQ5複数の行動を有する制御可能なMDPに下界を拡張しても、学習の不可能性が保たれるか?

主な発見

  • 任意の割引率 γ ∈ (0,1) を持つ1次元特徴の2状態MDPは、バッチ強化学習において無限のサンプル複雑性を示す。
  • 価値関数の線形的実現可能性と、固有値 γ² > 0 を持つ特徴共分散行列があるにもかかわらず、真の報酬 r はデータから同定不可能である。
  • s_B からの観測が欠如しているため、無限のデータがあっても s_A や s_B の真の価値を学習者が特定できない。
  • d次元特徴への拡張では、特徴カバレッジが Θ(1/d) に比例するが、誤差は依然として Ω(1) のままである。
  • 2つの行動を有する s_A における制御可能な設定では、最適Q値は真の値から任意に離れているため、方策学習は不可能である。
  • この結果により、有限ホライズンと割引設定の強化学習設定が相互に交換可能であるという仮定が揺るがされ、両者の学習複雑性に根本的な違いがあることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。