Skip to main content
QUICK REVIEW

[論文レビュー] Exponential Lower Bounds for Batch Reinforcement Learning: Batch RL can be Exponentially Harder than Online RL

Andrea Zanette|arXiv (Cornell University)|Dec 14, 2020
Reinforcement Learning in Robotics参考文献 55被引用数 18
ひとこと要約

この論文は、線形関数近似設定におけるバッチ強化学習(RL)に対して、指数的である情報理論的下界を確立している。これは、正確な報酬、遷移、最適なデータ分布が与えられても、バッチRLがオンラインRLよりも指数的に難しいことを示している。主な結果は、バッチ学習とオンライン学習の間で指数的分離が生じることであり、実現可能性や正確なフィードバックという強い仮定のもとでも、オフラインデータのみを用いて近似的に最適な方策を学習するか、目標方策を評価することは根本的に制限されていることを示している。

ABSTRACT

Several practical applications of reinforcement learning involve an agent learning from past data without the possibility of further exploration. Often these applications require us to 1) identify a near optimal policy or to 2) estimate the value of a target policy. For both tasks we derive \emph{exponential} information-theoretic lower bounds in discounted infinite horizon MDPs with a linear function representation for the action value function even if 1) \emph{realizability} holds, 2) the batch algorithm observes the exact reward and transition \emph{functions}, and 3) the batch algorithm is given the \emph{best} a priori data distribution for the problem class. Our work introduces a new `oracle + batch algorithm' framework to prove lower bounds that hold for every distribution. The work shows an exponential separation between batch and online reinforcement learning.

研究の動機と目的

  • バッチ強化学習(RL)が、強い仮定のもとでもオンラインRLに比べて根本的に制限されているかどうかを調査すること。
  • 最良のデータ分布が与えられた場合に、バッチアルゴリズムが近似的に最適な方策を効率的に学習できるかどうか、または目標方策を評価できるかどうかを特定すること。
  • 実現可能性と正確なフィードバックのもとで、すべてのバッチデータ分布に対して成り立つ情報理論的下界を確立すること。
  • 無限時間ホライズンMDPにおいて線形関数近似の設定で、バッチ学習とオンライン学習の間の指数的分離を示すこと。
  • 分布に依存しない強い下界を導出するための、新規な「オラクル+バッチアルゴリズム」フレームワークを形式化すること。

提案手法

  • オラクルが事前に最良のデータ分布を選択し、バッチアルゴリズムがそのデータから学習するという「オラクル+バッチアルゴリズム」フレームワークを導入する。
  • 1つの重要な状態と線形パラメータ化された価値関数を持つMDPの族を構築し、困難なインスタンスを生成する。
  • 行動空間における超球面のキャップを用いて、未知の最適方策の方向性を符号化し、十分なサンプルが得られない限り同定が困難になるようにする。
  • 任意の単位ベクトルに対して、少なくとも1つの標準基底ベクトルとの内積が $1/\sqrt{d}$ 以上であることを示す補助補題を活用し、最適行動の検出を可能にする。
  • 任意のバッチアルゴリズムが、$1/\sqrt{d}$ の部分最適性ギャップを達成するには指数的多くのクエリを必要とする、という下界を証明する。
  • 正確なフィードバックと最適なデータが与えられても、バッチアルゴリズムは指数的サンプル複雑性がなければ、正しい方策や価値関数を信頼性を持って同定できないことを示す。

実験結果

リサーチクエスチョン

  • RQ1最良のデータ分布が与えられ、正確なフィードバックと実現可能性がある状況でも、バッチRLは近似的に最適な方策の学習を効率的に行えるか?
  • RQ2線形関数近似の設定において、バッチ学習とオンライン学習の間に根本的な指数的ギャップが存在するか?
  • RQ3すべてのデータ分布に対して成り立つ情報理論的下界を確立できるか、最悪ケースに限定されないか?
  • RQ4行動空間の構造(例:超球面のキャップ)が、方策同定やオフポリシーァセスメントにおける本質的困難さを引き起こすか?
  • RQ5オラクルフレームワークを用いて、データ分布に依存しない強い下界を証明できるか?

主な発見

  • この論文は、正確な報酬関数や遷移関数へのアクセスがある場合でも、バッチRLにおけるオフポリシー評価と最良方策同定の両方に対して指数的下界を確立している。
  • 最良の事前データ分布が与えられても、バッチアルゴリズムは特徴次元 $d$ に関して指数的多くのサンプルを必要とし、$1/\sqrt{d}$ の部分最適性ギャップを達成する必要がある。
  • 下界は実現可能性と正確なフィードバックのもとで成り立つため、モデルの誤指定やデータノイズによる困難さではないことが示されている。
  • オンラインアルゴリズムが適応的にクエリを発行することで、多項式時間で最適方策を同定できることを示すことで、バッチ学習とオンライン学習の間の指数的分離が証明されている。
  • 結果として、強い仮定のもとでも、オフラインデータの情報理論的制限が根本的であるため、一般にバッチRLは効率化できないことが示唆されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。