Skip to main content
QUICK REVIEW

[論文レビュー] Bootstrapping Fitted Q-Evaluation for Off-Policy Inference

Botao Hao, Xiang Ji|arXiv (Cornell University)|Feb 6, 2021
Reinforcement Learning in Robotics参考文献 17被引用数 10
ひとこと要約

本稿では、オフポリシー推論のためのブートストラップFitted Q-Evaluation(FQE)手法を提案する。この手法により、漸近的に一貫した推定が可能となり、政策評価誤差の分布、信頼区間、分散、相関を推定できる。理論的一貫性と効率性を確立し、実行時間を1桁削減しながらも精度を維持するサブサンプリング版を導入している。

ABSTRACT

Bootstrapping provides a flexible and effective approach for assessing the quality of batch reinforcement learning, yet its theoretical property is less understood. In this paper, we study the use of bootstrapping in off-policy evaluation (OPE), and in particular, we focus on the fitted Q-evaluation (FQE) that is known to be minimax-optimal in the tabular and linear-model cases. We propose a bootstrapping FQE method for inferring the distribution of the policy evaluation error and show that this method is asymptotically efficient and distributionally consistent for off-policy statistical inference. To overcome the computation limit of bootstrapping, we further adapt a subsampling procedure that improves the runtime by an order of magnitude. We numerically evaluate the bootrapping method in classical RL environments for confidence interval estimation, estimating the variance of off-policy evaluator, and estimating the correlation between multiple off-policy evaluators.

研究の動機と目的

  • ポイント推定を超えた信頼性のある統計的推論をオフポリシー評価(OPE)で可能にする。
  • ブートストラップFQEが漸近的に一貫的かつ効率的であることを理論的に正当化し、誤差分布推定に適していることを示す。
  • ブートストラップにおける計算上のボトル neck を軽減するため、サブサンプリング手順を導入する。
  • 従属的なエピソードデータに対して、個々の遷移ではなくエピソード単位でのブートストラップがなぜ必要かを明らかにする。
  • 表形式、線形、ディープ強化学習の設定において、信頼区間推定、分散、相関推定の評価を実施する。

提案手法

  • FQE政策価値推定器の標本分布を推定するために、エピソード全体を再サンプリングするブートストラップFQE手法を提案する。
  • 理論的分析により、ブートストラップFQEの誤差分布が漸近的に一貫的であり、Cramér–Raoの下界と一致することが示された。これは漸近的効率性を示唆する。
  • 各ブートストラップ反復でエピソードのサブセットをサンプリングすることで、計算コストを1桁削減するサブサンプルドブートストラップ手順を導入する。
  • 時間的依存構造を保つために、個々の遷移ではなくエピソード単位でのリサンプリングを採用し、依存性を無視した不一致な誤差推定を回避する。
  • 表形式、連続的制御、医療シミュレーション環境における性能評価のため、線形関数近似とニューラルネットワークを用いる。
  • 被覆確率評価のため、10,000サンプルのモンテカルロロールアウトを用いて真の政策価値を計算する。

実験結果

リサーチクエスチョン

  • RQ1ブートストラップFQEは、FQE政策評価誤差の分布推定において漸近的に一貫しているか?
  • RQ2提案手法は漸近的効率性を達成しており、Cramér–Raoの下界と一致しているか?
  • RQ3サブサンプリングにより計算コストを1桁削減できるが、推定精度を損なわないか?
  • RQ4従属的なエピソードデータにおいて、なぜ遷移レベルのブートストラップではなくエピソードレベルのブートストラップが必要なのか?
  • RQ5本手法は、複数のオフポリシー評価器において、タイトな信頼区間の構築および分散・相関の推定にどの程度有効か?

主な発見

  • ブートストラップFQEは、FQE政策評価誤差の分布推定において漸近的に一貫しており、分布的一致性に関する理論的保証がある。
  • FQEの漸近的分散はCramér–Raoの下界と一致しており、線形関数近似下でFQEが漸近的に効率的であることが確認された。
  • サブサンプルドブートストラップにより実行時間が1桁短縮されたが、信頼区間被覆率および分散推定の精度は高い水準を維持した。
  • エピソード単位のブートストラップは一貫した誤差分布推定をもたらすが、遷移単位のブートストラップは依存性を無視するため、分散および信頼区間推定が不一致となる。
  • Cliff Walking、MountainCar、Taxiを含む複数の環境において、ブートストラップ信頼区間の被覆確率は名目水準(例:90%)に近く、実証的に妥当である。
  • 有限サンプルサイズ下でも、ブートストラップFQEによる分散および相関推定は精度が高く、バイアスが小さく、信頼区間がタイトである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。