Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Feature Selection Makes Batch Reinforcement Learning More Sample Efficient

Botao Hao, Yaqi Duan|arXiv (Cornell University)|Nov 8, 2020
Advanced Bandit Algorithms Research参考文献 61被引用数 10
ひとこと要約

本稿では、バッチ強化学習におけるスパース特徴選択をLassoとグループLassoを用いて提案し、サンプル効率を向上させることを目的としている。関連する特徴に焦点を当てることで、有限サンプル誤差バウンドが、元の環境次元ではなく関連特徴の数に線形に依存するようになり、高次元設定下でのサンプル複雑性を顕著に低減する。

ABSTRACT

This paper provides a statistical analysis of high-dimensional batch Reinforcement Learning (RL) using sparse linear function approximation. When there is a large number of candidate features, our result sheds light on the fact that sparsity-aware methods can make batch RL more sample efficient. We first consider the off-policy policy evaluation problem. To evaluate a new target policy, we analyze a Lasso fitted Q-evaluation method and establish a finite-sample error bound that has no polynomial dependence on the ambient dimension. To reduce the Lasso bias, we further propose a post model-selection estimator that applies fitted Q-evaluation to the features selected via group Lasso. Under an additional signal strength assumption, we derive a sharper instance-dependent error bound that depends on a divergence function measuring the distribution mismatch between the data distribution and occupancy measure of the target policy. Further, we study the Lasso fitted Q-iteration for batch policy optimization and establish a finite-sample error bound depending on the ratio between the number of relevant features and restricted minimal eigenvalue of the data's covariance. In the end, we complement the results with minimax lower bounds for batch-data policy evaluation/optimization that nearly match our upper bounds. The results suggest that having well-conditioned data is crucial for sparse batch policy learning.

研究の動機と目的

  • 標準的手法がサンプル効率に劣るために、高次元状態空間におけるバッチ強化学習の課題に対処すること。
  • 特徴表現におけるスパarsityを活用することで、オフポリシー方策評価(OPE)およびバッチ方策最適化における次元の呪いを克服すること。
  • 多数の候補特徴から関連する特徴のみを選択することで、理論的裏付けをもったサンプル効率の良い学習法を開発すること。
  • 分布マッチングと特徴スパarsityに依存する、インスタンス依存の鋭い誤差バウンドを確立すること。
  • スパarsity仮定の下で、提案手法の統計的最適性を検証するためのミニマックス下界を提供すること。

提案手法

  • オフポリシー評価における価値関数推定にL1正則化線形回帰を適用するLasso Fitted Q-Evaluation(Lasso-FQE)を提案し、特徴選択におけるスパarsityを促進する。
  • モデル選択後にグループLassoを用いて特徴を選択する後処理推定器を導入し、Lassoバイアスを低減し、推定精度を向上させる。
  • 選択された特徴部分空間に制限された、行動データとターゲットポリシーの占有測度の間の分布マッチングを測る分散関数を定義する。
  • バッチ方策最適化のためのLasso Fitted Q-Iterationを分析し、関連特徴の数とデータの共分散行列の制限付き最小固有値の比に依存する誤差バウンドを導出する。
  • 適応的特徴選択の下で推定誤差の高確率バウンドを導出するため、新規の集中不等式とマルティンググールド・アーギュメントを用いる。
  • スパースバッチRLのためのミニマックス下界を確立し、上界とほぼ一致させることで、提案手法の統計的最適性を確認する。

実験結果

リサーチクエスチョン

  • RQ1スパース特徴選択は、高次元バッチ強化学習におけるサンプル効率を向上させることができるか?
  • RQ2正則化の選択(Lasso対グループLasso)は、オフポリシー方策評価における推定バイアスと誤差にどのように影響するか?
  • RQ3行動ポリシーとターゲットポリシー間の分布マッチングの不一致は、OPE誤差にどの程度影響を及ぼし、特徴選択によって緩和可能か?
  • RQ4データの共分散行列の制限付き最小固有値は、スパース方策学習のサンプル複雑性を決定する上で果たす役割は何か?
  • RQ5提案された上界は統計的にタイトであるか、根本的な下界と比較してどうなるか?

主な発見

  • Lasso Fitted Q-Evaluation法は、有限サンプル誤差バウンドが関連特徴の数と制限付き最小固有値に線形に依存し、環境次元dに多項式依存がないことを示した。
  • グループLassoを用いた後処理推定器は、縮小された特徴空間における分布マッチングを測る分散関数に依存する、より鋭いインスタンス依存誤差バウンドを達成した。
  • 選択された特徴空間における分散項は、全空間におけるものよりも顕著に小さいことが示され、スパース特徴選択が分布マッチングを低減することを示した。
  • バッチ方策最適化において、方策誤差のℓ∞-ノルムは、関連特徴の数とデータの共分散行列の制限付き最小固有値の比に線形に依存する。
  • ミニマックス下界は上界とほぼ一致しており、スパarsityおよび良好に条件付けられたデータの仮定の下で、提案手法が統計的に最適であることを確認した。
  • 結果として、良好に条件付けられたデータ(有利な制限付き最小固有値を特徴とする)が、スパースバッチ方策学習におけるサンプル効率にとって不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。