Skip to main content
QUICK REVIEW

[論文レビュー] On Well-posedness and Minimax Optimal Rates of Nonparametric Q-function Estimation in Off-policy Evaluation

Xiaohong Chen, Zhengling Qi|arXiv (Cornell University)|Jan 17, 2022
Advanced Causal Inference Techniques被引用数 5
ひとこと要約

この論文は、ベルマン方程式を用いてオフポリシー評価における非パラメトリックQ関数推定を非パラメトリックインスツルメンタル変数(NPIV)問題に再定式化することで、非パラメトリックQ関数推定における最初のミニマックス最適レートを確立した。弱い条件のもとで適切に定義されていることが示され、古典的な非パラメトリック回帰(Stone, 1982)と同一の$L^2$-ノルム収束レートが得られ、ホルダー空間およびソボレフ空間に属するQ関数に対して、スクリーニング2段階最小二乗推定量が、スレートノルムおよび$L^2$-ノルムの両方でこれらの最適レートを達成する。

ABSTRACT

We study the off-policy evaluation (OPE) problem in an infinite-horizon Markov decision process with continuous states and actions. We recast the $Q$-function estimation into a special form of the nonparametric instrumental variables (NPIV) estimation problem. We first show that under one mild condition the NPIV formulation of $Q$-function estimation is well-posed in the sense of $L^2$-measure of ill-posedness with respect to the data generating distribution, bypassing a strong assumption on the discount factor $γ$ imposed in the recent literature for obtaining the $L^2$ convergence rates of various $Q$-function estimators. Thanks to this new well-posed property, we derive the first minimax lower bounds for the convergence rates of nonparametric estimation of $Q$-function and its derivatives in both sup-norm and $L^2$-norm, which are shown to be the same as those for the classical nonparametric regression (Stone, 1982). We then propose a sieve two-stage least squares estimator and establish its rate-optimality in both norms under some mild conditions. Our general results on the well-posedness and the minimax lower bounds are of independent interest to study not only other nonparametric estimators for $Q$-function but also efficient estimation on the value of any target policy in off-policy settings.

研究の動機と目的

  • 連続的な状態と行動を有する無限ホライズンMDPにおける非パラメトリックQ関数推定のミニマックス下界を確立すること。
  • 先行研究が強い割引率仮定に依存するのを回避するため、弱い正則性条件のもとで$L^2$-測度における適切さ(well-posedness)を証明すること。
  • スレートノルムおよび$L^2$-ノルムの両方でミニマックス最適収束レートを達成するスクリーニング2段階最小二乗推定量を開発すること。
  • Q推定にとどまらず、ポリシー価値や重要度重み推定を含む他のオフポリシー推定量に対しても適用可能な一般理論的ツール—適切さとミニマックス下界—を提供すること。

提案手法

  • ベルマン方程式を用いて、オフポリシーQ関数推定を非パラメトリックインスツルメンタル変数(NPIV)問題に再定式化する。
  • 強い割引率($\gamma$)制約を回避するため、弱い条件下でNPIV定式化の$L^2$-測度における適切さを確立する。
  • スレートノルムおよび$L^2$-ノルムにおけるQ関数およびその導関数推定のミニマックス下界を導出し、古典的非パラメトリック回帰レート(Stone, 1982)と一致することを示す。
  • Bスプラインやウェーブレットなどの基底関数を用いてQ関数を近似するスクリーニング2段階最小二乗(2SLS)推定量を提案する。
  • 弱い正則性条件下で、導出されたミニマックス下界に一致することを示すことにより、スクリーニング2SLS推定量のレート最適性を確立する。
  • 依存的な時系列データ設定における推定誤差の高確率バインドを制御するため、行列ベルンシュタインの不等式およびベルビーのカップリング補題を適用する。

実験結果

リサーチクエスチョン

  • RQ1強力な割引率$\gamma$に関する仮定を必要とせず、$L^2$-測度の意味でオフポリシー評価における非パラメトリックQ関数推定が適切に定義される条件は何か?
  • RQ2連続的な状態と行動を有する一般のMDPにおいて、スレートノルムおよび$L^2$-ノルムの両方で、Q関数およびその導関数の非パラメトリック推定のミニマックス最適収束レートは何か?
  • RQ3スクリーニング2段階最小二乗推定量は、オフポリシー設定におけるQ関数推定でこれらのミニマックス最適レートを達成できるか?
  • RQ4導出されたミニマックス下界は、古典的非パラメトリック回帰レートとどのように比較されるか?これは、オフポリシーQ推定の本質的難易度に何を示唆するか?
  • RQ5適切さとミニマックス結果は、ポリシー価値や重要度重み推定を含む他のオフポリシー推定問題へどの程度一般化可能か?

主な発見

  • Q関数推定のNPIV定式化は、弱い正則性条件下で$L^2$-測度の意味で適切に定義されており、先行研究で見られる強い割引率($\gamma$)制約を排除できる。
  • スレートノルムおよび$L^2$-ノルムにおけるQ関数推定のミニマックス下界が、古典的非パラメトリック回帰(Stone, 1982)のものと同一であることが示され、オフポリシーQ推定が最悪のレートの意味で標準的な非パラメトリック回帰よりも難しいわけではないことを示唆する。
  • 提案されたスクリーニング2段階最小二乗推定量は、スレートノルムおよび$L^2$-ノルムの両方でミニマックス最適レートを達成する。Bスプラインおよびウェーブレット推定量は、ホルダークラスに属するQ関数に対してスレートノルム下界に一致する。
  • ソボレフクラスに属するQ関数に対しては、多項式、コサイン関数、スプライン、ウェーブレットなど、多くの線形スクリーニング推定量が$L^2$-ノルムのミニマックス下界に一致する。
  • 弱い条件下で導出された$L^2$-ノルム収束レートは、効率的推定およびターゲットポリシー価値に関する最適推論に十分である。
  • 一般の適切さおよびミニマックス下界の結果は、独立しての価値が高く、ポリシー価値推定や周辺重要度重み推定を含む他のオフポリシー推定問題へも拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。