Skip to main content
QUICK REVIEW

[論文レビュー] Understanding the Curse of Horizon in Off-Policy Evaluation via Conditional Importance Sampling

Yao Liu, Pierre‐Luc Bacon|arXiv (Cornell University)|Oct 15, 2019
Advanced Causal Inference Techniques参考文献 36被引用数 8
ひとこと要約

本稿は、条件付き重要度サンプリングを用いた非政策評価の理論的分析を提供し、有限時horizon MDPにおける、逐次的・定常的重要度サンプリングが、一般に重要度サンプリング(vanilla IS)よりも分散を必ずしも低減しないことを示している。驚くべきことに、特定の条件下では、これらの推定器は粗いISよりも指数関数的に高い分散を示すことがあるが、漸近的には多項式的分散成長を達成できることから、長時間スケールの設定においてその実験的成功が説明できる。

ABSTRACT

Off-policy policy estimators that use importance sampling (IS) can suffer from high variance in long-horizon domains, and there has been particular excitement over new IS methods that leverage the structure of Markov decision processes. We analyze the variance of the most popular approaches through the viewpoint of conditional Monte Carlo. Surprisingly, we find that in finite horizon MDPs there is no strict variance reduction of per-decision importance sampling or stationary importance sampling, comparing with vanilla importance sampling. We then provide sufficient conditions under which the per-decision or stationary estimators will provably reduce the variance over importance sampling with finite horizons. For the asymptotic (in terms of horizon $T$) case, we develop upper and lower bounds on the variance of those estimators which yields sufficient conditions under which there exists an exponential v.s. polynomial gap between the variance of importance sampling and that of the per-decision or stationary estimators. These results help advance our understanding of if and when new types of IS estimators will improve the accuracy of off-policy estimation.

研究の動機と目的

  • 定性的に予想される理論的期待とは対照的に、非政策評価において、逐次的重要度サンプリング(SIS)および逐次的推定重要度サンプリング(PDIS)が分散を必ずしも低減しない理由を理解すること。
  • 拡張された条件付きモンテカルロ推定器の観点から、IS、PDIS、SISの間の関係を形式化すること。
  • 有限時horizon MDPにおいて、PDISおよびSISがvanilla ISよりも分散を明示的に低減する十分条件を導出すること。
  • IS、PDIS、SISの分散に対する漸近的上界および下界を確立し、時horizon Tに対する多項式的・指数的依存関係を示すこと。
  • 理論的知見と、長時間スケールの領域におけるSISの実験的成功を調和させるために、分散低減が発生する条件を同定すること。

提案手法

  • 異なる統計量(例:状態行動列、報酬)に条件付けたことで、IS、PDIS、SISを条件付きモンテカルロ推定器の具体例として形式化する。
  • 全分散の法則を適用して、条件付き推定器の分散を分析し、和項間の共分散のため、分散低減が保証されないことを示す。
  • MDPの構造と条件付き統計量の選択に基づいて、分散低減の十分条件を定理1および定理2で導出する。
  • マルティンゲールの集中不等式を用いて、一般状態空間下での3つの推定器の漸近的分散バウンドを導出する。
  • 漸近的分散成長率を比較し、特定の条件下でSISおよびPDISが時horizon Tに対して多項式的(例:O(T²))依存を示す一方、vanilla ISは指数的依存を示すことを示す。
  • バッチ設定における報酬に条件付けた推定器が、vanilla ISと同等であることを示し、オンライン学習とバッチ学習の間の差異を強調する。

実験結果

リサーチクエスチョン

  • RQ1有限時horizon MDPにおいて、逐次的推定重要度サンプリング(PDIS)が一般に重要度サンプリング(IS)よりも分散を低減する条件は何か?
  • RQ2定常的重要度サンプリング(SIS)は、PDISおよびISよりも分散を明示的に低減できるか? もしそうならば、その十分条件は何か?
  • RQ3理論的には分散が高くなるリスクがあるにもかかわらず、なぜ実験結果ではSISが長時間スケールの領域でISを上回るのか?
  • RQ4時horizon Tが増大するに従って、IS、PDIS、SISの漸近的分散挙動はどのように変化するか? また、成長率の観点からそれらを比較するとどうなるか?
  • RQ5異なる統計量(例:報酬、状態行動ペア)に条件付けた場合、非政策評価における重要度サンプリング推定器の分散にどのような影響を与えるか?

主な発見

  • 有限時horizon MDPにおいて、逐次的および定常的重要度サンプリングは、一般にvanilla ISよりも分散を低減しない。反例として、ISの方が分散が小さい場合がある。
  • 軌道の和における和項間の共分散のため、条件付き重要度サンプリング推定器の分散は、粗いISよりも低くなるとは限らない。
  • 定理1および定理2で、MDPの構造と条件付き統計量の選択に基づいた、PDISおよびSISにおける分散低減の十分条件が導出された。
  • 漸近的には、特定の条件下でSISの分散はO(T²)の割合で増加する一方、vanilla ISはTに指数関数的に依存するため、SISの長時間スケール設定における実験的成功が説明できる。
  • 系4では、やや強い仮定のもとで、SISの分散がPDISの分散よりも明示的に低いことが示され、SISの一部の領域における優位性に理論的根拠を与える。
  • バッチ設定における報酬に条件付けた推定器が、vanilla ISと同等であることが示され、このような条件付けがバッチ非政策評価において分散を本質的に低減しないことを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。