[論文レビュー] Importance Sampling Policy Evaluation with an Estimated Behavior Policy
この論文では、オフポリシー評価に使用される同じデータセットから行動方策を推定する回帰重要度サンプリング(RIS)を提案する。これにより、重要度サンプリングにおける平均二乗誤差(MSE)が低減される。行動空間の尤度におけるサンプリング誤差を補正することで、RISは真の行動方策がマルコフ的であっても、特に大規模なサンプルと非マルコフ的行動方策推定において、通常の重要度サンプリングよりも低いMSEを達成する。
We consider the problem of off-policy evaluation in Markov decision processes. Off-policy evaluation is the task of evaluating the expected return of one policy with data generated by a different, behavior policy. Importance sampling is a technique for off-policy evaluation that re-weights off-policy returns to account for differences in the likelihood of the returns between the two policies. In this paper, we study importance sampling with an estimated behavior policy where the behavior policy estimate comes from the same set of data used to compute the importance sampling estimate. We find that this estimator often lowers the mean squared error of off-policy evaluation compared to importance sampling with the true behavior policy or using a behavior policy that is estimated from a separate data set. Intuitively, estimating the behavior policy in this way corrects for error due to sampling in the action-space. Our empirical results also extend to other popular variants of importance sampling and show that estimating a non-Markovian behavior policy can further lower large-sample mean squared error even when the true behavior policy is Markovian.
研究の動機と目的
- オフポリシー評価における重要度サンプリングの高分散およびサンプリング誤差を緩和すること。
- 同じデータセットから行動方策を推定することで、推定精度が向上するかどうかを調査すること。
- 真の方策がマルコフ的であっても、非マルコフ的行動方策推定が漸近的MSEを低減できるかどうかを評価すること。
- 通常の重要度サンプリングと比較して、RISの一貫性および低い漸近的分散を示すこと。
- RISを既存の分散低減技術と組み合わせた実用的利点を検討すること。
提案手法
- RISは、データセット $\mathcal{D}$ における各状態での実測行動頻度を用いて、同じデータセットから $\pi_{\mathcal{D}}$ を推定し、重要度サンプリングにおける真の $\pi_b$ を置き換える。
- 重要度重みは $\frac{\pi_e(a|s)}{\pi_{\mathcal{D}}(a|s)}$ として計算され、ここで $\pi_{\mathcal{D}}$ は $\mathcal{D}$ 内の観測された状態-行動頻度から推定される。
- RISは、$\mathcal{D}$ を用いて $\pi_{\mathcal{D}}$ を推定するとともに、重要度サンプリング推定を計算し、サンプリングに起因するバイアスを補正する。
- 現在の状態だけでなく、軌道セグメントに条件付けた非マルコフ的行動方策の拡張がなされる。
- さらなる改善のため、RISは制御変数、正規化された重み、クリッピングといった既存の分散低減技術と組み合わせられる。
- 理論的分析により、方策クラスに真の行動方策が含まれる場合、RISは一貫性があり、通常の重要度サンプリングよりも漸近的に低い分散を持つことが示される。
実験結果
リサーチクエスチョン
- RQ1同じデータセットから重要度サンプリング推定を行う際に、行動方策を推定することで、オフポリシー評価における平均二乗誤差(MSE)が低減するか?
- RQ2真の行動方策がマルコフ的であっても、非マルコフ的行動方策推定が、大規模なサンプルにおけるMSEをさらに低減できるか?
- RQ3離散的および連続的行動空間において、RISは通常の重要度サンプリングと比較してバイアス、分散、MSEの観点でどのように異なるか?
- RQ4標準的分散低減技術とRISを組み合わせた場合の影響は何か?
- RQ5RISは、真の行動方策を使用する場合と比較して、どのような条件下で低い漸近的分散を達成するか?
主な発見
- 真の行動方策がマルコフ的であっても、RISは通常の重要度サンプリング(OIS)と比較して一貫してMSEを低減する。
- 同じデータセットから行動方策を推定することで、行動空間尤度におけるサンプリング誤差が補正され、MSEが低減する。
- 非マルコフ的行動方策推定を用いたRISは、真の方策がマルコフ的であっても、大規模なサンプルにおけるMSEをさらに低減する。
- 推定方策クラスに真の行動方策が含まれる場合、RISは一貫性があり、OISよりも漸近的に低い分散を持つ。
- 本手法は、離散的および連続的行動空間の両方の環境で実証的に有効である。
- RISは既存の分散低減技術と相乗効果を示し、それらを組み合わせることでさらにMSEの低減が達成される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。