Skip to main content
QUICK REVIEW

[論文レビュー] Minimax Value Interval for Off-Policy Evaluation and Policy Optimization

Nan Jiang, Jiawei Huang|arXiv (Cornell University)|Feb 6, 2020
Advanced Causal Inference Techniques参考文献 38被引用数 14
ひとこと要約

本稿は、価値関数と重要度重み推定を統合した1つのフレームワークに統合した、オフポリシー評価のための統一されたミニマックス値区間を提案する。この区間は二重ロバスト性を備えており、価値関数または重み関数のいずれか一方の関数クラスが適切に定式化されていれば区間は有効であり、残りのものの不適合度が区間の長さによって測定される。本手法は、先行手法よりも一貫性があり、よりタイトな境界を提供し、データカバレッジの制限下でも原理的(principled)なポリシー最適化を可能にする。

ABSTRACT

We study minimax methods for off-policy evaluation (OPE) using value functions and marginalized importance weights. Despite that they hold promises of overcoming the exponential variance in traditional importance sampling, several key problems remain: (1) They require function approximation and are generally biased. For the sake of trustworthy OPE, is there anyway to quantify the biases? (2) They are split into two styles ("weight-learning" vs "value-learning"). Can we unify them? In this paper we answer both questions positively. By slightly altering the derivation of previous methods (one from each style; Uehara et al., 2020), we unify them into a single value interval that comes with a special type of double robustness: when either the value-function or the importance-weight class is well specified, the interval is valid and its length quantifies the misspecification of the other class. Our interval also provides a unified view of and new insights to some recent methods, and we further explore the implications of our results on exploration and exploitation in off-policy policy optimization with insufficient data coverage.

研究の動機と目的

  • 関数近似に基づくオフポリシー評価(OPE)手法におけるバイアスの定量的評価の欠如に対処すること。
  • 「重み学習」と「価値学習」の2つの主要なOPEパラダイムを、1つの一貫したフレームワークに統合すること。
  • 部分的なモデル不適合が生じても有効な値区間を提供すること。区間の幅は、もう一方の成分における不適合度を測定する。
  • データカバレッジが不十分な状況下でも、懐疑的(pessimism)および楽観的(optimism)の原則を活用して、オフポリシーのポリシー最適化を可能にするフレームワークを拡張すること。

提案手法

  • Liuら[5]とUeharaら[1]の2つの先行OPE手法を、共通の変分的定式化を通じて再解釈・統合し、ミニマックス値区間を導出する。
  • 価値関数と重要度重みを同時に学習する1つの最適化プログラムを用い、データの各成分を完全に活用する。
  • 価値関数とマージナライズド重要度重みの両方にベルマン方程式を適用し、真のリターンの双対表現を導出する。
  • 値関数と重み関数の上界・下界をミニマックス最適化により構築する:$\inf_w \sup_q L(w,q)$ および $\sup_w \inf_q L(w,q)$、ここで $L(w,q) = \mathbb{E}_w[r + \gamma q(s',\pi) - q(s,a)]$。
  • 価値関数または重み関数のどちらか一方の関数クラスが適切に定式化されていれば、区間が有効であり、区間幅が残りのものの不適合度誤差を測定することを確立する。
  • 定常分布および吸収状態を考慮したベルマン恒等式への適応により、平均報酬および有限時限MDDPへのフレームワークの拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1『重み学習』と『価値学習』という2つの主要なオフポリシー評価スタイルを、1つの一貫したフレームワークに統合できるか?
  • RQ2価値関数と重み関数の両方が不適合している場合でも、関数近似によって生じるバイアスを定量的に評価できるか?
  • RQ3区間が、価値関数または重み関数のどちらか一方が適切に定式化されていれば、モデル不適合度の意味のある測定値を提供するか?
  • RQ4ミニマックス区間を用いて、データカバレッジが不十分な状況下でのオフポリシーのポリシー最適化において、原理的(principled)な探索と活用戦略を導出できるか?

主な発見

  • 提案されたミニマックス値区間は、Liuら[5]とUeharaら[1]の2つの主要なOPE手法を、共通の変分的導出を通じて1つの一貫したフレームワークに統合した。
  • 区間は特別な形の二重ロバスト性を示す:価値関数または重み関数のどちらか一方の関数クラスが適切に定式化されていれば、区間は有効であり、区間幅は残りのものの不適合度誤差を測定する。
  • 区間は、個々の手法から得られる単純な境界よりも一般的にタイトである。これは、データのすべての成分を統合的最適化プログラムを通じて活用しているためである。
  • 定常分布および吸収状態を考慮したベルマン恒等式への適応により、フレームワークは平均報酬および有限時限MDDPに自然に拡張可能である。
  • ポリシークラス上で下界と上界を最適化することは、それぞれ懐疑的および楽観的の原則に対応し、データカバレッジが不十分な状況下でも信頼性の高いポリシー最適化を可能にする。
  • ブートストラップを用いた実験的評価により、理論的一般化境界が緩いにもかかわらず、統計誤差の適切な取り扱いが可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。