Skip to main content
QUICK REVIEW

[論文レビュー] Accountable Off-Policy Evaluation With Kernel Bellman Statistics

Yihao Feng, Tongzheng Ren|arXiv (Cornell University)|Aug 15, 2020
Machine Learning and Algorithms参考文献 46被引用数 7
ひとこと要約

本稿では、カーネルベルマン統計を用いて、既知の行動方策を必要とせず、高い分散に苦しむことなく、きつい、証明可能な信頼区間を構築するための変分枠組みを提案する。再生核ヒルバート空間(RKHS)内でのカーネルベルマン損失の境界に基づく、真のQ関数を含む可能性の高いQ関数の妥当集合を最適化することで、計算的に効率的で高信頼性の境界が得られ、既存の推定器の事後診断が可能になる。従来の重要度サンプリングに比べ、安定性と正確性の両面で優れている。

ABSTRACT

We consider off-policy evaluation (OPE), which evaluates the performance of a new policy from observed data collected from previous experiments, without requiring the execution of the new policy. This finds important applications in areas with high execution cost or safety concerns, such as medical diagnosis, recommendation systems and robotics. In practice, due to the limited information from off-policy data, it is highly desirable to construct rigorous confidence intervals, not just point estimation, for the policy performance. In this work, we propose a new variational framework which reduces the problem of calculating tight confidence bounds in OPE into an optimization problem on a feasible set that catches the true state-action value function with high probability. The feasible set is constructed by leveraging statistical properties of a recently proposed kernel Bellman loss (Feng et al., 2019). We design an efficient computational approach for calculating our bounds, and extend it to perform post-hoc diagnosis and correction for existing estimators. Empirical results show that our method yields tight confidence intervals in different settings.

研究の動機と目的

  • 重要度サンプリングの限界、特に高い分散と既知の行動方策への依存を是正すること。
  • オフポリシーデータを用いて、政策のパフォーマンス推定のためのきつい、厳密な信頼区間を構築すること。
  • 同じフレームワークを用いて、既存のオフポリシー推定器の事後診断と補正を可能にすること。
  • 密度比推定を回避することで、長時間スケールのMDPにおける「時間枠の呪い」を克服すること。
  • 行動方策の明示的知識を必要としない、行動方策に依存しない手法を提供すること。

提案手法

  • 真のQ関数を高確率で含むQ関数の妥当集合を最適化する問題として、オフポリシー評価を定式化する。
  • カーネルベルマン損失(Feng et al., 2019)を用いて、候補となるQ関数が真のベルマン方程式からどれだけ逸脱しているかを制約する統計的制約を定義する。
  • 計算の tractability を保証するため、再生核ヒルバート空間(RKHS)内でのQ関数のノルム制約を課す。
  • 有限次元パラメータ化による効率的な最適化を可能にするために、ランダム特徴を用いてカーネルを近似する。
  • 制約付きの妥当集合上で戦略的報酬関数を最大化/最小化することで、期待報酬の上限および下限を求める。
  • 事前にあるQ関数推定値を用いて最適化を制約することで、フレームワークを事後分析に拡張する。

実験結果

リサーチクエスチョン

  • RQ1既知の行動方策を必要とせず、きつい、証明可能な信頼区間を構築することは可能か?
  • RQ2カーネルベースの統計的制約を用いて、真のQ関数が妥当集合に高確率で含まれることをどのように保証できるか?
  • RQ3特に高い分散または長時間スケールの設定において、重要度サンプリングに比べて、提案手法がよりきつい信頼区間を達成できるか?
  • RQ4同じ変分フレームワークを用いて、既存のオフポリシー推定器の事後診断と補正が可能か?
  • RQ5異なる制御ベンチマークにおいて、政策の乖離度合いが異なる状況でも、本手法は実験的にどの程度の性能を示すか?

主な発見

  • 本手法は、特に高い分散の状態において、重要度サンプリングに基づく手法に比べて顕著にきつい信頼区間を達成する。
  • フレームワークは、真の政策価値に対する証明可能な高信頼区間を提供し、包含確率に関する理論的保証を有する。
  • 制御ベンチマークにおける実験結果から、本手法は多様な環境において信頼性が高く、狭い信頼区間を達成することが示された。
  • 事後補正により、推定Q関数が真の値から逸脱している場合に、既存の推定器のバイアスを効果的に同定・補正できることが確認された。
  • 行動方策が未知または複数の政策の混合である場合でも、本手法は密度比推定を回避することで、依然として頑健である。
  • 理論的分析により、ランダム特徴によるカーネル化の近似誤差は有界であり、標本サイズが増加するにつれて減少することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。