Skip to main content
QUICK REVIEW

[論文レビュー] Intrinsically Efficient, Stable, and Bounded Off-Policy Evaluation for Reinforcement Learning

Nathan Kallus, Masatoshi Uehara|arXiv (Cornell University)|Jun 9, 2019
Reinforcement Learning in Robotics参考文献 23被引用数 8
ひとこと要約

本稿では、重要度サンプリング(IS)、自己正規化IS(SNIS)、二重に頑健(DR)手法よりも内在的に高い効率性を示す、経験的尤度に基づく新しい非政策評価(OPE)推定量を提案する。SNISと同様に有界性と安定性を維持しつつ、文脈的バンディットおよび強化学習の両設定で漸近的平均二乗誤差(MSE)の改善を達成する。理論的保証と実験的検証により、既存手法を上回る一貫した性能向上が示された。

ABSTRACT

Off-policy evaluation (OPE) in both contextual bandits and reinforcement learning allows one to evaluate novel decision policies without needing to conduct exploration, which is often costly or otherwise infeasible. The problem's importance has attracted many proposed solutions, including importance sampling (IS), self-normalized IS (SNIS), and doubly robust (DR) estimates. DR and its variants ensure semiparametric local efficiency if Q-functions are well-specified, but if they are not they can be worse than both IS and SNIS. It also does not enjoy SNIS's inherent stability and boundedness. We propose new estimators for OPE based on empirical likelihood that are always more efficient than IS, SNIS, and DR and satisfy the same stability and boundedness properties as SNIS. On the way, we categorize various properties and classify existing estimators by them. Besides the theoretical guarantees, empirical studies suggest the new estimators provide advantages.

研究の動機と目的

  • 既存のOPE手法の限界、すなわちISの高い分散、Q関数の誤り指定下でのDRの不安定性、DRの有界性欠如を解消すること。
  • 漸近的MSEの観点で、常にIS、SNIS、DRより高い効率性を示す推定量を開発すること。
  • Q関数が誤って指定された場合でも、SNISが持つ有界性と安定性の性質を引き継ぐ推定量を保証すること。
  • IS、SNIS、DRを特別なケースとして含む共通のパラメトリック枠組みを構築し、体系的な改善を可能とすること。
  • 文脈的バンディットおよび強化学習環境において、提案手法の実験的妥当性を検証すること。

提案手法

  • IS、SNIS、DRを特別なケースとして含む、係数でパrameter化された一般クラスの推定量を提案する。
  • 経験的尤度を用いて漸近的MSEを最小化する最適なパラメータを選択し、内在的効率性を保証する。
  • REG(回帰ベース)およびEMP(経験的尤度ベース)の2つの変種を導入し、両者とも効率性の向上を達成する。
  • 影響関数および漸近的分散の式を導出し、Q関数が正しく指定された場合の局所効率性とMSE最適性を証明する。
  • 報酬のサポートに推定量が収まるように制約を課すことで有界性を確保し、SNISの安定性を模倣する。
  • 理論的および実験的検証を伴い、文脈的バンディット(T=1)およびマコフ決定過程(T>1)の両設定にこの枠組みを適用する。

実験結果

リサーチクエスチョン

  • RQ1漸近的MSEの観点で、常にIS、SNIS、DRより高い効率性を示すOPE推定量を構築可能か?
  • RQ2Q関数が誤って指定された場合でも、SNISが持つ有界性と安定性を維持しつつ、DRの局所効率性を達成可能か?
  • RQ3IS、SNIS、DRを特別なケースとして含み、体系的な改善を可能とする統一的枠組みは存在するか?
  • RQ4提案手法の推定量は、文脈的バンディットおよび強化学習設定において、実験的にどのように性能を発揮するか?
  • RQ5Q関数の誤指定が、既存手法と比較して新しい推定量の性能に与える影響は何か?

主な発見

  • 提案されたEMPおよびREG推定量は、一般条件下で、IS、SNIS、DRよりも内在的に高い効率性を示し、漸近的MSEが厳密に低くなる。
  • Q関数が誤って指定された場合でも、SNISと同様に有界性と安定性の性質を維持し、DRの不安定性を回避する。
  • 文脈的バンディットおよび強化学習(例:Windy Gridworld、Cliff Walking、Mountain Car)における実験結果から、ベースライン手法を上回る一貫した性能向上が観察された。
  • 理論的分析により、Q関数が正しく指定された場合に、提案推定量の漸近的MSEが半パラメトリック効率限界に達することが確認された。
  • Q関数が誤って指定された場合でも、標準的なDRと比較してMSEの低下を回避し、DRを上回る性能を示した。
  • 経験的尤度の使用により、安定性や有界性を損なわず、最適な重み付けを実現し、効率性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。