Skip to main content
QUICK REVIEW

[論文レビュー] More Robust Doubly Robust Off-policy Evaluation

Mehrdad Farajtabar, Yinlam Chow|arXiv (Cornell University)|Feb 10, 2018
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

本稿では、二重にロバストな推定器の分散を最小化するようにモデルパラメータを学習することにより、分散を低減するより頑健な二重にロバストな(MRDR)オフポリシー評価推定器を提案する。この手法は、強い一致性と漸近的最適性を達成し、標準的なDR、IS、DMよりも、平均二乗誤差が低く、文脈的バンディットおよび強化学習のベンチマークで優れた性能を示す。

ABSTRACT

We study the problem of off-policy evaluation (OPE) in reinforcement learning (RL), where the goal is to estimate the performance of a policy from the data generated by another policy(ies). In particular, we focus on the doubly robust (DR) estimators that consist of an importance sampling (IS) component and a performance model, and utilize the low (or zero) bias of IS and low variance of the model at the same time. Although the accuracy of the model has a huge impact on the overall performance of DR, most of the work on using the DR estimators in OPE has been focused on improving the IS part, and not much on how to learn the model. In this paper, we propose alternative DR estimators, called more robust doubly robust (MRDR), that learn the model parameter by minimizing the variance of the DR estimator. We first present a formulation for learning the DR model in RL. We then derive formulas for the variance of the DR estimator in both contextual bandits and RL, such that their gradients w.r.t.~the model parameters can be estimated from the samples, and propose methods to efficiently minimize the variance. We prove that the MRDR estimators are strongly consistent and asymptotically optimal. Finally, we evaluate MRDR in bandits and RL benchmark problems, and compare its performance with the existing methods.

研究の動機と目的

  • 強化学習および文脈的バンディットにおけるオフポリシー評価(OPE)推定器の高い分散を緩和すること。
  • より良いモデル学習により分散を低減することで、二重にロバスト(DR)推定器の頑健性を向上させること。
  • 任意の損失関数に依存せず、DR推定器の分散を最小化する目的関数としてDMモデルパラメータを学習する手法を開発すること。
  • 提案されたMRDR推定器の理論的一貫性および漸近的最適性を証明すること。
  • MRDRの優位性を、ベンチマークRLおよびバンディット環境において、DM、IS、DR、DR0と比較して実験的に検証すること。

提案手法

  • 強化学習におけるDR推定器の直接法(DM)成分のための新しい定式化を提案する。
  • 文脈的バンディットおよび強化学習の両設定において、DR推定器の分散に対する閉形式の表現を導出する。これにより勾配ベース最適化が可能になる。
  • サンプルに基づく分散勾配推定を用いて、確率的最適化によりDMモデルパラメータを訓練する。
  • DMモデルの学習の目的関数としてDR推定器の分散最小化を採用し、頑健性を向上させる。
  • 2つの変種を導入:MRDR(完全な分散最小化を伴う)とMRDR0(比較用のベースライン)。
  • MRDRが弱い正則性条件の下で強く一貫しており、漸近的に最適であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1二重にロバスト推定器の分散を最小化することは、強化学習および文脈的バンディットにおけるオフポリシー評価の正確性を向上させることができるか?
  • RQ2モデルの誤指定に強く、全体の推定器の分散を低減できるように、直接法モデルをどのように学習すればよいか?
  • RQ3DMモデルの分散に基づく最適化は、標準的な損失関数よりも優れた性能を発揮するか?
  • RQ4MRDR推定器は、IS、DM、標準的なDRと比較して、バイアス、分散、平均二乗誤差の観点でどのように差がつくか?
  • RQ5標準的なMDP仮定の下で、MRDR推定器は漸近的に最適であり、強く一貫しているか?

主な発見

  • MRDRは、4×4迷路、マウントレイン・カー、カート・ポールのすべてのベンチマーク環境において、標準的なDR、IS、DMと比較して平均二乗誤差(MSE)を顕著に低減した。
  • 4×4迷路ドメインでは、2048サンプルでDR0と比較してMSEが75%低減され、DRと比較しても60%低減された。
  • マウントレイン・カー・ドメインでは、2048サンプルでDR0と比較してMSEが80%以上低減され、DRと比較しても70%低減された。
  • カート・ポール・ドメインでは、512サンプルでDRと比較してMSEが75%低減され、MSEはDRの0.08455からMRDRの0.079に低下した。
  • ベースラインであるMRDR0はMRDRより性能が悪く、分散最小化が性能向上の鍵であることを裏付けた。
  • 理論的分析により、MRDRが強く一貫しており、漸近的に最適であることが確認され、その実験的優位性が正当化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。