Skip to main content
QUICK REVIEW

[論文レビュー] Data-Efficient Policy Evaluation Through Behavior Policy Search

Josiah P. Hanna, Philip S. Thomas|arXiv (Cornell University)|Jun 12, 2017
Reinforcement Learning in Robotics参考文献 17被引用数 8
ひとこと要約

本稿では、行動方策の最適化によりオフポリシー推定の分散を最小化することで、データ効率の高い方策評価を実現する、行動方策勾配(BPG)を提案する。環境のダイナミクスを入手できない状況下でも、オフポリシー推定の分散に対する勾配降下を用いることで、BPGはオンポリシー評価よりも低い平均二乗誤差を達成する。

ABSTRACT

We consider the task of evaluating a policy for a Markov decision process (MDP). The standard unbiased technique for evaluating a policy is to deploy the policy and observe its performance. We show that the data collected from deploying a different policy, commonly called the behavior policy, can be used to produce unbiased estimates with lower mean squared error than this standard technique. We derive an analytic expression for the optimal behavior policy --- the behavior policy that minimizes the mean squared error of the resulting estimates. Because this expression depends on terms that are unknown in practice, we propose a novel policy evaluation sub-problem, behavior policy search: searching for a behavior policy that reduces mean squared error. We present a behavior policy search algorithm and empirically demonstrate its effectiveness in lowering the mean squared error of policy performance estimates.

研究の動機と目的

  • オンポリシーのモンテカルロ法を用いた方策評価における高い分散を是正すること。
  • オフポリシー評価における方策パフォーマンス推定の平均二乗誤差(MSE)を低減すること。
  • データ効率を向上させるために、方策評価における行動方策を最適化する手法を開発すること。
  • 環境の遷移確率の知識がなくても、方策評価の分散低減を可能にする手法の開発

提案手法

  • 行動方策の選択を新たな最適化問題として定式化する:行動方策探索。
  • 重要度サンプリング推定器の分散を最小化する最適な行動方策の解析的表現を導出する。
  • オフポリシー推定器の分散を最小化するように行動方策パラメータを適応させる、確率的勾配降下法である行動方策勾配(BPG)を提案する。
  • 重要度サンプリングを用いて、行動方策に従って収集されたデータから評価方策のパフォーマンスの不偏推定値を生成する。
  • BPGと組み合わせて、さらに分散を低減するための制御変数技術を採用する。
  • 重要度サンプリング推定器の推定分散に基づいて、行動方策のパラメータに対する勾配更新を実行する。

実験結果

リサーチクエスチョン

  • RQ1行動方策の最適化は、オンポリシー手法と比較して方策評価の平均二乗誤差を低減できるか?
  • RQ2環境の遷移確率の知識がなくても、行動方策探索はオフポリシー方策評価における分散を低減できるか?
  • RQ3BPGはモデルベースの制御変数と効果的に組み合わせて、さらに推定誤差を低減できるか?
  • RQ4どのような条件下で、行動方策の適応がオンポリシー評価に比べて顕著な改善をもたらすか?

主な発見

  • BPGはオンポリシーのモンテカルロ推定と比較して、方策パフォーマンス推定の平均二乗誤差を低減する。
  • 評価方策に本質的に低い分散がある場合でも、BPGはオンポリシー評価よりも低い分散を達成する。
  • まれに発生するが高額な報酬が分散に寄与する環境において、BPGは推定誤差の低減に有効である。
  • モデルベースの制御変数と組み合わせることで、BPGは方策評価の平均二乗誤差をさらに低減する。
  • BPGはオンポリシー評価と比較してデータ効率が低下することはない。理論的にも分散が増加することはない。
  • 実験的結果により、BPGは複数の環境において、推定精度の面でオンポリシー手法を上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。