Skip to main content
QUICK REVIEW

[論文レビュー] Black-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning

Ali Mousavi, Lihong Li|arXiv (Cornell University)|Mar 24, 2020
Advanced Bandit Algorithms Research参考文献 30被引用数 12
ひとこと要約

本稿では、無限時間ホライズン強化学習におけるブラックボックスのオフポリシー推定手法を提案する。この手法は、行動方策が既知である必要がなかったり、オフポリシーのデータが定常的でない場合でも、後向きフロー作用素の不動点方程式として問題を定式化することにより、それらの要件を回避する。再生核ヒルベルト空間(RKHS)を用いて、データから直接定常分布の重要度比を非パrametricに推定し、漸近的整合性と有限サンプルの一般化性能を達成する。実験では、データが非定常的であっても、先行手法を上回る性能を示した。

ABSTRACT

Off-policy estimation for long-horizon problems is important in many real-life applications such as healthcare and robotics, where high-fidelity simulators may not be available and on-policy evaluation is expensive or impossible. Recently, \cite{liu18breaking} proposed an approach that avoids the \emph{curse of horizon} suffered by typical importance-sampling-based methods. While showing promising results, this approach is limited in practice as it requires data be drawn from the \emph{stationary distribution} of a \emph{known} behavior policy. In this work, we propose a novel approach that eliminates such limitations. In particular, we formulate the problem as solving for the fixed point of a certain operator. Using tools from Reproducing Kernel Hilbert Spaces (RKHSs), we develop a new estimator that computes importance ratios of stationary distributions, without knowledge of how the off-policy data are collected. We analyze its asymptotic consistency and finite-sample generalization. Experiments on benchmarks verify the effectiveness of our approach.

研究の動機と目的

  • 長時間ホライズン強化学習において、既知の行動方策や定常的データ分布を要件としている従来のオフポリシー推定手法の限界を是正すること。
  • 行動方策が未知で、長期間にわたって非定常的にデータが収集される現実世界の設定でも、正確なオフポリシー評価を可能にする手法を開発すること。
  • オフポリシー推定を、ホライズン依存性を明示的に持たない後向きフロー作用素を含む不動点問題として定式化することにより、頑健な推定を可能にすること。
  • 提案手法の漸近的整合性と有限サンプル一般化に対する理論的保証を提供すること。
  • 非定常的かつ同定不能な行動方策条件下での、古典的制御ベンチマークにおける手法の有効性を実験的に検証すること。

提案手法

  • 本手法は、標準的な前向きベルマン作用素とは異なり、後向きフロー作用素の不動点を求める形でオフポリシー推定を定式化する。
  • 再生核ヒルベルト空間(RKHS)を用いて、行動方策の知識を必要とせずに、定常分布の重要度比を非パrametricに推定する。
  • 推定器は、オフポリシーのデータに基づいて、状態ごとの重要度重みを計算する。これは、行動方策が未知または複数のものである場合でも可能である。
  • 伝統的な重要度サンプリングが経験的に指数的増加を示す分散を回避するため、軌道レベルの重みではなく、定常分布比に基づいて処理を行う。
  • パラメトリックモデル(順方向ニューラルネットワーク)を用いて不動点関数を表現し、サブセットデータ上でハイパーパrameterを最適化することで、サンプルサイズの変化に対しても頑健性を確保する。
  • 理論的分析により、緩い正則性条件の下で漸近的整合性と有限サンプル一般化バウンドを確立する。

実験結果

リサーチクエスチョン

  • RQ1行動方策の知識がなくても、無限時間ホライズンRLにおけるオフポリシー推定を正確に行うことは可能か?
  • RQ2オフポリシーのデータが定常分布に到達していない場合でも、本手法は有効に機能するか?
  • RQ3RKHSにおける不動点定式化は、従来手法と比較してバイアス、分散、およびデータ分布シフトへの頑健性においてどのように異なるか?
  • RQ4現実的で非定常的なデータ収集条件下での推定器の有限サンプル一般化性能はいかがなものか?
  • RQ5長時間ホライズンダイナミクスと未知の行動方策を伴うベンチマークにおいて、本手法は既存手法を上回るか?

主な発見

  • 本手法は、非定常データ条件下でも、Pendulum、Mountain Car、CartPoleの3つの制御ベンチマークにおいて、RMSEの観点でベースライン手法(ナーブな平均化やIPS)を上回った。
  • AcrobotではIPSと同等の性能を示し、多様な環境において頑健性を示した。
  • 複数の軌道数にわたり一貫した性能を維持し、ハイパーパrameterの再調整なしにデータサイズの変化に対しても強い頑健性を示した。
  • 中央値と四分位範囲(図3)の結果から、競合手法よりも外れ値に敏感でない安定した性能トレンドが確認された。
  • 行動方策が既知でないか、非定常データを収集する複数の未観測プロトコルからのデータでも、本手法は有効であることが実験で示された。これは、ブラックボックス性と実用的応用可能性を裏付ける。
  • 実験では、行動方策が未知で、複数の観測不能なプロトコルからデータが収集される現実の観測データにおいても、本手法が有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。