Skip to main content
QUICK REVIEW

[論文レビュー] Towards Instance-Optimal Offline Reinforcement Learning with Pessimism

Minghao Yin, Yu-Xiang Wang|arXiv (Cornell University)|Oct 17, 2021
Reinforcement Learning in Robotics参考文献 50被引用数 4
ひとこと要約

本稿は、悲観主義を用いたインスタンス最適なオフライン強化学習フレームワークを導入し、個々のMDPインスタンスに適応するタイトなサブ最適性バウンドを導出する。提案された適応的悲観的価値反復(APVI)アルゴリズムは、$ O\left(\sum_{h=1}^{H}\sum_{s_h,a_h} d^{\pi^\star}_h(s_h,a_h) \sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h)}{d^{\mu}_h(s_h,a_h)}} \sqrt{\frac{1}{n}} \right) $ にほぼ一致するバウンドを達成し、さまざまな仮定の下で既存のミニマックスおよび問題依存的結果を回復し、個々のインスタンスに対する情報理論的下界を確立する。

ABSTRACT

We study the offline reinforcement learning (offline RL) problem, where the goal is to learn a reward-maximizing policy in an unknown Markov Decision Process (MDP) using the data coming from a policy $μ$. In particular, we consider the sample complexity problems of offline RL for finite-horizon MDPs. Prior works study this problem based on different data-coverage assumptions, and their learning guarantees are expressed by the covering coefficients which lack the explicit characterization of system quantities. In this work, we analyze the Adaptive Pessimistic Value Iteration (APVI) algorithm and derive the suboptimality upper bound that nearly matches \[ O\left(\sum_{h=1}^H\sum_{s_h,a_h}d^{π^\star}_h(s_h,a_h)\sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}{(V^\star_{h+1}+r_h)}}{d^μ_h(s_h,a_h)}}\sqrt{\frac{1}{n}} ight). \] In complementary, we also prove a per-instance information-theoretical lower bound under the weak assumption that $d^μ_h(s_h,a_h)>0$ if $d^{π^\star}_h(s_h,a_h)>0$. Different from the previous minimax lower bounds, the per-instance lower bound (via local minimaxity) is a much stronger criterion as it applies to individual instances separately. Here $π^\star$ is a optimal policy, $μ$ is the behavior policy and $d_h^μ$ is the marginal state-action probability. We call the above equation the intrinsic offline reinforcement learning bound since it directly implies all the existing optimal results: minimax rate under uniform data-coverage assumption, horizon-free setting, single policy concentrability, and the tight problem-dependent results. Later, we extend the result to the assumption-free regime (where we make no assumption on $ μ$) and obtain the assumption-free intrinsic bound. Due to its generic form, we believe the intrinsic bound could help illuminate what makes a specific problem hard and reveal the fundamental challenges in offline RL.

研究の動機と目的

  • 最悪ケースの仮定に依存せず、個々の問題インスタンスに適応する、証明可能な有効性を持つオフライン強化学習手法の開発。
  • 最適方策の訪問度と価値分散に基づき、各MDPインスタンスの固有の難易度を捉えるサブ最適性バウンドの導出。
  • 局所ミニマックス性を用いて、従来のミニマックスバウンドよりも強い、個々のインスタンスに対する情報理論的下界の確立。
  • データカバレッジの仮定を一切行わない仮定フリーな状態への分析の拡張。
  • 単一の内在的バウンドにおいて、既存の結果(ミニマックス、ホライズンフリー、単一方策濃縮性、問題依存バウンド)を統合・回復すること。

提案手法

  • オフラインデータにおける分布シフトに対処するため、価値反復に悲観主義を組み込んだ、適応的悲観的価値反復(APVI)アルゴリズムを提案。
  • 最適方策の状態・行動訪問度 $ d^{\pi^\star}_h $、行動方策のカバレッジ $ d^{\mu}_h $、次の価値関数の分散 $ \mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h) $ に依存するサブ最適性の上界を導出。
  • 二点最適価値推定への新しい還元を用いて、個々のインスタンスの下界を証明し、局所ミニマックス最適性を確立。
  • 仮定フリーな状態を分析するため、悲観的拡張MDPを導入し、いかなるデータカバレッジ仮定も必要としないバウンドの導出を可能にする。
  • ハレインジャー距離と2次テイラー展開を用いて、分布シフトを制御し、推定された遷移モデルの統計的整合性を保証。
  • 局所的インスタンス依存解析を適用し、各個々のMDPインスタンスに対して成り立つ下界を導出。これは、最悪ケースインスタンスの期待値上でのみ成り立つものではない。

実験結果

リサーチクエスチョン

  • RQ1最悪ケースの仮定に依存せず、個々のMDPインスタンスの固有の難易度に適応するサブ最適性バウンドを導出可能か?
  • RQ2提案されたバウンドは、ミニマックスレート、ホライズンフリーのバウンド、単一ポリシー濃縮性といった既存の結果とどのように関係し、それらを回復するか?
  • RQ3与えられたインスタンスに対するオフラインRLの根本的統計的限界は何か? そして、個々のインスタンスの下界によって特徴付け可能か?
  • RQ4行動方策にいかなるデータカバレッジ仮定も行わない仮定フリーな状態において、証明可能な有効性を持つアルゴリズムを確立可能か?
  • RQ5導出されたバウンドは、価値分散とカバレッジの役割を含め、オフラインRLの真のシステムレベルの複雑性を反映しているか?

主な発見

  • APVIアルゴリズムは、$ O\left(\sum_{h=1}^{H}\sum_{s_h,a_h} d^{\pi^\star}_h(s_h,a_h) \sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h)}{d^{\mu}_h(s_h,a_h)}} \sqrt{\frac{1}{n}} \right) $ にほぼ一致するサブ最適性上界を達成し、これがインスタンス最適であることが示された。
  • 本稿では、$ d^\mu_h(s_h,a_h) > 0 $ が $ d^{\pi^\star}_h(s_h,a_h) > 0 $ のとき常に成り立つ弱い仮定の下で、個々のインスタンスに対する情報理論的下界を証明し、従来のミニマックスバウンドよりも強いものである。
  • 内在的バウンドは、既存の結果を回復する:均一なカバレッジの下でミニマックスレート、ホライズンフリーのバウンド、単一ポリシー濃縮性、問題依存バウンド。
  • 仮定フリーな状態では、データカバレッジの仮定が一切不要なバウンドを導出し、行動方策のサポートとMDPの構造にのみ依存する。
  • 分析により、オフラインRLにおける根本的課題は、最適方策の訪問度、行動方策のカバレッジ、および価値関数の分散の相乗作用にあり、この内在的バウンドがそれを正確に捉えていることが示された。
  • 導出されたバウンドは、複数のスケールでタイトであることが示され、提案手法がインスタンス最適なサンプル複雑度を達成していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。