Skip to main content
QUICK REVIEW

[論文レビュー] Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity

Laixi Shi, Gen Li|arXiv (Cornell University)|Feb 28, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、有限時horizon MDPにおけるオフライン強化学習のための、Pessimistic Q-Learning (LCB-Q) とその分散低減版 (LCB-Q-Adv) を提案する。分布シフトとサンプル不足を緩和するために懸念(pessimism)を活用する。単一方策濃縮性仮定の下で、$\mathcal{O}(H^4 S C^* / \varepsilon^2)$ の近似的最適なサンプル複雑度を達成し、理論的下界と一致させ、モデルフリーなアルゴリズムがオフライン強化学習においてもサンプル効率的であることを確立する。

ABSTRACT

Offline or batch reinforcement learning seeks to learn a near-optimal policy using history data without active exploration of the environment. To counter the insufficient coverage and sample scarcity of many offline datasets, the principle of pessimism has been recently introduced to mitigate high bias of the estimated values. While pessimistic variants of model-based algorithms (e.g., value iteration with lower confidence bounds) have been theoretically investigated, their model-free counterparts -- which do not require explicit model estimation -- have not been adequately studied, especially in terms of sample efficiency. To address this inadequacy, we study a pessimistic variant of Q-learning in the context of finite-horizon Markov decision processes, and characterize its sample complexity under the single-policy concentrability assumption which does not require the full coverage of the state-action space. In addition, a variance-reduced pessimistic Q-learning algorithm is proposed to achieve near-optimal sample complexity. Altogether, this work highlights the efficiency of model-free algorithms in offline RL when used in conjunction with pessimism and variance reduction.

研究の動機と目的

  • モデルフリーで懸念のあるオフラインRLアルゴリズムの理論的理解の欠如に応える。実用的であるが、理論的裏付けが不足している。
  • やや弱い分布的仮定の下で、モデルベースとモデルフリーなオフラインRLのサンプル効率のギャップを埋める。
  • 有限時horizon MDPにおける懸念付きQ学習の変種に対して、証明可能なサンプル複雑度の保証を確立する。
  • モデルフリー枠組み内で、懸念と分散低減を組み合わせることで、近似的最適なサンプル複雑度を達成する。
  • モデルフリーなアルゴリズムが、懸念と分散低減を備えることで、オフラインRLの理論的限界に達することが示される。

提案手法

  • Q値推定に自信区間のペナルティを差し引くことで、低データ領域での過大評価を低減する、Q学習の懸念付き変種であるLCB-Qを提案する。
  • Q値更新における確率的ノイズを低減することで、サンプル効率を向上させる、LCB-Qの分散低減版であるLCB-Q-Advを導入する。
  • 単一方策濃縮性仮定を用いて、行動方策と最適方策の比を制限し、全状態行動空間のカバレッジがなくても一般化を可能にする。
  • Freedmanの不等式と集中不等式を用いて、経験的Q値推定とその期待値との乖離を制御する。
  • 推定誤差をバイアスとバイアス成分に分解することで、Q値推定の誤差に対する高確率境界を導出する。
  • 経験的遷移ダイナミクスと価値関数推定を含む項に分解することで、Q値更新誤差を新たな分解法で扱い、限られたデータ下でもきめ細やかに制御可能にする。

実験結果

リサーチクエスチョン

  • RQ1やや弱い分布的仮定の下で、モデルフリーで懸念のあるQ学習アルゴリズムが、オフラインRLにおいて近似的最適なサンプル複雑度を達成できるか?
  • RQ2分散低減は、オフライン設定における懸念付きQ学習のサンプル効率を向上させるか?
  • RQ3単一方策濃縮性仮定は、オフラインQ学習アルゴリズムのサンプル複雑度にどのように影響するか?
  • RQ4懸念付きQ学習は、有限時horizon MDPにおけるオフラインRLの理論的下界に達することができるか?
  • RQ5データが乏しく、非一様に分布している状況で、自信区間の役割はQ値推定の安定化にどのように寄与するか?

主な発見

  • LCB-Qは、同一仮定下で、最もよく知られたモデルベース手法と同等のサンプル複雑度 $\mathcal{O}(H^6 S C^* / \varepsilon^2)$ を達成する。
  • LCB-Q-Advは、$\mathcal{O}(H^4 S C^* / \varepsilon^2)$ の近似的最適なサンプル複雑度を達成し、対数要因を除いて理論的下界と一致する。
  • 分散低減版のLCB-Q-Advは、特に低データ環境下で、標準的なLCB-Qに比べて顕著にサンプル効率が向上する。
  • 分析により、単一方策濃縮性の下で、モデルフリーQ学習における懸念が、状態行動空間の完全カバレッジがなくても、実際に有効であることが示された。
  • 集中不等式の適用と推定誤差のきめ細やかな分解により、性能の高確率境界が導出され、保証される。
  • 結果として、懸念と分散低減を備えたモデルフリーなアルゴリズムが、モデルベース手法と同等のサンプル複雑度を達成できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。