Skip to main content
QUICK REVIEW

[論文レビュー] Offline Reinforcement Learning with Realizability and Single-policy Concentrability

Wenhao Zhan, Baihe Huang|arXiv (Cornell University)|Feb 9, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿では、最適価値関数の実現可能性と単一方策濃縮性の2つの仮定のみを仮定して、多項式的サンプル複雑性を達成するモデルフリーなオフライン強化学習アルゴリズムを提案する。先行研究と比較して、はるかに弱い仮定の下でも、すべての政策の濃縮性やベルマン完備性を必要としない。正則化とマージナライズド重要度重みを用いたプライマルデュアル定式化により、学習の安定性を保証する。

ABSTRACT

Sample-efficiency guarantees for offline reinforcement learning (RL) often rely on strong assumptions on both the function classes (e.g., Bellman-completeness) and the data coverage (e.g., all-policy concentrability). Despite the recent efforts on relaxing these assumptions, existing works are only able to relax one of the two factors, leaving the strong assumption on the other factor intact. As an important open problem, can we achieve sample-efficient offline RL with weak assumptions on both factors? In this paper we answer the question in the positive. We analyze a simple algorithm based on the primal-dual formulation of MDPs, where the dual variables (discounted occupancy) are modeled using a density-ratio function against offline data. With proper regularization, we show that the algorithm enjoys polynomial sample complexity, under only realizability and single-policy concentrability. We also provide alternative analyses based on different assumptions to shed light on the nature of primal-dual algorithms for offline RL.

研究の動機と目的

  • データカバレッジと関数近似に関する弱い仮定の下で、サンプル効率の良いオフライン強化学習を達成するという未解決問題に取り組む。
  • 多くの先行研究のサンプル効率保証の根幹をなす、すべての政策の濃縮性やベルマン完備性といった強い仮定を緩和する。
  • 現実的で実用的な仮定のもとでも安定性と性能を維持するモデルフリーなアルゴリズムを開発する。
  • 正則化と密度比モデリングを用いたプライマルデュアルフレームワークを用いて理論的保証を提供する。

提案手法

  • MDPの線形計画法的表現を用いて、オフライン強化学習問題をプライマルデュアル最適化問題として定式化する。
  • デュアル変数(割合付き占有分布)を、オフラインデータ分布に対する密度比関数としてモデル化する。
  • 強い凹性とデュアル最適化における安定性を保証するための正則化された目的関数を導入する。
  • 濃縮不等式を用いて、経験的損失関数と真の損失関数の一般化誤差をバウンディングする。
  • 強い凸性とノルム制御を用いて、方策近似誤差と価値関数誤差のバウンディングを確立する。
  • 実現可能性と単一方策濃縮性の下で、経験的解が正則化された最適方策にどのように関連するかを示す一般化バウンディングを導出する。

実験結果

リサーチクエスチョン

  • RQ1すべての政策の濃縮性やベルマン完備性を仮定せず、実現可能性と単一方策濃縮性の仮定のみで、サンプル効率の良いオフライン強化学習を達成できるか?
  • RQ2密度比モデリングを用いたプライマルデュアル定式化は、弱いデータカバレッジ仮定のもとでどのように安定した学習を可能にするか?
  • RQ3強い関数クラスの仮定がなければ、正則化が収束性と一般化性能を保証するために果たす役割は何か?
  • RQ4近似誤差と最適化誤差は、弱い仮定の下でアルゴリズムの性能にどのように影響を与えるか?
  • RQ5最適方策がデータにカバーされていない場合、アルゴリズムはデータにサポートされる最良の方策と競合できるか?

主な発見

  • 提案されたアルゴリズムは、最適価値関数の実現可能性と単一方策濃縮性の仮定のみで、多項式的サンプル複雑性を達成する。
  • 統計誤差項 $\epsilon_{\text{stat}}$ に依存する一般化バウンディングを提供する。この項は、オフラインサンプル数と関数クラスの容量に依存する。
  • 方策近似誤差は $\|\widehat{w} - w^*_{\alpha}\|_{2,d^D} \leq \sqrt{\frac{4\epsilon_{\text{stat}}}{\alpha M_f}}$ でバウンディングされ、正則化された最適方策への収束を保証する。
  • サブオプティマルティーガップ $J(\pi^*_{\alpha}) - J(\widehat{\pi})$ は $\frac{1}{1-\gamma} \mathbb{E}_{s \sim d^*_{\alpha}}[\|\pi^*_{\alpha}(s,\cdot) - \widehat{\pi}(s,\cdot)\|_1]$ でバウンディングされ、方策誤差と分布のずれを結びつける。
  • 近似誤差と最適化誤差が存在する場合の解析へも拡張可能であり、現実的な条件下でもロバストであることを示す。
  • 最適方策がカバーされていなくても、データにサポートされる方策の中での最良のものと競合できる優れた性能を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。