Skip to main content
QUICK REVIEW

[論文レビュー] Nearly Horizon-Free Offline Reinforcement Learning

Tongzheng Ren, Jialian Li|arXiv (Cornell University)|Mar 25, 2021
Reinforcement Learning in Robotics参考文献 47被引用数 6
ひとこと要約

本稿では、時刻一様なMDPにおけるオフライン強化学習の、ほぼホライズンに依存しないサンプル複雑度の上限を提示する。オフライン方策評価では誤差 $\tilde{O}\big(\sigma{1}{Kd_m}\big)$ を達成し、方策最適化では $\tilde{O}\big(\sigma{1}{Kd_m} + \frac{\min(S,d)}{Kd_m}\big)$ の近似最適性ギャップを達成する。主な革新点は、合計分散を制御するための新しい再帰的アプローチであり、主な誤差項に明示的な $H$ 依存性を排除した点である。

ABSTRACT

We revisit offline reinforcement learning on episodic time-homogeneous Markov Decision Processes (MDP). For tabular MDP with $S$ states and $A$ actions, or linear MDP with anchor points and feature dimension $d$, given the collected $K$ episodes data with minimum visiting probability of (anchor) state-action pairs $d_m$, we obtain nearly horizon $H$-free sample complexity bounds for offline reinforcement learning when the total reward is upper bounded by $1$. Specifically: 1. For offline policy evaluation, we obtain an $ ilde{O}\left(\sqrt{\frac{1}{Kd_m}} ight)$ error bound for the plug-in estimator, which matches the lower bound up to logarithmic factors and does not have additional dependency on $\mathrm{poly}\left(H, S, A, d ight)$ in higher-order term. 2.For offline policy optimization, we obtain an $ ilde{O}\left(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S, d)}{Kd_m} ight)$ sub-optimality gap for the empirical optimal policy, which approaches the lower bound up to logarithmic factors and a high-order term, improving upon the best known result by \cite{cui2020plug} that has additional $\mathrm{poly}\left(H, S, d ight)$ factors in the main term. To the best of our knowledge, these are the \emph{first} set of nearly horizon-free bounds for episodic time-homogeneous offline tabular MDP and linear MDP with anchor points. Central to our analysis is a simple yet effective recursion based method to bound a "total variance" term in the offline scenarios, which could be of individual interest.

研究の動機と目的

  • 既存の手法がホライズン $H$ に対して多項式的またはそれ以上の依存性を示すという、オフライン強化学習におけるホライズンの呪いに対処する。
  • オフライン方策評価(OPE)およびオフライン方策最適化(OPO)のサンプル複雑度の上限を、$H$ にほぼ依存しない形で開発する。
  • 既知の下界と対数要因を除き一致する上限を達成し、高次の項を除いて $\mathrm{poly}(H,S,d)$ 依存性を持つ先行研究を改善する。
  • オフラインRL解析における重要な「合計分散」項を制御するための新しい再帰的アプローチを導入し、独立した関心の対象となる可能性がある。
  • 時刻一様MDPにおけるオフライン方策評価(OPE)および方策最適化(OPO)に対して、初めてのほぼホライズンに依存しない保証を確立する。これは、アンカー点を有する表形式および線形MDPにおいて初めての成果である。

提案手法

  • オフラインRL誤差解析に現れる「合計分散」項を制御するための再帰的アプローチを提案し、推定誤差を制御する上で中心的な役割を果たす。
  • この再帰的アプローチを適用して、オフライン方策評価におけるプラグイン推定量の有限標本誤差上限を導出。誤差は $\tilde{O}\big(\sqrt{\frac{1}{Kd_m}}\big)$ を示す。
  • 経験的MDP上でモデルベース計画法を用いて、オフライン方策最適化のための方策を導出し、その近似最適性ギャップは $\tilde{O}\big(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S,d)}{Kd_m}\big)$ であることを示す。
  • MDPの時刻一様構造を活用して、主な誤差成分にホライズン依存項を含めない。
  • 情報理論的下界と対数要因および高次項を除いて一致する上限を確立する。
  • 提案手法が先行研究に見られる $\mathrm{poly}(H,S,A,d)$ 依存性、特に高次項においても回避できることを示す。

実験結果

リサーチクエスチョン

  • RQ1時刻一様MDPにおいて、オフライン強化学習はホライズン $H$ にほぼ依存しないサンプル複雑度の上限を達成できるか?
  • RQ2ホライズンに明示的な依存性を避けることのできる、オフライン方策評価の最もタイトな有限標本誤差上限は何か?
  • RQ3オフライン方策最適化における近似最適性ギャップを、$\mathrm{poly}(H,S,d)$ 要因を含む先行結果を改善して、ほぼホライズンに依存しない形にできるか?
  • RQ4オフラインRLにおける「合計分散」項を制御する一般化された解析的手法は存在するか? これによりホライズンの爆発を回避できるか?
  • RQ5提案手法は、オフラインRL設定において、対数要因を除いてミニマックス最適なサンプル複雑度をどの程度達成できるか?

主な発見

  • オフライン方策評価において、プラグイン推定量は誤差上限 $\widetilde{O}\big(\sqrt{\frac{1}{Kd_m}}\big)$ を達成し、既知の下界と対数要因を除いて一致し、高次項に $\mathrm{poly}(H,S,A,d)$ 依存性を追加で持たない。
  • オフライン方策最適化において、経験的最適方策の近似最適性ギャップは $\widetilde{O}\big(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S,d)}{Kd_m}\big)$ であり、これは主な項から $\mathrm{poly}(H,S,d)$ 要因を除去することで、既存の最良結果を改善している。
  • 合計分散を制御するための提案された再帰的アプローチは、ホライズンに依存しない上限を達成する上で中心的な役割を果たし、本研究の範囲を超えて独立した関心の対象となる可能性がある。
  • 本研究は、アンカー点を有する表形式および線形MDPにおける、オフライン方策評価(OPE)および方策最適化(OPO)の、初めてのほぼホライズンに依存しない境界を提供する。
  • 結果は、MDPが時刻一様であり、データカバレッジが十分である場合、ホライズンの呪いが著しく緩和可能であることを示している。
  • 解析により、時刻一様構造が価値関数推定誤差のより緊密な制御を可能にし、時刻非一様設定で見られる $S$ 要因の爆発を回避できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。