[論文レビュー] Near-Optimal Offline Reinforcement Learning via Double Variance Reduction
本稿では、二重分散低減を用いることで近似的に最適なサンプル複雑度を達成する、新しいオフライン強化学習アルゴリズムOPDVRを提案する。有限時 horizon の定常MDPにおいて、OPDVRは $ widetilde{O}(H^{2}/d_{m} au^{2})$ のオフラインエピソードで $ epsilon$-最適方策を発見できることを証明しており、先行研究に比べて $H$ 要因の改善を達成し、新たな情報理論的下界と一致する(対数要因を除いて)。
We consider the problem of offline reinforcement learning (RL) -- a well-motivated setting of RL that aims at policy optimization using only historical data. Despite its wide applicability, theoretical understandings of offline RL, such as its optimal sample complexity, remain largely open even in basic settings such as \emph{tabular} Markov Decision Processes (MDPs). In this paper, we propose Off-Policy Double Variance Reduction (OPDVR), a new variance reduction based algorithm for offline RL. Our main result shows that OPDVR provably identifies an $ε$-optimal policy with $\widetilde{O}(H^2/d_mε^2)$ episodes of offline data in the finite-horizon stationary transition setting, where $H$ is the horizon length and $d_m$ is the minimal marginal state-action distribution induced by the behavior policy. This improves over the best known upper bound by a factor of $H$. Moreover, we establish an information-theoretic lower bound of $Ω(H^2/d_mε^2)$ which certifies that OPDVR is optimal up to logarithmic factors. Lastly, we show that OPDVR also achieves rate-optimal sample complexity under alternative settings such as the finite-horizon MDPs with non-stationary transitions and the infinite horizon MDPs with discounted rewards.
研究の動機と目的
- 表形式MDPにおけるオフライン強化学習のサンプル複雑度に関する理論的理解のギャップを埋めること。
- 有限時 horizon の定常MDPにおけるオフライン方策最適化で最適なサンプル複雑度を達成するアルゴリズムを開発すること。
- 提案されたアルゴリズムの最適性を証明するためのタイトな情報理論的下界を確立すること。
- アルゴリズムの最適性を非定常および無限時 horizon の割引MDPへと拡張すること。
- 先行の分散低減手法における初期化依存性の問題を解決すること。
提案手法
- OPDVRは、オフラインデータからの学習を安定化させるために二重分散低減を用いた確率的価値反復フレームワークを採用する。
- 標準的な分散低減アルゴリズムにおける初期化依存性の問題を克服するため、ダブルイング技術を適用する。
- 履歴軌道を用いてミニバッチ確率的更新を価値関数に対して実行することで、推定分散を低減する。
- Sidfordら(2018a)の手法を模倣した変形された分散低減形式を用い、非政策データおよび定常遷移に適応させる。
- 任意の初期化のもとで濃度束縛を維持することで、ミニマックス最適性を保証する。
- MDP内の時刻ステップにわたる誤差伝播を分析するために、条件付き分散分解を組み込む。
実験結果
リサーチクエスチョン
- RQ1有限時 horizon の定常MDPにおけるオフライン強化学習の最適なサンプル複雑度は何か?
- RQ2分散低減に基づくアルゴリズムは、オフライン設定においてこの最適複雑度を達成できるか?
- RQ3定常と非定常遷移モデルの間で、オフライン強化学習のサンプル複雑度にはどのような違いがあるか?
- RQ4提案されたアルゴリズムは、無限時 horizon の割引MDPにおいても最適性を維持できるか?
- RQ5先行の分散低減手法におけるオフライン強化学習における理論的限界は何か? そして、それらはどのように克服できるか?
主な発見
- OPDVRは、有限時 horizon の定常MDPにおいて、$ widetilde{O}(H^{2}/d_{m}\epsilon^{2})$ のサンプル複雑度で $ epsilon$-最適方策を達成でき、先行の最良の境界に比べて $H$ 要因の改善を達成する。
- 本稿では、$ Omega(H^{2}/d_{m}\epsilon^{2})$ の一致する情報理論的下界を確立し、OPDVRが対数要因を除いて最適であることを証明する。
- 有限時 horizon の非定常設定では、OPDVRは $ widetilde{O}(H^{3}/d_{m}\epsilon^{2})$ のサンプル複雑度を達成し、対数要因を除いて最適である。
- 無限時 horizon の割引MDPでは、OPDVRはステップ数の観点から $ widetilde{O}((1-\gamma)^{-3}/d_{m}\epsilon^{2})$ のサンプル複雑度を達成し、対数要因を除いて最適である。
- 初期化に依存しないダブルイング手順を用いることで、先行の分散低減手法における深刻な欠陥を解消する。
- 解析により、OPDVRが定常設定において $O(H^2)$ の時 horizon 依存性を達成する最初のオフラインアルゴリズムであることが確認され、非定常設定と明確に分離される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。