Skip to main content
QUICK REVIEW

[論文レビュー] Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning

Tengyang Xie, Nan Jiang|arXiv (Cornell University)|Jun 9, 2021
Reinforcement Learning in Robotics参考文献 44被引用数 16
ひとこと要約

本稿では、最適方策 $\pi_{\star}$ に近い参照方策 $\mu$ を用いることで、オフライン強化学習とオンライン強化学習を統合する統一された強化学習設定「ポリシー微調整」を提案する。この手法は、$\mu$ からのオフラインデータ収集と、適応的オンライン探索を組み合わせることで、より高いデータ効率を達成するハイブリッドアルゴリズムを提案し、オフライン還元のための最初のタイトなサンプル複雑度バウンド $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$ を証明するとともに、最適性能が純粋なオフライン還元または完全にオンライン手法によって達成されることを示す下界を確立する。

ABSTRACT

Recent theoretical work studies sample-efficient reinforcement learning (RL) extensively in two settings: learning interactively in the environment (online RL), or learning from an offline dataset (offline RL). However, existing algorithms and theories for learning near-optimal policies in these two settings are rather different and disconnected. Towards bridging this gap, this paper initiates the theoretical study of policy finetuning, that is, online RL where the learner has additional access to a "reference policy" $μ$ close to the optimal policy $π_\star$ in a certain sense. We consider the policy finetuning problem in episodic Markov Decision Processes (MDPs) with $S$ states, $A$ actions, and horizon length $H$. We first design a sharp offline reduction algorithm -- which simply executes $μ$ and runs offline policy optimization on the collected dataset -- that finds an $\varepsilon$ near-optimal policy within $\widetilde{O}(H^3SC^\star/\varepsilon^2)$ episodes, where $C^\star$ is the single-policy concentrability coefficient between $μ$ and $π_\star$. This offline result is the first that matches the sample complexity lower bound in this setting, and resolves a recent open question in offline RL. We then establish an $Ω(H^3S\min\{C^\star, A\}/\varepsilon^2)$ sample complexity lower bound for any policy finetuning algorithm, including those that can adaptively explore the environment. This implies that -- perhaps surprisingly -- the optimal policy finetuning algorithm is either offline reduction or a purely online RL algorithm that does not use $μ$. Finally, we design a new hybrid offline/online algorithm for policy finetuning that achieves better sample complexity than both vanilla offline reduction and purely online RL algorithms, in a relaxed setting where $μ$ only satisfies concentrability partially up to a certain time step.

研究の動機と目的

  • データ効率の良いオフラインおよびオンライン強化学習の理論的理解を統一すること。
  • 最適方策 $\pi_{\star}$ に近い参照方策 $\mu$ が、濃縮性(concentrability)の観点からどれほど利益をもたらすかを検討すること。
  • データ収集と適応的探索を可能にする新しい設定「ポリシー微調整」を提案することで、オフラインとオンラインRLのギャップを埋めること。
  • ポリシー微調整におけるサンプル複雑度のタイトな理論的バウンドを確立し、オフライン還元または完全にオンラインの手法が最適であることを示す下界を提示すること。
  • 参照方策 $\mu$ が濃縮性を部分的に満たすような緩い設定において、オフラインとオンラインの両方の成分を組み合わせたハイブリッドアルゴリズムが、通常のオフライン還元や完全にオンラインRLを上回ることを示すこと。

提案手法

  • 参照方策 $\mu$ とインタラクティブな環境へのアクセスを有する新しい強化学習設定「ポリシー微調整」を提案する。
  • データを $\mu$ を用いて収集し、オフライン方策最適化を適用して $\varepsilon$-最適方策を求める、オフライン還元アルゴリズム(PEVI-Adv)を設計する。
  • オフラインとオンラインの両方の要素を統合したハイブリッドアルゴリズムを導入し、$\mu$ を用いたデータ収集と適応的探索によって、データ効率を向上させる。
  • 参照方策 $\mu$ が最適方策の状態行動分布をどれほどよくカバーしているかを測るため、濃縮性係数($C^\star$ と $C^{\rm partial}$)を導入する。
  • 信頼区間とバイアス分解を用いた価値関数推定を用いて、提案されたアルゴリズムの性能を分析する。
  • 帰納法、集中不等式、再帰的誤差バウンドといった理論的ツールを用い、サンプル複雑度の保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1最適方策 $\pi_{\star}$ に近い参照方策 $\mu$ は、強化学習におけるデータ効率を著しく向上させることができるか?
  • RQ2参照方策 $\mu$ を最適に活用する方法は何か? 純粋にオフラインデータ収集に使うべきか、それとも適応的オンライン探索がより良いサンプル複雑度をもたらすか?
  • RQ3参照方策の利点に根本的な限界があるか? そして、タイトなサンプル複雑度下界によってそれが捉えられるか?
  • RQ4オフラインとオンラインの両方のコンponentsを組み合わせたハイブリッドアルゴリズムは、$\mu$ が濃縮性を部分的に満たすような設定において、純粋なオフライン還元や純粋なオンラインRLを上回ることができるか?
  • RQ5オフライン還元アプローチは、ポリシー微調整において最適なサンプル複雑度を達成するか? そして、理論的にタイトであるか?

主な発見

  • オフライン還元アルゴリズム PEVI-Adv は、$\varepsilon$-最適方策を求めるために $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$ エピソードのサンプル複雑度を達成し、この設定における理論的下界と一致する。
  • 任意のポリシー微調整アルゴリズムに対して、$\Omega(H^3 S \min\{C^\star, A\} / \varepsilon^2)$ のサンプル複雑度下界が確立され、最適な手法は純粋なオフライン還元または $\mu$ を無視する完全にオンラインのアルゴリズムであることを示唆する。
  • 参照方策 $\mu$ が時間ステップ $h_{\star}$ まで部分的濃縮性 $C^{\rm partial}$ を満たす緩い設定において、ハイブリッドアルゴリズムは、純粋なオフライン還元および完全にオンライン手法の両方を上回るサンプル複雑度を達成する。
  • ハイブリッドアルゴリズムのサンプル複雑度は、$\widetilde{O}\left(\frac{H^2 h_{\star} S C^{\rm partial} + (H - h_{\star})^3 S A (C^{\rm partial})^2}{\varepsilon^2} + \frac{H^2 h_{\star}^{3.5} S C^{\rm partial}}{\varepsilon} \right)$ であり、$h_{\star} \ll H$ のとき、両方のベースラインを上回る。
  • 分析により、最終出力方策 $\widehat{\pi}$ が、導出されたサンプル複雑度条件のもとで $V_1^\star(s_1) - V_1^{\widehat{\pi}}(s_1) \leq \varepsilon$ を満たすことが示された。
  • 本研究は、単一ポリシー濃縮性設定におけるオフラインRLの未解決問題を解決し、優れた参照方策を用いたオフライン還元が、この設定で最適なサンプル複雑度を達成することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。