Skip to main content
QUICK REVIEW

[論文レビュー] A general sample complexity analysis of vanilla policy gradient

Rui Yuan, Robert M. Gower|arXiv (Cornell University)|Jul 23, 2021
Stochastic Gradient Optimization Techniques参考文献 39被引用数 7
ひとこと要約

本稿は、勾配分散に関する新しいABC仮定を用いて、バニラ方策勾配(PG)手法の一般化された標本複雑度解析を提供する。この仮定は一般的な有界勾配仮定を包含する。一階停留点(FOSP)への収束に対しては、タイトな $\tilde{\rm O}(\epsilon^{-4})$ の標本複雑度を確立し、緩い勾配支配条件の下では、グローバル最適解への収束に対して $\tilde{\rm O}(\epsilon^{-3})$ を達成する。これにより、単一トラジェクトリ(バッチサイズ $m=1$)学習を含むより広いハイパーパrameterの柔軟性が可能になる。

ABSTRACT

We adapt recent tools developed for the analysis of Stochastic Gradient Descent (SGD) in non-convex optimization to obtain convergence and sample complexity guarantees for the vanilla policy gradient (PG). Our only assumptions are that the expected return is smooth w.r.t. the policy parameters, that its $H$-step truncated gradient is close to the exact gradient, and a certain ABC assumption. This assumption requires the second moment of the estimated gradient to be bounded by $A\geq 0$ times the suboptimality gap, $B \geq 0$ times the norm of the full batch gradient and an additive constant $C \geq 0$, or any combination of aforementioned. We show that the ABC assumption is more general than the commonly used assumptions on the policy space to prove convergence to a stationary point. We provide a single convergence theorem that recovers the $\widetilde{\mathcal{O}}(ε^{-4})$ sample complexity of PG to a stationary point. Our results also affords greater flexibility in the choice of hyper parameters such as the step size and the batch size $m$, including the single trajectory case (i.e., $m=1$). When an additional relaxed weak gradient domination assumption is available, we establish a novel global optimum convergence theory of PG with $\widetilde{\mathcal{O}}(ε^{-3})$ sample complexity. We then instantiate our theorems in different settings, where we both recover existing results and obtain improved sample complexity, e.g., $\widetilde{\mathcal{O}}(ε^{-3})$ sample complexity for the convergence to the global optimum for Fisher-non-degenerated parametrized policies.

研究の動機と目的

  • 強化学習におけるバニラ方策勾配(PG)手法の標本複雑度を分析する統一的理論的枠組みを提供すること。
  • 勾配分散に関するABC仮定を導入することで、収束保証に必要な仮定を弱める。この仮定は、既存の有界勾配型仮定を一般化する。
  • 一階停留点(FOSP)への収束に対するタイトな標本複雑度バウンドを確立し、追加条件のもとでグローバル最適解への収束についても同様に示すこと。
  • 収束保証を維持したまま、単一トラジェクトリ学習(バッチサイズ $m=1$)を含むより広いハイパーパrameter選択を可能にすること。
  • 特にソフトマックスおよびログバリアントパラメータ化の設定において、既存の結果を回復・改善すること。

提案手法

  • 勾配推定値の2次モーメントが、サブオプティマルギャップ、フルバッチ勾配のノルム、および定数の線形結合によって抑えられるABC仮定を導入する。
  • 非凸確率的最適化(例:SGD解析)のツールを適応し、ABC仮定の下でPGを分析する。これには、期待報酬の滑らかさと $H$-ステップ勾配の打ち切り誤差を活用する。
  • ABC仮定と滑らかさ条件の下で、REINFORCEおよびGPOMDPの両変種を統一的に分析する1つの収束定理を導出する。
  • 適応的ステップサイズルール(例:$\eta_t = \min(1/b, 2/(\mu(t - t_0 + 2b/\mu))$)を用いて、収束速度と分散制御のバランスを取る。
  • 緩い弱い勾配支配仮定の下でグローバル収束を確立し、改善された標本複雑度を達成する。
  • 具体的な設定(例:ソフトマックス、ログバリアント、表形式、LQR)に一般定理を適用し、既存の結果を回復または改善する。

実験結果

リサーチクエスチョン

  • RQ1バニラPGに対して、既存の仮定を包含し、標本複雑度を改善する統一的かつ一般的な収束解析を構築できるか?
  • RQ2PG解析で一般的に使われる有界勾配仮定と比較して、ABC仮定は一般性と適用性においてどのように異なるか?
  • RQ3ABC仮定の下で、特に一階停留点への収束に対して、どのような標本複雑度バウンドを導出できるか?
  • RQ4解析をグローバル収束に拡張できるか?緩い勾配支配条件のもとで、どのような標本複雑度が達成可能か?
  • RQ5特定のポリシーのパラメータ化(例:ソフトマックス、ログバリアント)において、一般枠組みが、先行研究と比較してタイトまたは改善された標本複雑度をもたらすか?

主な発見

  • ABC仮定の下で、一階停留点(FOSP)への収束に対して $\tilde{\rm O}(\epsilon^{-4})$ の標本複雑度を確立した。これは一部の設定では、既存の結果よりもタイトである。
  • ABC仮定は、標準的な有界勾配仮定よりも一般性が高く、それらを特別な場合として含むことが示された。
  • 解析はハイパーパramータの柔軟性を許容し、単一トラジェクトリ学習($m=1$)を含む。また、正確なPGの ${\rm O}(\epsilon^{-2})$ 複雑度を回復した。
  • 緩い弱い勾配支配仮定の下で、グローバル最適解への収束に対して、前例のない $\tilde{\rm O}(\epsilon^{-3})$ の標本複雑度を達成し、既存の結果を改善した。
  • 本フレームワークは、特定の設定(例:ソフトマックスとログバリアントの組み合わせでは $\tilde{\rm O}(\epsilon^{-6})$、以前の結果より余分なステップを必要とせず改善)や、フィッシャー非特異ポリシーでは $\tilde{\rm O}(\epsilon^{-3})$ を回復・改善した。
  • 本解析は、表形式ポリシー、LQR、プロジェクション付きPGなどの既知の設定においても、既存の結果を回復できるほど一般性があり、有効なハイパーパラメータの範囲を拡張した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。