Skip to main content
QUICK REVIEW

[論文レビュー] Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy

Boyi Liu, Qi Cai|arXiv (Cornell University)|Jun 25, 2019
Reinforcement Learning in Robotics参考文献 53被引用数 17
ひとこと要約

本稿は、過パラメータ化された2層ニューラルネットワークを用いたProximal Policy Optimization(PPO)およびTrust Region Policy Optimization(TRPO)の変種について、非漸近的でグローバルな収束速度を初めて確立した。無限次元のミラー降下を1点単調性のもとでモデル化し、過パラメータ化されたネットワークの最適化幾何学を活用することで、著者らはPPOが反復回数$K$に対して$O(1/\sqrt{K})$の非線形速度でグローバル最適方策に収束することを証明した。また、方策評価および方策改善サブルーチンの非漸近的バウンドも得た。

ABSTRACT

Proximal policy optimization and trust region policy optimization (PPO and TRPO) with actor and critic parametrized by neural networks achieve significant empirical success in deep reinforcement learning. However, due to nonconvexity, the global convergence of PPO and TRPO remains less understood, which separates theory from practice. In this paper, we prove that a variant of PPO and TRPO equipped with overparametrized neural networks converges to the globally optimal policy at a sublinear rate. The key to our analysis is the global convergence of infinite-dimensional mirror descent under a notion of one-point monotonicity, where the gradient and iterate are instantiated by neural networks. In particular, the desirable representation power and optimization geometry induced by the overparametrization of such neural networks allow them to accurately approximate the infinite-dimensional gradient and iterate.

研究の動機と目的

  • 深層強化学習における理論と実装のギャップを埋めるために、ニューラルネットワークパラメータ化を用いたPPOおよびTRPOのグローバル収束保証を確立すること。
  • 方策空間における非凸性およびニューラルネットワークパラメータ化によるグローバル収束の理解不足を解消すること。
  • PPO/TRPOにおける時系列学習(TD学習)による方策評価とSGDによる方策改善の相互作用を分析すること。
  • 各PPO反復において$\epsilon$-精度を達成するために必要なTDおよびSGD反復回数の非漸近的バウンドを提供すること。
  • クライアントおよびエージェントネットワークの両方における、過パラメータ化されたニューラルネットワークにおける平均二乗ベルヌーイ誤差(MSBE)と平均二乗誤差(MSE)の収束分析を統一すること。

提案手法

  • 理想化された方策更新を無限次元ミラー降下として形式化し、正確な行動価値関数を双対反復とみなし、方策を原始反復とみなす。
  • 最適方策への収束を保証するために、期待報酬の1点単調性を導入し、非凸性に対しても収束を可能にする。
  • 方策評価誤差を双対誤差、方策改善誤差を原始誤差としてモデル化し、クライアントおよびエージェントのニューラルネットワーク近似に起因するものとする。
  • 過パラメータ化された2層ReLUネットワークにおけるMSBE(TD学習用)およびMSE(SGD用)のグローバル収束を、非線形速度で確立する。
  • 過パラメータ化を活用して正確な近似を実現するニューラル接線カーネル(NTK)の枠組みにおいて、TDおよびSGDの収束分析を統一する。
  • 双対誤差と原始誤差をミラー降下フレームワークに統合し、ニューラルネットワークを用いたPPOのグローバル収束速度を導出する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークパラメータ化を用いたPPOは、最適方策にグローバルに収束するか?その収束速度は?
  • RQ2各PPO反復において、$\epsilon$-精度を達成するためのTD反復回数はどの程度か?
  • RQ3各PPO反復内で$\epsilon$-精度の高い方策改善を達成するために必要なSGD反復回数はどの程度か?
  • RQ4非凸的かつ無限次元的な方策最適化問題は、1点単調性のもとでミラー降下を用いて解析可能か?
  • RQ5過パラメータ化されたニューラルネットワークは、方策評価および方策改善サブルーチンの両方のグローバル収束を可能にするか?

主な発見

  • 過パラメータ化された2層ReLUネットワークを用いた提案されたPPOの変種は、反復回数$K$に対して$O(1/\sqrt{K})$の速度で、グローバルに最適方策に収束する。
  • 時系列学習(TD学習)を用いて方策評価を$\epsilon$-精度で達成するためには、$O(1/\epsilon^2)$回のTD反復が十分である。
  • 確率的勾配降下(SGD)を用いて方策改善を$\epsilon$-精度で達成するためには、$O(1/\epsilon^2)$回のSGD反復が十分である。
  • 過パラメータ化されたネットワークの表現力と最適化幾何学のおかげで、MSBE(クライアント用)およびMSE(エージェント用)の両方の収束がグローバルに保証され、非線形速度で達成される。
  • 解析により、方策評価誤差と方策改善誤差が反復を経て蓄積されるが、それらの非線形収束がPPO全体のグローバル収束を保証することが示された。
  • 証明フレームワークにより、NTKの枠組みにおいてTDとSGDの収束が統一され、ニューラルネットワークベースの方策最適化の原理的分析が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。