Skip to main content
QUICK REVIEW

[論文レビュー] Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence

Wenhao Zhan, Shicong Cen|arXiv (Cornell University)|May 24, 2021
Reinforcement Learning in Robotics参考文献 45被引用数 8
ひとこと要約

本稿では、任意の凸正則化子を扱えるようにするための、Bregman散発を用いた正則化強化学習の統一的枠組みである一般化政策ミラー降下(GPMD)を提案する。この手法は、滑らかでない・強く強凸でない正則化子でさえも含め、広範な学習率の範囲でグローバル最適解への線形収束を確立する。さらに、不正確な方策評価に対しても安定で、次元に依存しない収束レートを保証する。

ABSTRACT

Policy optimization, which finds the desired policy by maximizing value functions via optimization techniques, lies at the heart of reinforcement learning (RL). In addition to value maximization, other practical considerations arise as well, including the need of encouraging exploration, and that of ensuring certain structural properties of the learned policy due to safety, resource and operational constraints. These can often be accounted for via regularized RL, which augments the target value function with a structure-promoting regularizer. Focusing on discounted infinite-horizon Markov decision processes, we propose a generalized policy mirror descent (GPMD) algorithm for solving regularized RL. As a generalization of policy mirror descent (arXiv:2102.00135), our algorithm accommodates a general class of convex regularizers and promotes the use of Bregman divergence in cognizant of the regularizer in use. We demonstrate that our algorithm converges linearly to the global solution over an entire range of learning rates, in a dimension-free fashion, even when the regularizer lacks strong convexity and smoothness. In addition, this linear convergence feature is provably stable in the face of inexact policy evaluation and imperfect policy updates. Numerical experiments are provided to corroborate the appealing performance of GPMD.

研究の動機と目的

  • エントロピーのような特定の正則化子に限定された、正則化強化学習における方策最適化の一般的な収束理論の欠如に対処する。
  • 滑らかでない・強く強凸でない正則化子を含む広範な凸正則化子クラスを扱える統一的アルゴリズムフレームワークを構築する。
  • 強い凸性や滑らかさの欠如がある一般正則化子に対しても、方策最適化の線形収束保証を確立する。
  • 実用的なRL設定で一般的な不正確な方策評価や不完全な方策更新に対しても、ロバストであることを保証する。
  • 広範な学習率の範囲で一様に成り立つ次元に依存しない収束解析を提供する。

提案手法

  • 選択された正則化子に適合したBregman散発を組み込むことで、政策ミラー降下を一般化する一般化政策ミラー降下(GPMD)アルゴリズムを提案する。
  • 正則化子が定める幾何構造に一致する更新方向を確保するため、Bregman散発を距離尺度として用いる。これにより、柔軟かつ構造を保った方策更新が可能になる。
  • Bregman散発を用いた正則化目的関数の最小化として方策更新を定式化し、正則化子が定義する可解集合内に方策が留まるように保証する。
  • 性能差の補題を用いて、価値ギャップと方策間のBregman散発および勾配の関係を確立し、収束を導く。
  • GPMDの正確版と不正確版の両方を分析し、Q値差の収縮を用いた弱い仮定のもとで線形収束を証明する。
  • 各エポックごとにステップサイズとイテレーション回数の戦略を導入し、方策評価が近似的であっても誤差が指数関数的に減少することを保証する。

実験結果

リサーチクエスチョン

  • RQ1強化学習における任意の凸正則化子をサポートする統一的方策最適化フレームワークを構築可能か?
  • RQ2提案されたGPMDアルゴリズムは、正則化子が強く強凸でも滑らかでもない場合でも、グローバル最適解への線形収束を達成するか?
  • RQ3不正確な方策評価や不完全な方策更新下でも、アルゴリズムの性能は如何であり、収束は保証されるか?
  • RQ4収束レートは次元に依存せず、広範な学習率の範囲で一様に成り立つか?
  • RQ5Bregman散発の選択が、一般正則化子下での方策最適化の安定性と収束に与える影響は何か?

主な発見

  • GPMDは、正則化子が強く強凸でも滑らかでもない場合でさえも、学習率の全範囲でグローバル最適方策への線形収束を達成する。
  • 収束レートは次元に依存せず、状態空間や行動空間のサイズにかかわらず劣化しない。
  • 不正確な方策評価や不完全な方策更新に対しても、誤差がイテレーション回数に従って指数関数的に減少するため、証明可能な安定性を有する。
  • 各エポックにおいて、誤差の指数関数的減少を保証するため、内側のイテレーション回数 $ T_i $ は $ \big\rfloor \frac{1+\tau_i\theta}{\theta(1-\rho)} \rho \big\rfloor $ と選べる。ここで $ \theta $ は正則化子パラメータ、$ \rho $ は割引率である。
  • 現在の方策と最適方策との性能ギャップは $ \frac{\tau_i B}{1-\rho} $ として減少する。ここで $ \tau_i $ はステップサイズ、$ B $ はQ値差の上限である。
  • 数値実験により、GPMDはエントロピー正則化や制約正則化の下で、標準的方策勾配法や自然方策勾配法よりも収束速度と安定性に優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。