[論文レビュー] Stochastic Recursive Momentum for Policy Gradient Methods
本稿では、バッチの入れ替えを必要とせずに分散低減を達成するための確率的再帰的モーメンタムを活用する、STORM-PGと呼ばれる新しい方策勾配法を提案する。この手法は、既存の分散低減ベースラインと比較して、より単純なハイパーパrameterチューニングと優れた実験的性能を実現しながら、最良の既知の収束レートと一致する $O(1/\epsilon^3)$ のサンプル複雑度を達成する。
In this paper, we propose a novel algorithm named STOchastic Recursive Momentum for Policy Gradient (STORM-PG), which operates a SARAH-type stochastic recursive variance-reduced policy gradient in an exponential moving average fashion. STORM-PG enjoys a provably sharp $O(1/ε^3)$ sample complexity bound for STORM-PG, matching the best-known convergence rate for policy gradient algorithm. In the mean time, STORM-PG avoids the alternations between large batches and small batches which persists in comparable variance-reduced policy gradient methods, allowing considerably simpler parameter tuning. Numerical experiments depicts the superiority of our algorithm over comparative policy gradient algorithms.
研究の動機と目的
- 分布シフトとノイズの多い勾配による方策勾配法の高いサンプル複雑度と分散を軽減すること。
- 分散低減方策勾配法において、大規模バッチと小規模バッチを交互に切り替える必要を排除することにより、ハイパーパrameterチューニングの複雑さを軽減すること。
- 再起動機構を用いず、訓練全体を通して低分散を維持できる安定的かつ効率的な方策勾配アルゴリズムの開発。
- 強化学習の非凸確率的最適化設定において、最先端の収束レートを達成すること。
提案手法
- STORM-PGは、指数移動平均を用いて再帰的に勾配分散を推定・低減することで、STORMの分散低減フレームワークを方策勾配法に統合する。
- SVRPG や SRVRPG などの手法で用いられる従来のバッチ再起動機構に代わり、連続的でモーメンタムに基づく分散安定化方式を採用する。
- アルゴリズムは、過去の勾配の重み付き平均を用いて勾配の再帰的推定を維持し、モーメンタム係数によって減衰を制御する。
- Adam最適化手法を用いて適応的学習率を導入し、初期学習率の選択に対する感受性を低減する。
- 内側ループの反復回数のチューニングを回避するため、固定されたミニバッチサイズ $B$ と初期の大規模バッチサイズ $S_0$ を使用する。
- 1層の隠れ層を備えたガウス方策を用い、複数回の独立実験における平均報酬を評価指標とする。
実験結果
リサーチクエスチョン
- RQ1バッチの入れ替えに依存しない分散低減方策勾配法は、$O(1/\epsilon^3)$ の最適な収束性を達成できるか?
- RQ2再起動機構を指数移動平均に置き換えることで、訓練の安定性とハイパーパrameter感受性が向上するか?
- RQ3STORM-PGは、SVRPG や SRVRPG といった既存の分散低減ベースラインと比較して、収束速度と最終的性能の両面で優れているか?
- RQ4特に内側ループのチューニングが不要な状況において、提案手法はハイパーパrameterの選択に対して頑健であるか?
主な発見
- STORM-PGは、方策勾配法における最良の既知の理論的収束レートと一致する $O(1/\epsilon^3)$ のサンプル複雑度バウンダリーを達成する。
- Cart-Pole環境では、STORM-PGは約500本のトラジェクトリで最適な性能に到達するが、SRVRPG や SVRPG は約1500本のトラジェクトリを必要とする。
- マウンテンカールタスクでは、STORM-PGは600本のトラジェクトリ以内で安定化し、強力な性能を発揮するが、ベースライン手法は1000本を超えるトラジェクトリを必要としてやっと同等の結果に到達する。
- STORM-PGは、ミニバッチサイズ $B$ や内側ループの反復回数のチューニングを必要としないため、SVRPG や SRVRPG と比較して顕著にハイパーパラメータ感受性が低いことが示された。
- 複数の環境において、より高い平均報酬とより狭い信頼区間を実現するなど、訓練の安定性と収束速度が優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。