[論文レビュー] Variance Reduction for Deep Q-Learning using Stochastic Recursive Gradient
本稿では、勾配の分散を低減するために確率的再帰的勾配(SRG)を用いる、オンライン強化学習における不正確な全勾配アンカーベースの必要性を排除する、新たな深層Q学習アルゴリズムSRG-DQNを提案する。再帰的な勾配推定値の更新とAdam最適化の統合により、従来のSGDおよびSVRGベースのベースラインと比較して、収束が速く、安定性が向上し、Atariゲームにおける性能が優れている。
Deep Q-learning algorithms often suffer from poor gradient estimations with an excessive variance, resulting in unstable training and poor sampling efficiency. Stochastic variance-reduced gradient methods such as SVRG have been applied to reduce the estimation variance (Zhao et al. 2019). However, due to the online instance generation nature of reinforcement learning, directly applying SVRG to deep Q-learning is facing the problem of the inaccurate estimation of the anchor points, which dramatically limits the potentials of SVRG. To address this issue and inspired by the recursive gradient variance reduction algorithm SARAH (Nguyen et al. 2017), this paper proposes to introduce the recursive framework for updating the stochastic gradient estimates in deep Q-learning, achieving a novel algorithm called SRG-DQN. Unlike the SVRG-based algorithms, SRG-DQN designs a recursive update of the stochastic gradient estimate. The parameter update is along an accumulated direction using the past stochastic gradient information, and therefore can get rid of the estimation of the full gradients as the anchors. Additionally, SRG-DQN involves the Adam process for further accelerating the training process. Theoretical analysis and the experimental results on well-known reinforcement learning tasks demonstrate the efficiency and effectiveness of the proposed SRG-DQN algorithm.
研究の動機と目的
- 高分散勾配推定による深層Q学習における不安定性と低いサンプリング効率を解消すること。
- 非i.i.d.かつ動的に生成される遷移のため、オンライン強化学習におけるSVRGベース手法のアンカーポイント推定が不正確であるという制限を克服すること。
- 再帰的勾配更新を用いることで、全勾配計算を回避する分散低減フレームワークを設計すること。
- 再帰的勾配推定と適応的最適化(Adam)を統合し、収束を高速化すること。
- 報酬、収束速度、学習安定性の観点から、最先端のDQN変種と比較して提案手法の優位性を実験的に検証すること。
提案手法
- 外ループがリプレイバッファからN個の遷移をサンプリングし、内ループが再帰的勾配更新を実行する二重ループ構造を導入する。
- SARAHにインspiredされた再帰的勾配推定器を採用し、全バッチアンカーに依存せず、過去の勾配差分を用いて確率的勾配を更新する。
- SVRGのアンカーポイントを再帰的に更新される推定値に置き換え、計算コストの高い全勾配計算の必要性を回避する。
- 各外ループの終了時にAdam最適化器を統合し、収束を加速させ、パラメータ更新方向を改善する。
- 再帰的更新ルール:$ g_{k} = g_{k-1} + \nabla f_{i_k}(\theta_k) - \nabla f_{i_k}(\theta_{k-1}) $ を用い、反復ごとに勾配情報が蓄積される。
- 理論的分析により、本手法はIFOに対する$ O(1/\varepsilon) $のクエリ複雑度で$ \varepsilon $-最適解に到達でき、分散低減手法における最良の既知のレートに一致することが示された。
実験結果
リサーチクエスチョン
- RQ1全勾配アンカーに依存せずに、オンライン深層Q学習における勾配分散を再帰的勾配推定が効果的に低減できるか?
- RQ2勾配の正確性と学習安定性の観点から、再帰的勾配更新はSVRGのアンカーベースアプローチと比べてどのように異なるか?
- RQ3再帰的勾配推定とAdam最適化を組み合わせることで、Atari環境における収束速度と性能が向上するか?
- RQ4勾配の標準偏差という観点から、SRG-DQNはSVR-DQNと比較してどの程度勾配分散を低減するか?
- RQ5既存のSGDおよびSVRGベースのDQN変種と比較して、提案手法はより高いサンプリング効率と最終的な性能を達成できるか?
主な発見
- エピソード平均サイズの実験から、標準DQN(SGD)と比較して、SRG-DQNは収束が著しく速く、エピソード長の標準偏差も低いことが示された。
- 再帰的アンカーと正確なアンカーとの間の$ \ell_2 $距離が大幅に縮小され、アンカー推定の正確性が向上したことが確認された。
- 平均して、SRG-DQNは最初の層のパラメータにおける勾配の標準偏差を、SVR-DQNと比較して最大50%まで低減した。特に後期の学習段階で顕著であった。
- Atariゲームベンチマークにおいて、SRG-DQNはSGDベースDQNおよびSVR-DQNを上回る最終平均報酬スコアを達成し、Breakoutでは最大0.966、Q*bertでは最大0.632の向上を示した。
- 再帰的勾配推定とAdamの組み合わせにより、SVR-DQNと比較して学習時間を30〜40%短縮でき、性能は維持または向上させた。
- 実験結果により、SRG-DQNが既存の分散低減ベースラインと比較して、特に高分散かつ非定常な環境において、学習をより安定化させ、分散をより効果的に低減することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。