Skip to main content
QUICK REVIEW

[論文レビュー] History-Gradient Aided Batch Size Adaptation for Variance Reduced Algorithms

Kaiyi Ji, Zhe Wang|arXiv (Cornell University)|Oct 21, 2019
Stochastic Gradient Optimization Techniques参考文献 42被引用数 10
ひとこと要約

本稿では、SVRG や SPIDER などの分散低減最適化アルゴリズム向けに、過去の確率的勾配の平均大きさに基づいてバッチサイズを動的に増加させる、新しいバッチサイズ適応スキームを提案する。バックトラッキングラインサーチの必要性を排除する。この手法は、非凸最適化および強化学習の両方で、収束複雑度の向上と実用的性能の高速化を達成し、理論的保証と実証的検証を兼ね備えている。

ABSTRACT

Variance-reduced algorithms, although achieve great theoretical performance, can run slowly in practice due to the periodic gradient estimation with a large batch of data. Batch-size adaptation thus arises as a promising approach to accelerate such algorithms. However, existing schemes either apply prescribed batch-size adaption rule or exploit the information along optimization path via additional backtracking and condition verification steps. In this paper, we propose a novel scheme, which eliminates backtracking line search but still exploits the information along optimization path by adapting the batch size via history stochastic gradients. We further theoretically show that such a scheme substantially reduces the overall complexity for popular variance-reduced algorithms SVRG and SARAH/SPIDER for both conventional nonconvex optimization and reinforcement learning problems. To this end, we develop a new convergence analysis framework to handle the dependence of the batch size on history stochastic gradients. Extensive experiments validate the effectiveness of the proposed batch-size adaptation scheme.

研究の動機と目的

  • 分散低減アルゴリズムの実用的収束が遅い問題に起因する、周期的な大規模バッチ勾配推定の影響を緩和すること。
  • 従来のバッチサイズ適応スキームにおけるバックトラッキングラインサーチに起因する計算コストを排除すること。
  • 履歴勾配情報を利用した理論的裏付けがあり、実装が容易なバッチサイズ適応手法を開発すること。
  • 非凸最適化および強化学習の文脈において、SVRG や SPIDER およびそのポリシー勾配変種の全体的な複雑度と収束速度を向上させること。

提案手法

  • 各外ループにおいて、前エポックの確率的勾配の平均ノルムに反比例する形でバッチサイズを適応的に変更する。
  • 直近の反復からの平均勾配ノルムを用いて、現在の勾配の大きさを推定し、バックトラッキングなしでバッチサイズを設定する。
  • 非凸最適化のための AbaSVRG および AbaSPIDER、強化学習のための AbaSVRPG および AbaSPIDER-PG を導入する。
  • バッチサイズが過去の勾配に依存することを考慮した、新たな収束解析フレームワークを構築し、目的関数値の変化に対してより緊密な境界を導出可能にする。
  • 履歴勾配ノルムを用いて、エポックごとの期待関数値の減少をバウンディングすることで、収束保証を確立する。
  • 従来のエポック単位または反復単位の降下解析とは異なる、新規な解析技術を採用し、パラメータ選択の柔軟性を高め、複雑度境界を改善する。

実験結果

リサーチクエスチョン

  • RQ1履歴勾配に基づくバッチサイズ適応は、バックトラッキングを伴わずに分散低減アルゴリズムの収束速度を向上させることができるか?
  • RQ2履歴勾配に基づくバッチサイズ適応は、非凸最適化における全体の反復回数および関数評価複雑度にどのように影響を与えるか?
  • RQ3このスキームは、理論的収束保証を伴って、強化学習におけるポリシー勾配法へ拡張可能か?
  • RQ4提案手法の適応的バッチサイズアルゴリズムの理論的複雑度境界は、標準的な SVRG や SPIDER と比較してどうなるか?
  • RQ5新たな収束解析フレームワークは、バッチサイズが過去の確率的勾配に依存することをどのように扱っているか?

主な発見

  • 提案された AbaSVRG および AbaSPIDER アルゴリズムは、履歴勾配に基づくバッチサイズ適応により、非凸最適化において収束複雑度の向上を達成する。
  • AbaSVRPG および AbaSPIDER-PG アルゴリズムは、ベースラインの分散低減ポリシー勾配法と比較して、強化学習タスクでより高速な収束と優れた性能を示す。
  • 理論的解析により、$\epsilon$ 未満の期待勾配ノルムが達成されるまでに、$\mathcal{O}(1/\epsilon^2 \wedge n/\epsilon)$ 回の確率的一次オракル(SFO)呼び出しが必要であることが示された。
  • バックトラッキングラインサーチを回避しながらも収束保証を維持でき、アルゴリズムの複雑度が低減された。
  • 実験的結果により、適応的バッチサイズスキームが最適化および強化学習の両設定で学習を加速させ、安定性を向上させることを確認した。
  • 新規な収束解析フレームワークにより、SVRG型アルゴリズムに対する従来手法に比べ、より緊密な境界とより柔軟なパrameterチューニングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。