Skip to main content
QUICK REVIEW

[論文レビュー] Positive-Negative Momentum: Manipulating Stochastic Gradient Noise to Improve Generalization

Zeke Xie, Yuan Li|arXiv (Cornell University)|Mar 31, 2021
Stochastic Gradient Optimization Techniques参考文献 58被引用数 6
ひとこと要約

本稿では、正の負のモーメンタム(PNM)を提案する。PNMは、2つの独立したモーメンタム項を維持し、その差がSGN(確率的勾配ノイズ)の大きさを制御することで、深層学習におけるSGNを向上させる新しい最適化手法である。PNMは計算コストをほとんど増加させることなく、SGD や Adam よりも顕著に一般化性能を向上させ、画像分類、言語モデリング、ノイズのあるラベル学習のベンチマークにおいて、従来のモーメンタムベースの最適化手法を上回る性能を示す。

ABSTRACT

It is well-known that stochastic gradient noise (SGN) acts as implicit regularization for deep learning and is essentially important for both optimization and generalization of deep networks. Some works attempted to artificially simulate SGN by injecting random noise to improve deep learning. However, it turned out that the injected simple random noise cannot work as well as SGN, which is anisotropic and parameter-dependent. For simulating SGN at low computational costs and without changing the learning rate or batch size, we propose the Positive-Negative Momentum (PNM) approach that is a powerful alternative to conventional Momentum in classic optimizers. The introduced PNM method maintains two approximate independent momentum terms. Then, we can control the magnitude of SGN explicitly by adjusting the momentum difference. We theoretically prove the convergence guarantee and the generalization advantage of PNM over Stochastic Gradient Descent (SGD). By incorporating PNM into the two conventional optimizers, SGD with Momentum and Adam, our extensive experiments empirically verified the significant advantage of the PNM-based variants over the corresponding conventional Momentum-based optimizers.

研究の動機と目的

  • 人工的なランダムノイズが一般化を改善する際の限界を解決すること。これは、実際の確率的勾配ノイズ(SGN)が示す非等方的かつパラメータ依存の性質を再現できないためである。
  • 学習率やバッチサイズを変更せずに、計算コストが低く、効果的なSGNの強化手法を開発すること。これは、計算コストと収束性のトレードオフによって制約を受けるためである。
  • SGD や Adam のような最適化手法における従来のモーメンタムの理論的裏付けが強く、実験的にも堅牢な代替手法を提供すること。
  • 深層ニューラルネットワークの学習において、学習率や重み減衰といったハイパーパrameterに対する一般化性能とロバスト性を向上させること。

提案手法

  • 従来のモーメンタムの代わりに、差を制御可能な2つの独立したモーメンタム項を用いる正の負のモーメンタム(PNM)を提案する。
  • 2つのモーメンタム項の差が、SGNの大きさを明示的に制御でき、一般化性能の向上に向けた勾配ノイズの標的的操作を可能にする。
  • 学習率やバッチサイズを変更せずに、既存の最適化手法(SGD with Momentum および Adam)に PNM を統合し、PNM を用いた変種を構築する。
  • 理論的分析により、標準的な SGD よりも PNM が収束性および一般化性能に優れていることを証明しており、特に平坦な最小値を好む傾向がある。
  • 実験的に、Stochastic PNM および AdaPNM として PNM を適用し、SGN を強化しながら学習の安定性を維持するようにハイパーパrameterを調整する。
  • 本手法はプラグアンドプレイ設計となっており、Adam や AdamW、AMSGrad といった一般的な最適化手法とも互換性がある。

実験結果

リサーチクエスチョン

  • RQ1モーメンタムダイナミクスに対する簡単な修正が、深層学習における一般化性能の向上に向け、確率的勾配ノイズ(SGN)を効果的に強化できるか?
  • RQ2提案された正の負のモーメンタム手法が、テスト精度およびロバスト性において、従来のモーメンタムベースの最適化手法を上回るか?
  • RQ3ハイパーパrameterのチューニングなしに、CIFAR-10、CIFAR-100、ImageNet といった多様なデータセットと画像分類、言語モデリング、ノイズのあるラベル学習といった多様なタスクにおいて、PNM が優れた性能を維持できるか?
  • RQ4β₀ といった重要なハイパーパrameterに対して PNM はどれほど感受性を示すか?また、学習率や重み減衰の変動に対してロバストであるか?

主な発見

  • PNM を用いた最適化手法は、従来のモーメンタムベースの対応手法よりも顕著に一般化性能が向上しており、ラベルノイズが40%のCIFAR-10では、テスト誤差が最大20ポイントも低下した。
  • ResNet18 を用いたCIFAR-10では、PNM が 4.48% ± 0.09 のテスト誤差を達成し、SGD(5.01% ± 0.03)や Adam(6.53% ± 0.03)を上回った。
  • ImageNet では、Stochastic PNM が学習率減衰の各段階においても、SGD よりも常に低いテスト誤差を示しており、収束が速く、一般化性能に優れていることが示された。
  • AdaPNM は言語モデリングタスクにおいて Adam を上回り、より良いテスト性能と高速な学習速度を示した。
  • PNM は学習率や重み減衰に対してロバストであり、SGD よりもはるかに広く深い最適ハイパーパrameterの盆地を示した。
  • β₀ > 0 の範囲では β₀ に対してロバストであり、広い範囲の値で優れた性能を発揮した。一方、β₀ ≤ 0 の場合、性能が低下し、理論的予測と一致した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。