Skip to main content
QUICK REVIEW

[論文レビュー] Normalized Direction-preserving Adam

Zijun Zhang, Lin Ma|arXiv (Cornell University)|Sep 13, 2017
Stochastic Gradient Optimization Techniques参考文献 21被引用数 20
ひとこと要約

本稿では、勾配の方向を重みベクトルごとに保持し、重みベクトルを明示的に正規化することで効果的学習率を制御する、改良されたAdam最適化手法であるNormalized Direction-preserving Adam (ND-Adam) を提案する。SGDに近い更新ダイナミクスを実現し、正則化されたソフトマックスを組み込むことで、画像分類においてSGDと同等の一般化性能を達成し、AdamとSGDの間の一般化ギャップを埋めることに成功した。

ABSTRACT

Adaptive optimization algorithms, such as Adam and RMSprop, have shown better optimization performance than stochastic gradient descent (SGD) in some scenarios. However, recent studies show that they often lead to worse generalization performance than SGD, especially for training deep neural networks (DNNs). In this work, we identify the reasons that Adam generalizes worse than SGD, and develop a variant of Adam to eliminate the generalization gap. The proposed method, normalized direction-preserving Adam (ND-Adam), enables more precise control of the direction and step size for updating weight vectors, leading to significantly improved generalization performance. Following a similar rationale, we further improve the generalization performance in classification tasks by regularizing the softmax logits. By bridging the gap between SGD and Adam, we also hope to shed light on why certain optimization algorithms generalize better than others.

研究の動機と目的

  • 深層ニューラルネットワークにおけるAdamの一般化性能がSGDに劣る理由を特定すること。
  • 2つの主要な問題に取り組むこと:(1) Adamは重みベクトルごとの勾配方向を保持しないこと、(2) 制御不能なパラメータノルムの増大により、有効な学習率が低下すること。
  • 更新方向と有効な学習率に対するより精確な制御が可能なAdamの変種を開発すること。
  • ソフトマックスのログィットを正則化することで分類の学習信号を改善すること。
  • AdamとSGDの間の一般化性能のギャップを埋めること。

提案手法

  • ND-Adamは、各パラメータごではなく、重みベクトルごとに学習率を適応させることで、勾配方向の保持を保証する。
  • 最適化中に各重みベクトルを明示的に正規化し、方向と大きさの更新を分離することで、有効な学習率の安定化を図る。
  • 勾配の方向を維持しながら、正規化によるステップサイズの制御を実現する修正された更新ルールを採用する。
  • バッチノーマライゼーションまたはL2正則化を用いた正則化されたソフトマックス層を導入し、ログィットの大きさを制約し、学習信号の質を向上させる。
  • SGDにおけるL2重み減衰の暗黙的な正則化効果を、Adamにおいて明示的に重みベクトルを正規化することで再現する。
  • 実験的評価では、CIFAR-10およびCIFAR-100においてハイパーパramータを制御したWRNアーキテクチャを用い、ND-Adam、Adam、SGDを比較した。

実験結果

リサーチクエスチョン

  • RQ1なぜ深層ニューラルネットワークにおいてAdamの一般化性能がSGDに劣るのか?
  • RQ2Adamにおける勾配方向の保持の欠如が最適化ダイナミクスに与える影響は何か?
  • RQ3Adamにおける重みベクトルの明示的正規化が一般化性能にどれほど向上効果をもたらすのか?
  • RQ4ソフトマックスのログィットの大きさは、学習信号の質と一般化にどのように影響するか?
  • RQ5正規化された重み更新と正則化されたソフトマックスを組み合わせることで、AdamとSGDの間の一般化ギャップを埋められるか?

主な発見

  • WRN-22-7.5を用いた場合、ND-AdamはCIFAR-10で3.70%、CIFAR-100で19.30%のテスト誤差を達成し、SGDと同等の性能を示した。
  • BN-SoftmaxとL2正則化付きログィットを用いることで、ND-AdamはCIFAR-10で4.14%、CIFAR-100で19.90%の誤差にまで低下させ、標準Adamを上回った。
  • 標準Adamではログィットの大きさが顕著に大きくなる(図3)、これが正則化がAdamに対してより効果的である理由を説明している。
  • 元のWRN実装では、ND-AdamとSGDはほぼ同一の一般化性能を示した(WRN-28-10を用いたCIFAR-10で3.70%の誤差)。
  • L2正則化付きソフトマックスの導入により、Adamの一般化性能が最も向上した。これは、未正則化のログィットがAdamの更新ダイナミクスの悪影響を拡大していることを示している。
  • ND-Adamは、ベクトルの正規化による更新方向と有効な学習率の精密な制御により、AdamとSGDの間の一般化ギャップを解消した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。