Skip to main content
QUICK REVIEW

[論文レビュー] Penalizing Gradient Norm for Efficiently Improving Generalization in Deep Learning

Yang Zhao, Hao Zhang|arXiv (Cornell University)|Feb 8, 2022
Advanced Neural Network Applications被引用数 16
ひとこと要約

本稿では、損失関数の勾配ノルムを罰則化することで、計算コストの高いヘッセ行列の計算を避けるために1次近似を用いることで、深層学習の一般化性能を向上させる新しい最適化手法を提案する。この手法は、標準的なSGDおよびSharpness-Aware Minimization(SAM)を上回り、CIFARおよびImageNetベンチマークで最高水準の結果を達成し、最大70%の向上を実現する。

ABSTRACT

How to train deep neural networks (DNNs) to generalize well is a central concern in deep learning, especially for severely overparameterized networks nowadays. In this paper, we propose an effective method to improve the model generalization by additionally penalizing the gradient norm of loss function during optimization. We demonstrate that confining the gradient norm of loss function could help lead the optimizers towards finding flat minima. We leverage the first-order approximation to efficiently implement the corresponding gradient to fit well in the gradient descent framework. In our experiments, we confirm that when using our methods, generalization performance of various models could be improved on different datasets. Also, we show that the recent sharpness-aware minimization method (Foret et al., 2021) is a special, but not the best, case of our method, where the best case of our method could give new state-of-art performance on these tasks. Code is available at {https://github.com/zhaoyang-0204/gnp}.

研究の動機と目的

  • 過パラメータ化された深層ニューラルネットワークにおける一般化性能の低さという課題に対処し、最適化を平坦な最小値へと明示的に誘導すること。
  • ヘッセ行列の計算による勾配ノルムの直接最小化が計算的に非現実的であるのを克服し、効率的な1次近似を導入すること。
  • 勾配ノルムの罰則化が平坦な最小値をもたらし、これは鋭い最小値よりも一般化性能が優れていることが知られていることの実証。
  • 最近のSAM手法が提案されたフレームワークの特別なケースであることを示し、最適なハイパーパrameterチューニングにより、本手法がより優れた性能を達成できることを示すこと。
  • 実世界の訓練シナリオで一般化性能を最大化するための実用的なハイパーパrameter選定ガイドを提供すること。

提案手法

  • ネットワークパラメータに関する損失関数の勾配のL2ノルムに罰則項を追加する新しい訓練目的を提案する。
  • 2次微分を避けるために、勾配ノルムの勾配を1次近似で計算する。これにより、標準的なSGDフレームワークでの効率的実装が可能になる。
  • SAMに類似したミニマックス問題として最適化を定式化するが、より一般かつ柔軟な罰則構造を有する。
  • 2つのハイパーパrameterを導入する:α(罰則の大きさを制御)とr(ミニマックス定式化における摂動の半径を制御)。
  • バックプロパゲーションを介した1次近似を通じて、標準的なディープラーニングフレームワークでこの手法を実装する。
  • 過剰な罰則化が勾配ノルムを早期にゼロに収束させるのを防ぐために、ハイパーパrameterを慎重に選択することで安定した訓練を実現する。

実験結果

リサーチクエスチョン

  • RQ1損失関数の勾配ノルムを罰則化することで、深層ニューラルネットワークにおける平坦な最小値が得られ、一般化性能が向上するか?
  • RQ2ヘッセ行列の計算を避けて、勾配ノルム罰則をどのように効率的に実装できるか?
  • RQ3Sharpness-Aware Minimization(SAM)手法は、提案された一般フレームワークの特別なケースであるか?
  • RQ4異なるアーサテクチャとデータセットで最適な一般化性能を達成するためのハイパーパラメータ設定(αとr)は何か?
  • RQ5提案手法は、CIFAR-10、CIFAR-100、ImageNetなどの多様なベンチマークで、標準的なSGDおよびSAMを一貫して上回るか?

主な発見

  • 提案手法はCIFAR-10およびCIFAR-100で最先端の性能を達成し、SAMの結果よりも最大70%も高い向上を実現した。
  • ImageNetでは、VGG16-BNでトップ-1誤差率を0.37%、ResNet50で0.29%、ResNet101で0.45%削減し、標準的な訓練を上回り、さらにSAMをも凌駆する。
  • CIFAR-10のWideResNet-28-10では、最良のハイパーパラメータ(α=0.8、r∈{0.05,0.1})が最高の性能をもたらしたが、大きなα値(例:α=2.0)は勾配ノルムの早期収束を引き起こし、テスト精度を低下させた。
  • 一部の設定では、ハイパーパラメータを丁寧にチューニングした場合、SAMよりも訓練の安定性が向上した。
  • 勾配ノルム罰則は、最適化が平坦な最小値に収束するのを効果的に促進し、これはより良い一般化と相関している。
  • この手法は、畳み込みネットワークやビジョントランスフォーマーを含むさまざまなアーサテクチャに広く適用可能であり、小規模(CIFAR)および大規模(ImageNet)の両方のデータセットで効果的に機能する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。