Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Gradient Descent with Nonlinear Conjugate Gradient-Style Adaptive Momentum

Bao Wang, Qiang Ye|arXiv (Cornell University)|Dec 3, 2020
Adversarial Robustness in Machine Learning参考文献 30被引用数 9
ひとこと要約

本論文は、非線形共役勾配(NCG)スタイルの適応的モーメンタムを備えた確率的勾配降下法(FRSGD)を提案する。この手法は、手動によるモーメンタムハイパーパrameterのチューニングの必要性を排除する。勾配履歴に基づいて動的にモーメンタムを調整することで、より大きな学習率を可能にし、トレーニングを高速化するとともに、ResNetモデルにおけるクリーン精度および敵対的精度を向上させる。CIFAR-10のテスト誤差は5.25%から4.64%へ、CIFAR-100は23.75%から20.03%へ低下する。

ABSTRACT

Momentum plays a crucial role in stochastic gradient-based optimization algorithms for accelerating or improving training deep neural networks (DNNs). In deep learning practice, the momentum is usually weighted by a well-calibrated constant. However, tuning hyperparameters for momentum can be a significant computational burden. In this paper, we propose a novel \emph{adaptive momentum} for improving DNNs training; this adaptive momentum, with no momentum related hyperparameter required, is motivated by the nonlinear conjugate gradient (NCG) method. Stochastic gradient descent (SGD) with this new adaptive momentum eliminates the need for the momentum hyperparameter calibration, allows a significantly larger learning rate, accelerates DNN training, and improves final accuracy and robustness of the trained DNNs. For instance, SGD with this adaptive momentum reduces classification errors for training ResNet110 for CIFAR10 and CIFAR100 from $5.25\%$ to $4.64\%$ and $23.75\%$ to $20.03\%$, respectively. Furthermore, SGD with the new adaptive momentum also benefits adversarial training and improves adversarial robustness of the trained DNNs.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)のトレーニングにおけるSGDのモーメンタムハイパーパrameterチューニングの計算負荷を軽減すること。
  • 計算コストを増加させることなく、DNNの収束速度と最終的なモデル精度を向上させること。
  • 新しい適応的モーメンタム機構を用いて、DNNの敵対的耐性を強化すること。
  • Adam やネステロフモーメンタムのような既存の適応的最適化手法の簡単で効果的な代替策を開発すること。

提案手法

  • 非線形共役勾配(NCG)法にインspiredされた新しい適応的モーメンタム項を導入し、固定されたモーメンタム係数βを動的に計算される値に置き換える。
  • 現在および直前の勾配に依存するNCGから導出された式を用いてモーメンタム更新を行うことで、降下方向の適応性を確保する。
  • 固定された学習率を維持しつつ、収束特性の向上により、はるかに大きなステップサイズを可能にする。
  • 標準的なSGDと後方互換性を持つように設計されており、コード変更を最小限に抑える。
  • ミニバッチトレーニングに適した簡素化され効率的なNCGモーメンタム更新の近似を用いることで、ラインサーチを回避する。
  • 追加のハイパーパrameterがチューニング不要なため、定数βの代わりにSGDに統合される。

実験結果

リサーチクエスチョン

  • RQ1NCGにインspiredされた適応的モーメンタム機構は、DNNのSGDトレーニングにおける速度と収束性を向上させることができるか?
  • RQ2モーメンタムハイパーパrameterβの削除により、計算コストを増加させることなく、DNNの一般化性能と耐性が向上するか?
  • RQ3この適応的モーメンタムにより、モデル精度を維持または向上させながら、より大きな学習率を可能にすることができるか?
  • RQ4クリーン精度および敵対的精度の観点から、本手法はネステロフモーメンタム付きSGDおよびAdamと比較してどのように評価されるか?
  • RQ5この適応的モーメンタムは、さまざまな敵対的攻撃に対してDNNの敵対的耐性を向上させることができるか?

主な発見

  • FRSGDは、ResNet110におけるCIFAR-10のテスト誤差を5.25%から4.64%へ低下させ、相対的改善率は11.6%である。
  • CIFAR-100では、テスト誤差が23.75%から20.03%へ低下し、相対的改善率は15.6%である。
  • 延長トレーニング(400エポック)を実施した場合、FRSGDはCIFAR-10で4.26%、CIFAR-100で19.89%のテスト誤差を達成し、SGDおよびSGD+ネステロフモーメンタムを上回る性能を示した。
  • CIFAR-10のPreResNet290におけるFRSGDのトレーニング損失は0.00138であり、SGDの0.0048およびSGD+NMの0.0052よりも顕著に低い。
  • 敵対的トレーニングにおいて、FRSGDはIFGSM-100攻撃下でCIFAR-10で52.15%のロバスト精度を達成した。これはSGD+NMの51.08%を上回る。
  • FRSGDは、FGSM、IFGSM、C&Wのすべての攻撃に対して一貫した利点を示し、ベースラインのSGDおよびSGD+NMを上回る耐性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。