Skip to main content
QUICK REVIEW

[論文レビュー] Scheduled Restart Momentum for Accelerated Stochastic Gradient Descent

Bao Wang, Tan M. Nguyen|arXiv (Cornell University)|Feb 24, 2020
Stochastic Gradient Optimization Techniques被引用数 5
ひとこと要約

本論文は、深層ニューラルネットワークにおける学習の安定性と収束速度の向上を目的として、Nesterov加速勾配降下法と周期的なモーメンタムリセットを統合した新しい最適化アルゴリズム、Scheduled Restart Stochastic Gradient Descent (SRSGD) を提案する。定数モーメンタムの代わりに、固定回数の反復ごとにリセットされる増加するNesterovモーメンタムを導入することで、SRSGDは収束を加速させるとともに、一般化性能を向上させ、ResNet200におけるImageNetの誤差をベースラインのSGDの22.13%から20.93%に低減した。

ABSTRACT

Stochastic gradient descent (SGD) with constant momentum and its variants such as Adam are the optimization algorithms of choice for training deep neural networks (DNNs). Since DNN training is incredibly computationally expensive, there is great interest in speeding up the convergence. Nesterov accelerated gradient (NAG) improves the convergence rate of gradient descent (GD) for convex optimization using a specially designed momentum; however, it accumulates error when an inexact gradient is used (such as in SGD), slowing convergence at best and diverging at worst. In this paper, we propose Scheduled Restart SGD (SRSGD), a new NAG-style scheme for training DNNs. SRSGD replaces the constant momentum in SGD by the increasing momentum in NAG but stabilizes the iterations by resetting the momentum to zero according to a schedule. Using a variety of models and benchmarks for image classification, we demonstrate that, in training DNNs, SRSGD significantly improves convergence and generalization; for instance in training ResNet200 for ImageNet classification, SRSGD achieves an error rate of 20.93% vs. the benchmark of 22.13%. These improvements become more significant as the network grows deeper. Furthermore, on both CIFAR and ImageNet, SRSGD reaches similar or even better error rates with significantly fewer training epochs compared to the SGD baseline.

研究の動機と目的

  • 深層学習における不正確な勾配を用いる場合にNesterov加速勾配降下法(NASGD)が誤差蓄積を起こしやすく、不安定になる問題を解決すること。
  • 実際の応用ではNesterov法の最適なO(1/k²)収束速度を達成できない、SGDにおける定数モーメンタムの限界を克服すること。
  • Nesterovモーメンタムの高速収束性と周期的リセットの安定性を組み合わせた実用的な最適化アルゴリズムを開発すること。
  • 特に深層アーキテクチャにおいて、訓練速度とモデル精度の顕著な向上を示すこと。
  • NASGDにおける誤差蓄積の理論的分析と、SRSGDの収束保証を提供すること。

提案手法

  • 固定回数の反復ごとにモーメンタムをゼロにリセットするスケジュールされたリスタート機構を導入し、確率的設定下でのNesterovモーメンタムの安定化を実現する。
  • SGDにおける定数モーメンタムを、時間に応じて変化するNesterovモーメンタム係数μ_k = (k-1)/(k+2)に置き換え、収束を加速する。
  • 周期的モーメンタム更新を実装:v^{k+1} = w^k - s_k ∇f(w^k), w^{k+1} = v^{k+1} + μ_k (v^{k+1} - v^k) で、モーメンタムバッファを周期的にリセットする。
  • ユーザーが定義した反復回数ごとにモーメンタムをリセットする学習率およびモーメンタムスケジュールを設計し、訓練の進行に応じて適応的に調整する。
  • モジュラー実装により、PyTorchおよびKerasフレームワークに統合し、ディープラーニングパイプラインへの容易な統合を実現する。
  • 以前の速度を追跡するモーメンタムバッファを用いて、効率的なNesterovスタイルの先読み更新を可能にする。

実験結果

リサーチクエスチョン

  • RQ1不正確な勾配を伴う確率的勾配降下法において、Nesterov加速モーメンタムが誤差蓄積の傾向を示す中で、その安定性を確保できるか?
  • RQ2定数モーメンタムやAdamと比較して、周期的モーメンタムリセットが深層ニューラルネットワークの学習における収束速度と一般化性能を向上させるか?
  • RQ3CIFAR-10やImageNetなどの標準的な画像分類ベンチマークにおいて、SRSGDは特に深層ネットワークでどのように性能を発揮するか?
  • RQ4リスタート間隔が訓練の安定性および最終的なモデル精度に与える影響は何か?
  • RQ5SGDやAdamと比較して、SRSGDはより少ない訓練エポック数で収束を達成し、テスト精度を維持または向上させられるか?

主な発見

  • ResNet200を用いたImageNet分類において、SRSGDはベースラインのSGDの22.13%から20.93%へトップ-1誤差率を低減させ、顕著な一般化性能の向上を示した。
  • CIFAR-10およびCIFAR-100において、SRSGDはSGDやAdamと同等またはそれ以上のテスト精度を達成したが、はるかに少ない訓練エポック数で実現した。
  • ネットワークの深さが増すほど、SRSGDの性能向上効果が顕著になる傾向があり、特に深層アーキテクチャにおいてより大きな利点を示した。
  • SRSGDは確率的設定下でのNesterovモーメンタム機構を安定化させ、標準的なNASGDで観察された発散や誤差蓄積を抑制した。
  • 適応的モーメンタムスケジューリングのおかげで、収束が速く、より少ない反復回数で低い損失値に到達した。
  • スケジュールされたリスタート機構は、加速と安定性のバランスを効果的に実現し、Nesterovモーメンタムを現実のディープラーニング訓練に実用的なものにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。