Skip to main content
QUICK REVIEW

[論文レビュー] Understanding and Scheduling Weight Decay

Zeke Xie, Issei Sato|arXiv (Cornell University)|Nov 23, 2020
Adversarial Robustness in Machine Learning参考文献 60被引用数 10
ひとこと要約

本稿では、学習ダイナミクスを通じた重み減衰の新しい理論的解釈を提案し、学習率に応じて重み減衰を動的にスケジューリングする Stable Weight Decay (SWD) スケジューラーを導入する。また、大バッチ学習における線形スケーリング則を提示し、バッチサイズに比例して重み減衰を増加させることで、標準的なL2正則化や重み減衰を分離した手法よりも一般化性能を向上させる。

ABSTRACT

Weight decay is a popular and even necessary regularization technique for training deep neural networks that generalize well. Previous work usually interpreted weight decay as a Gaussian prior from the Bayesian perspective. However, weight decay sometimes shows mysterious behaviors beyond the conventional understanding. For example, the optimal weight decay value tends to be zero given long enough training time. Moreover, existing work typically failed to recognize the importance of scheduling weight decay during training. Our work aims at theoretically understanding novel behaviors of weight decay and designing schedulers for weight decay in deep learning. This paper mainly has three contributions. First, we propose a novel theoretical interpretation of weight decay from the perspective of learning dynamics. Second, we propose a novel weight-decay linear scaling rule for large-batch training that proportionally increases weight decay rather than the learning rate as the batch size increases. Third, we provide an effective learning-rate-aware scheduler for weight decay, called the Stable Weight Decay (SWD) method, which, to the best of our knowledge, is the first practical design for weight decay scheduling. In our various experiments, the SWD method often makes improvements over $L_{2}$ Regularization and Decoupled Weight Decay.

研究の動機と目的

  • 長期間の学習において最適な重み減衰値がゼロに近づくという奇妙な振る舞いを解消するため、学習ダイナミクスの観点から重み減衰を再解釈すること。
  • 現在の深層学習実践において重み減衰スケジューリングがほとんど無視されているという問題を解決すること。
  • モデルの一般化性能を向上させる、学習率に依存する実用的な重み減衰スケジューラーを開発すること。
  • バッチサイズに比例して重み減衰を増加させる線形スケーリング則を提案し、学習率のスケーリング則とは異なった方法で大バッチ学習を安定化させること。
  • 特に長期間の学習や大バッチ学習の状況において、従来のL2正則化や重み減衰を分離した手法に対する理論的裏付けのある代替手法を提供すること。

提案手法

  • 勾配降下法のダイナミクスに基づく、重み減衰の新しい理論的解釈を提案し、訓練中の重みノルムの変化と関連付ける。
  • バッチサイズに比例して重み減衰を増加させる線形スケーリング則を導入し、大バッチ学習でも一般化性能を維持できるようにする。
  • 現在の学習率に応じて重み減衰を動的に調整する Stable Weight Decay (SWD) スケジューラーを設計し、訓練の安定化と一般化性能の向上を図る。
  • 特に長期間の学習において発散や収束不良を避けるために、重み減衰をスケジューリングする理論的条件を導出する。
  • 複数のデータセットとアーキテクチャを用いた実験を通じて、SWDをL2正則化や重み減衰を分離した手法と比較する。
  • 最適化軌道における学習率と重み減衰の相互作用を分析し、安定した訓練を維持するためにはその比を一定に保つべきであることを示す。

実験結果

リサーチクエスチョン

  • RQ1なぜ長期間の学習において最適な重み減衰値がゼロに近づくのか、その振る舞いを理論的に説明できるか?
  • RQ2特に長期間の学習や大バッチ学習の状況において、一般化性能を維持するためには重み減衰をどのようにスケジューリングすべきか?
  • RQ3バッチサイズを増加させる際の重み減衰の正しいスケーリング則は何か? これは標準的な学習率スケーリング則とはどのように異なるか?
  • RQ4学習率に依存する重み減衰スケジューラーは、実際の応用において標準的なL2正則化や重み減衰を分離した手法を上回ることができるか?
  • RQ5重み減衰と確率的勾配降下法における重みノルムの変化ダイナミクスとの理論的関連性は何か?

主な発見

  • 長期間の学習において最適な重み減衰値はゼロに近づくが、本稿では学習ダイナミクスと時間経過による重みノルムの減少という観点からこれを理論的に説明する。
  • 提案された Stable Weight Decay (SWD) スケジューラーは、複数のベンチマークとアーキテクチャにおいて、標準的なL2正則化や重み減衰を分離した手法よりも一貫して一般化性能を向上させる。
  • バッチサイズに比例して重み減衰を増加させる線形スケーリング則により、大ミニバッチを用いた安定な訓練が可能となり、小バッチ学習と同等の性能を維持できる。
  • 理論的分析から、重み減衰は学習率と連携してスケジューリングされるべきであり、有効な学習率を維持し、不安定性を回避するためである。
  • 実験結果から、SWDは特に大バッチおよび長期間の学習環境において、ImageNet や CIFAR-10 でベースライン手法よりも高いテスト精度を達成することが示された。
  • 本稿では、重み減衰が単なる事前分布ではなく、最適化の安定性や一般化に顕著な影響を与える動的正則化項であることが確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。