Skip to main content
QUICK REVIEW

[論文レビュー] Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be

Frederik Künstner, Jacques Chen|arXiv (Cornell University)|Apr 27, 2023
Neural Networks and Applications被引用数 5
ひとこと要約

この論文は、TransformerにおけるSGDとAdamの性能差が、重尾の確率的勾配ノイズに起因するという仮説に挑戦する。代わりに、Adamは完全ミニバッチ学習設定でもSGDを上回ることを発見し、その優位性は、勾配の符号に基づく勾配更新に類似した動き(勾配符号の適応)を示すことに起因する。これは、ノイズ耐性ではなく、決定的で適応的な勾配正規化が性能差を生んでいることを示唆する。

ABSTRACT

The success of the Adam optimizer on a wide array of architectures has made it the default in settings where stochastic gradient descent (SGD) performs poorly. However, our theoretical understanding of this discrepancy is lagging, preventing the development of significant improvements on either algorithm. Recent work advances the hypothesis that Adam and other heuristics like gradient clipping outperform SGD on language tasks because the distribution of the error induced by sampling has heavy tails. This suggests that Adam outperform SGD because it uses a more robust gradient estimate. We evaluate this hypothesis by varying the batch size, up to the entire dataset, to control for stochasticity. We present evidence that stochasticity and heavy-tailed noise are not major factors in the performance gap between SGD and Adam. Rather, Adam performs better as the batch size increases, while SGD is less effective at taking advantage of the reduction in noise. This raises the question as to why Adam outperforms SGD in the full-batch setting. Through further investigation of simpler variants of SGD, we find that the behavior of Adam with large batches is similar to sign descent with momentum.

研究の動機と目的

  • TransformerモデルにおけるSGDとAdamの性能差が、重尾の確率的勾配ノイズに起因する主因であるかどうかを調査すること。
  • バッチサイズを変化させることで、特に完全ミニバッチ学習におけるノイズの役割を評価すること。
  • ノイズが最小限に抑えられた低ノイズ・完全ミニバッチ設定でもAdamがSGDを上回る理由を解明すること。
  • 性能差を説明する要因として、勾配の符号の適応といった決定的特性がより適切であるかどうかを特定すること。
  • Adamの大きなバッチサイズ下での挙動が、勾配の符号に基づく降下に類似しているかどうかを検証し、その成功の新たな理論的説明を提示すること。

提案手法

  • 言語モデリングタスク(PTB、Wikitext2、SQuAD)および画像タスク(MNIST、CIFAR-10)を用いて、バッチサイズを変化させたSGDとAdamの性能を実験的に評価する。完全ミニバッチ学習を含む。
  • QQプロットを用いて、確率的勾配誤差(‖g − g̃‖)の分布を正規分布およびα安定分布と比較し、尾の重さを評価する。
  • 完全ミニバッチ設定での最適化手法の挙動を分析し、ノイズのない決定的要因を隔離する。
  • Adamの更新ダイナミクスを、勾配の符号に基づく降下に類似した動きと比較する。特に、座標ごとの勾配符号推定の観点から分析する。
  • 符号ベースの更新とモーメンタムの効果を分離するために、アブレーションスタディおよび簡略化された最適化手法を用いる。
  • ハイパーパramータのグリッドサーチを実施し、学習損失のトレンドを報告する。一般化性能の洞察を得るために、検証指標を併記する。

実験結果

リサーチクエスチョン

  • RQ1SGDとAdamの性能差が、以前の仮説通り、Transformerにおける重尾の確率的勾配ノイズに起因しているとみなせるか?
  • RQ2バッチサイズが増加するにつれて、SGDとAdamの性能差はどのように変化するか。特に、ノイズが最小限に抑えられた状況での変化を問う。
  • RQ3完全ミニバッチ設定でもAdamが優位であるという事実から、ノイズ耐性がその成功の主因ではないという結論が導けるか?
  • RQ4大きなバッチサイズでのAdamの挙動は、どの程度勾配の符号に基づく降下に類似しているか?
  • RQ5Transformerでは、CNNと比較してSGDとAdamの性能差が大きくなる要因(アーキテクチャ的要因など)は何か?

主な発見

  • 完全ミニバッチ設定では確率的ノイズが排除されるが、SGDとAdamの性能差は依然として存在する。これは、ノイズ耐性がAdam成功の主因であるという仮説に反する。
  • バッチサイズが増加するにつれて、AdamはSGDを上回り続けるが、SGDはノイズの低減から利益を得られない。これは、性能差がノイズに起因するものではないことを示唆する。
  • 大きなバッチサイズ下でのAdamの挙動は、勾配の符号に基づく降下に類似しており、座標ごとの勾配符号推定がその優位性の背後にある可能性がある。
  • 言語タスクにおける勾配誤差分布のQQプロット分析から、以前の主張とは異なり、勾配誤差の分布は言語タスクでは重尾であるとは言えない。
  • ResNet18を用いたCIFAR-10のような画像タスクでは、SGDとAdamの性能差は小さく、一貫性も低い。これは、アーキテクチャ的要因(例:バッチ正則化)が最適化手法の挙動に影響を与えている可能性を示唆する。
  • 学習損失をより良く最適化する最適化手法は、より早く検証損失を低くする。これは、この設定下で学習ダイナミクスと一般化性能の間に関連性があることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。