Skip to main content
QUICK REVIEW

[論文レビュー] Toward Understanding Why Adam Converges Faster Than SGD for Transformers

Yan Pan, Yuanzhi Li|arXiv (Cornell University)|May 31, 2023
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本論文は、方向性の鋭さ(directional sharpness)を主要な指標として導入することで、なぜAdamがTransformerの学習においてSGDよりも高速に収束するかを説明している。SGDは座標ごとの勾配の不均衡により高い方向性の鋭さを示すが、Adamの適応的学習率はこの鋭さを低減する。著者らは、この問題を緩和するための座標単位のクリッピングを提案し、複数の最適化アルゴリズムにおいて収束速度の向上と局所的損失の低減を実証した。

ABSTRACT

While stochastic gradient descent (SGD) is still the most popular optimization algorithm in deep learning, adaptive algorithms such as Adam have established empirical advantages over SGD in some deep learning applications such as training transformers. However, it remains a question that why Adam converges significantly faster than SGD in these scenarios. In this paper, we propose one explanation of why Adam converges faster than SGD using a new concept directional sharpness. We argue that the performance of optimization algorithms is closely related to the directional sharpness of the update steps, and show SGD has much worse directional sharpness compared to adaptive algorithms. We further observe that only a small fraction of the coordinates causes the bad sharpness and slow convergence of SGD, and propose to use coordinate-wise clipping as a solution to SGD and other optimization algorithms. We demonstrate the effect of coordinate-wise clipping on sharpness reduction and speeding up the convergence of optimization algorithms under various settings. We show that coordinate-wise clipping improves the local loss reduction when only a small fraction of the coordinates has bad sharpness. We conclude that the sharpness reduction effect of adaptive coordinate-wise scaling is the reason for Adam's success in practice and suggest the use of coordinate-wise clipping as a universal technique to speed up deep learning optimization.

研究の動機と目的

  • SGDとAdamが類似した理論的収束レートを持つにもかかわらず、なぜAdamがTransformerの学習で優れているのかを理解すること。
  • 深層学習における収束速度に影響を与える最適化軌道の幾何的性質を同定すること。
  • ネットワークの座標間における勾配の不均衡がSGDの性能を低下させる役割を分析すること。
  • 方向性の鋭さを低減することで収束を改善する、簡単で普遍的な手法「座標単位のクリッピング」を提案すること。
  • 適応的スケーリングによる鋭さ低減が、Adamの実験的成功の主な要因であることを検証すること。

提案手法

  • 更新方向に沿った曲率の尺度として方向性の鋭さを導入し、従来の指標よりも最適化性能をよりよく予測できることを主張する。
  • 方向性の鋭さを、更新方向に射影されたヘッセ行列のスペクトルノルムとして定義し、局所的な関数の滑らかさを捉える。
  • 高勾配・高鋭さの座標の影響を制限するため、座標単位のクリッピングを提案し、全体の方向性の鋭さを低減する。
  • ニューラルネットワークの交差エントロピー損失の局所的曲率を推定するために、ガウス・ニュートンのヘッセ近似を用いる。
  • パラメータ更新の前に勾配にクリッピングを適用することで、より大きな安定なステップサイズを可能にし、局所的損失の低減を改善する。
  • TransformerとResNetにおいて、複数の最適化手法(SGD、Adam、Adafactorなど)を用いて方向性の鋭さと収束速度を評価する。

実験結果

リサーチクエスチョン

  • RQ1SGDとAdamが類似した理論的収束保証を持つにもかかわらず、なぜAdamはTransformer学習において顕著に高速に収束するのか?
  • RQ2深層学習における収束速度に相関する最適化軌道の幾何的性質は何か?
  • RQ3SGDの性能の悪さは、座標間の勾配の不均衡によって引き起こされる高い方向性の鋭さのおかげで、どの程度影響を受けるのか?
  • RQ4座標単位のクリッピングは、方向性の鋭さを低減することで、最適化アルゴリズムの収束を普遍的に改善できるか?
  • RQ5観察された鋭さの挙動は、Transformerに特有のものなのか、アーキテクチャに一般化されるのか?

主な発見

  • SGDは、特にTransformerの学習初期段階において、Adamよりも顕著に高い方向性の鋭さを示す。
  • SGDの方向性の鋭さの大部分を占めるのは、わずか1%から2.5%の座標に限られることが判明し、勾配の大きさに強い不均衡があることが示された。
  • 座標単位のクリッピングによりこれらの高鋭さの座標を除去することで、関数の滑らかさが2〜3倍向上し、局所的損失の低減が速くなった。
  • 座標単位のクリッピングは、Adam や Adafactor を含むすべてのテストされた最適化手法において方向性の鋭さを低減し、一貫して収束速度を向上させた。
  • ResNet などの非Transformerアーキテクチャでは、Adam や Adafactor の方向性の鋭さが SGD を上回ることがあり、この現象がTransformerに特有であることが示された。
  • 最適なステップサイズを用いることで、低方向性鋭さのアルゴリズムは顕著に優れた局所的損失低減を達成した。これにより、鋭さが性能予測の重要な要因であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。