Skip to main content
QUICK REVIEW

[論文レビュー] Step-size Adaptation Using Exponentiated Gradient Updates

Ehsan Amid, Rohan Anil|arXiv (Cornell University)|Jan 31, 2022
Machine Learning and ELM被引用数 4
ひとこと要約

本論文は、正規化されていない指数型勾配更新(EGU)を用いて、グローバルステップサイズと各座標ごとのゲインを自己調整的に最適化するメタ最適化フレームワークを提案する。これにより、深層学習における自動的学習率スケジューリングの発見が可能となり、CIFAR-10およびImageNetでResNet50およびMobileNetV1モデルを用いた際、手動の学習率スケジューリングなしで最先端の性能を達成した。

ABSTRACT

Optimizers like Adam and AdaGrad have been very successful in training large-scale neural networks. Yet, the performance of these methods is heavily dependent on a carefully tuned learning rate schedule. We show that in many large-scale applications, augmenting a given optimizer with an adaptive tuning method of the step-size greatly improves the performance. More precisely, we maintain a global step-size scale for the update as well as a gain factor for each coordinate. We adjust the global scale based on the alignment of the average gradient and the current gradient vectors. A similar approach is used for updating the local gain factors. This type of step-size scale tuning has been done before with gradient descent updates. In this paper, we update the step-size scale and the gain variables with exponentiated gradient updates instead. Experimentally, we show that our approach can achieve compelling accuracy on standard models without using any specially tuned learning rate schedule. We also show the effectiveness of our approach for quickly adapting to distribution shifts in the data during training.

研究の動機と目的

  • 深層学習最適化手法が手動で調整された学習率スケジュールに強く依存するという問題に取り組む。
  • 既存のステップサイズ適応手法を、厳密で一般化可能なフレームワークに統合する。
  • 自己適応的なゲインおよびスケールパラメータを用いて、有効な学習率スケジュールの自動発見を可能にする。
  • 訓練中のデータ分布の変化に対して高いロバスト性を向上させる。
  • Adam、AdaGrad、SGD Momentumを含む幅広いベース最適化手法との互換性を示す。

提案手法

  • グローバルステップサイズスケールと各座標ごとのゲイン要因を学習可能なハイパーパrameterとして維持するメタ最適化フレームワークを導入する。
  • 非正規化された指数型勾配更新(EGU)を用いて、グローバルスケールと局所的ゲインを更新する。EGUは非負性を強制し、乗法的かつスパースな更新を可能にする。
  • EGUの更新則は:θ^{t+1} = θ^t ⊙ exp(−η ∇_θ f(θ^t)) であり、安定的かつ非負のパラメータ更新を保証する。
  • 任意のベース最適化手法(例:Adam、AdaGrad、SGD Momentum)からの事前条件付き勾配を受け入れるため、モジュラーかつ広範に適用可能である。
  • スケールおよびゲインの更新のための整合性信号を、勾配の指数移動平均(EMA)を用いて計算する。
  • 内部最適化手法に依存せず、プラグイン型のメタアルゴリズムとして適用可能である。

実験結果

リサーチクエスチョン

  • RQ1統一的で原理的根拠を持つステップサイズ適応手法は、大規模な深層学習において手動の学習率スケジューリングを上回ることができるか?
  • RQ2EGUに基づくグローバルスケールおよび各座標ごとのゲインのチューニングは、有効な学習率スケジュールを自動で発見するのにどの程度効果的か?
  • RQ3提案手法は再トレーニングなしに一般化性能を向上させ、データ分布のシフトに適応できるか?
  • RQ4異なるアーキテクチャ(例:MobileNetV1、ResNet50)およびデータセット(CIFAR-10、ImageNet)において、本手法はどの程度の性能を示すか?
  • RQ5EGUに基づく更新機構は、ヒューリスティック法や勾配ベースのチューニング手法に比べ、収束性および安定性において優位性を示すか?

主な発見

  • MobileNetV1を用いたCIFAR-10では、Funneled Momentumは学習率スケジューリングなしでトップ-1精度89.61%を達成し、手動スケジューリングを用いたベースライン(89.51%)と同等の精度を達成した。
  • ResNet50を用いたImageNetでは、Funneled Momentumは学習率スケジューリングなしでトップ-1精度72.39%を達成し、AdaGrad-EMA(70.70%)を上回り、標準的なMomentum(53.80%)を著しく上回った。
  • 本手法は、すべての層でグローバルステップサイズに類似したスケジューリングを自動的に回復するが、層ごとに異なる減衰率を示す。図4に示す。
  • 各座標ごとのゲイン値は、初期に約5,000ステップの間、動的に上昇した後、減少する傾向を示しており、関連する特徴の適応的探索を示している。
  • 本手法は、分布シフトに対してロバストであり、訓練中に迅速に適応する様子が実証された。
  • コードは再現性およびさらなる研究のため、https://users.soe.ucsc.edu/~eamid/funnel.html で公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。