Skip to main content
QUICK REVIEW

[論文レビュー] Ranger21: a synergistic deep learning optimizer

Less Wright, Nestor Demeure|arXiv (Cornell University)|Jun 25, 2021
Advanced Neural Network Applications参考文献 22被引用数 4
ひとこと要約

Ranger21 は、AdamW と 8 つの補完的最適化技術(例:適応的勾配クリッピング、重み減衰の再重み付け、Lookahead など)を統合した協調的深層学習最適化手法であり、収束が速く、訓練曲線が滑らかで、バッチ正規化を用いない ImageNet2012 上の ResNet50 の学習が可能である。AdamW では完全に失敗するが、Ranger21 では成功する。

ABSTRACT

As optimizers are critical to the performances of neural networks, every year a large number of papers innovating on the subject are published. However, while most of these publications provide incremental improvements to existing algorithms, they tend to be presented as new optimizers rather than composable algorithms. Thus, many worthwhile improvements are rarely seen out of their initial publication. Taking advantage of this untapped potential, we introduce Ranger21, a new optimizer which combines AdamW with eight components, carefully selected after reviewing and testing ideas from the literature. We found that the resulting optimizer provides significantly improved validation accuracy and training speed, smoother training curves, and is even able to train a ResNet50 on ImageNet2012 without Batch Normalization layers. A problem on which AdamW stays systematically stuck in a bad initial state.

研究の動機と目的

  • 深層学習最適化手法の研究における断片化を是正すること。すなわち、増分的な改善が独立した最適化手法として提示されるのではなく、組み合わせ可能なコンポonentとして扱われるべきである。
  • 個別に検証された複数の最適化技術を統合することで、個々のコンponentsを上回る協調的性能向上が達成できるかどうかを調査すること。
  • アーキテクチャがかつて訓練が困難とされたとされるような厳しいベンチマークでも、AdamW より優れた性能を示す統合最適化手法が存在することを示すこと。
  • 実務家が最新の最適化技術を再実装することなく、すぐに利用できる公開可能でモジュラーな最適化手法を提供すること。
  • 将来の適応的最適化手法の構築に向け、メタ最適化とモジュラー設計の可能性を探索すること。

提案手法

  • Ranger21 は、コア最適化エンジンとして AdamW を採用し、勾配および勾配の二乗の指数移動平均を用いて適応的学習率を維持する。
  • 適応的勾配クリッピングを統合し、大きな勾配を動的に制限することで、分散の高いミニバッチにおける発散を防ぎ、訓練を安定化する。
  • 重み減衰の再重み付けを適用し、重み減衰と学習率を分離することで、一般化性能と訓練の安定性を向上させる。
  • Lookahead 最適化手法を組み込み、『速い』重みベクトルを遅延した移動平均更新ルールで更新することで収束性を向上させる。
  • Rectified Adam (RAdam) 技法を用いて、初期訓練段階における適応的学習率の分散を補正する。
  • 勾配正規化と修正された学習率スケジュールを適用することで、最適化ダイナミクスをさらに安定化させ、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数の組み合わせ可能な最適化改善を一つの最適化手法に統合することで、個々のコンponentsを上回る協調的性能向上が達成できるか?
  • RQ2検証済みの技術から構築された統合最適化手法が、ImageNet2012 などの標準ベンチマークで AdamW を上回る性能を示すか?
  • RQ3AdamW が収束に失敗するノーマライザフリーの ResNet50 を、Ranger21 がバッチ正規化なしで学習できるか?
  • RQ4AdamW と比較して、Ranger21 は訓練速度、検証精度、訓練曲線の滑らかさの点でどのように異なるか?
  • RQ5モジュラーかつ組み合わせ可能な最適化コンポーネントは、異なるアーキテクチャやデータセットにどの程度一般化可能か?

主な発見

  • Ranger21 は、AdamW よりも顕著に高い最終検証精度を達成し、一般化性能に優れていることを示した。
  • Ranger21 では、AdamW よりも最大 3 倍速く、重要な検証精度に到達した。これは顕著な速度向上を示している。
  • Ranger21 は、損失の振動が少ない滑らかな訓練曲線を生成し、より安定した最適化ダイナミクスを示している。
  • AdamW が収束に失敗した(損失が約 0.1 で一定)ノーマライザフリーの ResNet50 に対し、Ranger21 は 60 エポックにわたり安定した損失低下を達成した。
  • 複数のランダムシードに対して一貫した性能を示し、偶然の初期化に依存しない堅牢性を確認した。
  • Ranger21 は公開されており、即時利用可能な PyTorch および Flax 実装が提供されており、即時の採用とコミュニティからのフィードバックが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。