Skip to main content
QUICK REVIEW

[論文レビュー] Neumann Optimizer: A Practical Optimization Algorithm for Deep Neural Networks

Shankar Krishnan, Ying Xiao|arXiv (Cornell University)|Dec 8, 2017
Advanced Neural Network Applications参考文献 36被引用数 3
ひとこと要約

Neumann最適化法は、ヘシアン行列の明示的計算やヘシアン・ベクトル積を避けることで、ネウマン級数展開を用いて暗黙的にヘシアン逆行列方向を計算する、実用的で2次の確率的最適化アルゴリズムであり、深層ニューラルネットワークに適している。これは、32,000のミニバッチサイズまで線形スケーリングを実現し、検証精度に低下が生じない一方で、小さなバッチサイズでは一般化性能を0.8–0.9%向上させる。学習率の調整のみを必要とし、Adamと同等の計算コストであるため、最先端の性能を達成している。

ABSTRACT

Progress in deep learning is slowed by the days or weeks it takes to train large models. The natural solution of using more hardware is limited by diminishing returns, and leads to inefficient use of additional resources. In this paper, we present a large batch, stochastic optimization algorithm that is both faster than widely used algorithms for fixed amounts of computation, and also scales up substantially better as more computational resources become available. Our algorithm implicitly computes the inverse Hessian of each mini-batch to produce descent directions; we do so without either an explicit approximation to the Hessian or Hessian-vector products. We demonstrate the effectiveness of our algorithm by successfully training large ImageNet models (Inception-V3, Resnet-50, Resnet-101 and Inception-Resnet-V2) with mini-batch sizes of up to 32000 with no loss in validation error relative to current baselines, and no increase in the total number of steps. At smaller mini-batch sizes, our optimizer improves the validation error in these models by 0.8-0.9%. Alternatively, we can trade off this accuracy to reduce the number of training steps needed by roughly 10-30%. Our work is practical and easily usable by others -- only one hyperparameter (learning rate) needs tuning, and furthermore, the algorithm is as computationally cheap as the commonly used Adam optimizer.

研究の動機と目的

  • 大規模な深層ニューラルネットワークの学習における壁時刻ボトルネックを解消するため、スケーラブルで実用的な最適化アルゴリズムを開発すること。
  • モデルの一般化性能が低下しない大規模バッチ学習を可能にし、速度と精度の典型的なトレードオフを克服すること。
  • 明示的なヘシアン近似や高コストなヘシアン・ベクトル積を用いずに、2次情報を取り入れることで改善された降下方向を得ること。
  • Adamと同等に使いやすく、学習率のみが調整可能な1つのハイパーパrameterを持つが、速度と精度の両面で既存手法を上回る最適化法を設計すること。

提案手法

  • アルゴリズムは、各ミニバッチのヘシアンをネウマン級数展開を用いて暗黙的に逆行列化する中間最適化問題を解くことで降下方向を計算する。
  • ヘシアン行列の明示的表現を避けるために、ヘシアンの適用を単一の勾配評価に置き換えることで、計算を効率化する。
  • ヘシアン・ベクトル積の計算やヘシアン行列の保存を回避するため、ネウマン級数を用いてヘシアン逆行列を近似する。
  • 標準的な深層学習の学習パイプラインにスムーズに統合できる微分可能最適化ステップとして実装される。
  • 1つの学習率ハイパーパrameterのみを必要とし、計算コストがAdamと同等のまま維持されるため、大規模モデルに実用的である。
  • 本手法は、ResNet-50、ResNet-101、Inception-V3、Inception-ResNet-V2アーキテクチャを用いたImageNet上での大規模な実験により検証された。

実験結果

リサーチクエスチョン

  • RQ1明示的なヘシアン計算や高コストな計算を伴わずに、大規模な深層学習に実用的な2次最適化法を構築できるか?
  • RQ2ネウマン級数による暗黙のヘシアン逆行列化は、バッチサイズの増加に伴い学習性能を線形スケーリング可能であり、モデルの一般化性能を維持できるか?
  • RQ3Neumann最適化法は、標準的な最適化手法(例:Adam や RMSProp)と比較して、小さなミニバッチサイズでも一般化性能を向上させられるか?
  • RQ4勾配クリッピングが一般的なシーケンス・ツー・シーケンスRNNのような非ビジョンモデルでも、この最適化法は良好な性能を示すか?

主な発見

  • Neumann最適化法は、ResNet-50において、ミニバッチサイズが32,000に達するまで、ベースラインモデルと比較してトップ1検証誤差に低下が生じない線形スケーリングを達成した。
  • 小さなミニバッチサイズ(例:4,000)では、すべての評価対象モデルでトップ1検証誤差が0.8–0.9%改善されたが、トレーニング損失に改善は見られなかった。
  • 一般化性能の向上は、より速いトレーニングに交換可能である:ベースライン精度を維持したまま、ステップ数を10–30%削減できる。
  • アルゴリズムは、Adamと同等の計算コストを維持しており、学習率の調整のみを必要としており、実用的に容易に導入可能である。
  • 正則化を施すと性能がさらに向上し、ResNet-50においてバッチサイズ4,000でトップ1誤差を正則化なしの23.5%から正則化ありの23.0%に低下させた。
  • シーケンス・ツー・シーケンスのTacotronモデルでは、過度な勾配クリッピングによるヘシアン近似の崩壊のため、性能向上が得られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。