Skip to main content
QUICK REVIEW

[論文レビュー] Implementation of Stochastic Quasi-Newton's Method in PyTorch

Yingkai Li, Huidong Liu|arXiv (Cornell University)|May 7, 2018
Stochastic Gradient Optimization Techniques参考文献 4被引用数 8
ひとこと要約

この論文は、非凸な確率的最適化のためのPyTorchにおけるStochastic Damped L-BFGS(SdLBFGS)最適化手法の改善実装を提示する。ヘシアン近似を単位行列で初期化し、探索方向を正規化することで、元のSdLBFGS0よりも収束性と安定性が向上し、SGD や Adagrad といった一次最適化手法を上回り、CIFAR10 および MNIST におけるテスト精度で LBFGS と同等またはそれを上回る性能を達成した。

ABSTRACT

In this paper, we implement the Stochastic Damped LBFGS (SdLBFGS) for stochastic non-convex optimization. We make two important modifications to the original SdLBFGS algorithm. First, by initializing the Hessian at each step using an identity matrix, the algorithm converges better than original algorithm. Second, by performing direction normalization we could gain stable optimization procedure without line search. Experiments on minimizing a 2D non-convex function shows that our improved algorithm converges better than original algorithm, and experiments on the CIFAR10 and MNIST datasets show that our improved algorithm works stably and gives comparable or even better testing accuracies than first order optimizers SGD, Adagrad, and second order optimizers LBFGS in PyTorch.

研究の動機と目的

  • 深層学習最適化における元のSdLBFGS0アルゴリズムの不安定性および収束不能問題を解消する。
  • 非凸な深層ニューラルネットワークにおける2次最適化の収束性と数値的安定性を向上させる。
  • ラインサーチや手動の初期学習率設定を必要とせず、PyTorchにおける準ニュートン法の実用的導入を可能にする。
  • 改良型SdLBFGSが広く使われている一次および二次最適化手法と比較して、競争力あるか、あるいはそれを上回るテスト精度を達成するかを実証する。

提案手法

  • 最適化ステップごとにヘシアン初期化を元のものから単位行列に置き換えることで収束性を向上させる。
  • 探索方向のL2正規化を導入し、最適化プロセスの安定化を図り、ラインサーチの必要性を排除する。
  • 限られたメモリを用いたBFGS更新と、修正された曲率ペアを用いた減衰ヘシアン近似を用いるSdLBFGSのコアフレームワークを維持する。
  • 減衰更新式を用いる:$\bar{y}_{k-1} = \theta_{k-1} y_{k-1} + (1 - \theta_{k-1}) H_{k,0}^{-1} s_{k-1} $、ここで$\theta_{k-1}$はヘシアンの半正定値性を保証する。
  • メモリ効率の良いベクトル演算を用いてL-BFGS更新列を実装し、全行列を保存せずにヘシアン逆行列を近似する。
  • 改良型SdLBFGSをPyTorchに統合し、エンドツーエンド微分可能最適化を実現させ、標準的な深層学習訓練ループでの利用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ラインサーチを必要とせず、SdLBFGS0アルゴリズムを深層学習における実用的用途に安定化できるか?
  • RQ2ヘシアン近似を単位行列で初期化することで、非凸最適化における収束性が向上するか?
  • RQ3方向正規化がラインサーチの代わりに最適化の安定性と収束性を維持できるか?
  • RQ4標準的な視覚ベンチマークにおいて、改良型SdLBFGSは一次最適化手法(SGD、Adagrad)および二次最適化手法(LBFGS)と比較して、テスト精度および学習安定性においてどうなるか?

主な発見

  • 改良型SdLBFGSはCIFAR10で最終的に約66%のテスト精度を達成し、SGDやAdagrad(約62%)を上回り、組み込みのLBFGSオプティマイザをも凌駆した。
  • MNISTデータセットでは、SdLBFGSは約98%のテスト精度を達成し、SGDやAdagradと同等の性能を示したが、LBFGSは完全に失敗し、わずか約10%の精度にとどまった。
  • SdLBFGS0はCIFAR10およびMNISTの両方で数エポック後にクラッシュし、NaN値を出力したが、改良型SdLBFGSは安定して収束した。
  • 最適な学習率下で、すべてのベースラインと比較して、精度の上昇が早く、損失の低下も安定していた。
  • ラインサーチを必要とせず、学習率の選択に頑健であることを示し、LBFGSと同等またはそれ以上の性能を達成した。
  • 方向正規化と単位行列によるヘシアン初期化は両方とも安定性と収束性において不可欠であり、アブレーション実験でいずれかを除去すると失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。