Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Damped L-BFGS with Controlled Norm of the Hessian Approximation

Sanae Lotfi, Dominique Orban|arXiv (Cornell University)|Jan 1, 2020
Stochastic Gradient Optimization Techniques参考文献 31被引用数 2
ひとこと要約

本稿では、Hessian近似の条件数をその最小固有値と最大固有値の境界を用いて能動的に監視・制御することにより、深層学習におけるロバスト性を向上させる、新しい確率的減衰L-BFGSアルゴリズムVARCHENを提案する。分散低減と新たな初期Hessian近似を統合することで、VARCHENはほとんど確実に定常点に収束し、SdLBFGS-VRおよびSVRGと比較して、CIFAR-10における修正DavidNetのような極めて非凸的で悪条件な問題において優れた性能と安定性を示す。

ABSTRACT

We propose a new stochastic variance-reduced damped L-BFGS algorithm, where we leverage estimates of bounds on the largest and smallest eigenvalues of the Hessian approximation to balance its quality and conditioning. Our algorithm, VARCHEN, draws from previous work that proposed a novel stochastic damped L-BFGS algorithm called SdLBFGS. We establish almost sure convergence to a stationary point and a complexity bound. We empirically demonstrate that VARCHEN is more robust than SdLBFGS-VR and SVRG on a modified DavidNet problem -- a highly nonconvex and ill-conditioned problem that arises in the context of deep learning, and their performance is comparable on a logistic regression problem and a nonconvex support-vector machine problem.

研究の動機と目的

  • 非凸最適化のための確率的L-BFGS手法におけるHessian近似の不安定性と悪条件性を解消する。
  • 標準的な確率的2次最適化手法が失敗する、極めて非凸的で悪条件な深層学習問題における収束のロバスト性を向上させる。
  • 最適化の全過程でHessian近似の条件数を制御する、分散低減型で減衰のあるL-BFGSアルゴリズムを開発する。
  • 数値的安定性を向上させ、学習動態の振動を低減するための新たな初期Hessian近似を導入する。
  • 従来の研究よりも弱い仮定の下で理論的収束保証を確立する。具体的には、勾配のリプシッツ連続性のみを仮定する。

提案手法

  • 各反復でHessian近似Hkの最小固有値と最大固有値を推定・境界化する、分散低減型の確率的減衰L-BFGSアルゴリズムVARCHENを提案する。
  • 更新則ˆyk = θkyk + (1−θk)B0k+1skを用い、曲率条件s⊤k ˆyk ≥ ηs⊤k B0k+1sk > 0を満たすことで、Hk+1が正定値のままであることを保証する。
  • Hkの固有値の下限と上限を表す動的推定値λkとΛkを維持し、悪条件性の早期検出を可能にする。
  • λkが小さくなりすぎたりΛkが大きくなりすぎたりした場合に補正機構を適用し、収束性と数値的安定性を維持する。
  • 学習損失と検証精度の振動を低減するための、初期Hessian近似H0kの新たな式を導入する。
  • ほとんど確実に定常点に収束するように保証するため、減少するステップサイズαk = c/(k+1)またはαk = λmin/(Lλ2max)k−β(β ∈ (1/2, 1))を用いる。

実験結果

リサーチクエスチョン

  • RQ1Hessian近似の条件数を制御することで、非凸的深層学習問題における確率的L-BFGSの収束ロバスト性が向上するか?
  • RQ2Hessian近似の最小固有値と最大固有値に境界を設けることで、より安定的で振動の少ない学習動態が達成されるか?
  • RQ3分散低減型で減衰のあるL-BFGS法に、適応的Hessian条件数制御を組み合わせることで、悪条件で非凸的な問題において既存の確率的2次最適化手法を上回る性能が得られるか?
  • RQ4従来の確率的減衰L-BFGS手法よりも弱い仮定の下で、ほとんど確実に定常点に収束することは可能か?
  • RQ5初期Hessian近似の選択が、深層学習における確率的L-BFGSの安定性と性能に与える影響は何か?

主な発見

  • VARCHENは、Wangら[33] よりも弱い仮定の下で、ほとんど確実に定常点に収束する。具体的には、2回微分可能性やHessianの有界性を仮定せず、勾配のリプシッツ連続性のみを要件としている。
  • CIFAR-10における修正DavidNet問題では、VARCHENはSdLBFGS-VRおよびSVRGよりも、学習損失の最小化と検証精度の両面で優れており、滑らかで振動の少ない収束を示す。
  • VARCHENでは、固有値の境界λk(最小固有値の下限)とΛk(最大固有値の上限)が良好に制御されている一方、SdLBFGS-VRでは極端で不安定な値を示しており、悪条件性が顕著に現れている。
  • VARCHENの性能はSdLBFGS-VRよりも一貫性が高く、後者では学習損失と検証精度に高い振動が見られ、おそらくHessian近似の悪条件性に起因している。
  • より挑戦が少ない問題(ロジスティック回帰および非凸SVM)では、VARCHENとSdLBFGS-VRの性能は同等であり、VARCHENの優位性が極めて非凸的で悪条件な設定において顕著であることを確認する。
  • 理論的複雑度境界により、T = O(ϵ−1/(1−β))回の反復後、平均二乗勾配ノルムE[∥∇f(xk)∥²] ≤ ϵが成立することが示され、減少ステップサイズの下で収束が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。