Skip to main content
QUICK REVIEW

[论文解读] Stochastic Damped L-BFGS with Controlled Norm of the Hessian Approximation

Sanae Lotfi, Dominique Orban|arXiv (Cornell University)|Jan 1, 2020
Stochastic Gradient Optimization Techniques参考文献 31被引用 2
一句话总结

本文提出 VARCHEN,一种新颖的随机阻尼 L-BFGS 算法,通过在每次迭代中主动监控并控制 Hessian 近似矩阵的条件数(基于其最小与最大特征值的上下界),显著提升了深度学习中的鲁棒性。通过集成方差缩减与一种新型初始 Hessian 近似,VARCHEN 确保了几乎必然收敛至驻点,并在高度非凸、病态条件的优化问题(如 CIFAR-10 上的改进版 DavidNet)上,相较于 SdLBFGS-VR 和 SVRG 展现出更优的性能与更高的稳定性。

ABSTRACT

We propose a new stochastic variance-reduced damped L-BFGS algorithm, where we leverage estimates of bounds on the largest and smallest eigenvalues of the Hessian approximation to balance its quality and conditioning. Our algorithm, VARCHEN, draws from previous work that proposed a novel stochastic damped L-BFGS algorithm called SdLBFGS. We establish almost sure convergence to a stationary point and a complexity bound. We empirically demonstrate that VARCHEN is more robust than SdLBFGS-VR and SVRG on a modified DavidNet problem -- a highly nonconvex and ill-conditioned problem that arises in the context of deep learning, and their performance is comparable on a logistic regression problem and a nonconvex support-vector machine problem.

研究动机与目标

  • 解决随机 L-BFGS 方法在非凸优化中 Hessian 近似矩阵的不稳定性与病态条件问题。
  • 提升在标准随机二阶方法失效的高非凸、病态条件深度学习问题中的收敛鲁棒性。
  • 开发一种方差缩减的阻尼 L-BFGS 算法,确保在整个优化过程中对 Hessian 近似矩阵的条件数保持控制。
  • 提出一种新型初始 Hessian 近似方法,以增强数值稳定性并减少训练动态中的振荡。
  • 在弱于先前工作的假设下建立理论收敛保证,包括仅要求梯度的利普希茨连续性。

提出的方法

  • 提出 VARCHEN,一种方差缩减的随机阻尼 L-BFGS 算法,可在每次迭代中估计并约束 Hessian 近似矩阵 Hk 的最小与最大特征值。
  • 采用阻尼更新规则 ˆyk = θkyk + (1−θk)B0k+1sk,以确保满足曲率条件 s⊤k ˆyk ≥ ηs⊤k B0k+1sk > 0,从而保证 Hk+1 保持正定。
  • 动态维护 Hk 的特征值下界 λk 与上界 Λk,实现对病态条件的早期检测。
  • 当 λk 过小或 Λk 过大时,启动校正机制,以维持收敛特性与数值稳定性。
  • 提出一种新的初始 Hessian 近似 H0k 公式,以改善条件数并减少训练损失与验证准确率的振荡。
  • 采用递减步长 αk = c/(k+1) 或 αk = λmin/(Lλ2max)k−β(其中 β ∈ (1/2, 1)),以确保几乎必然收敛至驻点。

实验结果

研究问题

  • RQ1控制 Hessian 近似矩阵的条件数是否能提升随机 L-BFGS 在非凸深度学习问题中的收敛鲁棒性?
  • RQ2对 Hessian 近似矩阵最小与最大特征值施加上下界,是否能带来更稳定、更少振荡的训练动态?
  • RQ3一种具备自适应 Hessian 条件控制的方差缩减阻尼 L-BFGS 方法,是否能在病态、非凸问题上超越现有随机二阶方法?
  • RQ4是否可能在弱于先前随机阻尼 L-BFGS 方法的假设下,实现几乎必然收敛至驻点?
  • RQ5初始 Hessian 近似的选择如何影响随机 L-BFGS 在深度学习中的稳定性与性能?

主要发现

  • VARCHEN 在弱于 Wang 等人 [33] 的假设下实现了几乎必然收敛至驻点,仅需梯度的利普希茨连续性,而无需二阶可微性与有界 Hessian 的假设。
  • 在 CIFAR-10 上的改进版 DavidNet 问题中,VARCHEN 在训练损失最小化与验证准确率方面均优于 SdLBFGS-VR 与 SVRG,且收敛过程更平滑、振荡更少。
  • VARCHEN 中的特征值边界 λk(最小特征值的下界)与 Λk(最大特征值的上界)保持良好控制,而 SdLBFGS-VR 显示出极端且不稳定的取值,表明存在病态条件。
  • VARCHEN 的性能比 SdLBFGS-VR 更为一致,后者在训练损失与验证准确率上表现出高振荡,可能源于 Hessian 近似矩阵的病态条件。
  • 在较不具挑战性的问题(如逻辑回归与非凸 SVM)上,VARCHEN 与 SdLBFGS-VR 表现相当,证实 VARCHEN 的优势在高度非凸与病态条件设置下最为显著。
  • 理论复杂度界表明,在 T = O(ϵ−1/(1−β)) 次迭代后,平均梯度范数平方 E[∥∇f(xk)∥²] ≤ ϵ,其中 β ∈ (1/2, 1),验证了在递减步长下的收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。