Skip to main content
QUICK REVIEW

[论文解读] Stochastic Quasi-Newton Methods for Nonconvex Stochastic Optimization

Xiao Wang, Shiqian Ma|arXiv (Cornell University)|Jul 5, 2016
Stochastic Gradient Optimization Techniques参考文献 45被引用 16
一句话总结

本文提出了一种用于非凸随机优化的随机阻尼L-BFGS(SdLBFGS)方法,基于一种通用的随机拟牛顿方法框架,几乎必然收敛至驻点。该方法在寻找ε-近似驻点时达到O(ε⁻²)的SFO调用复杂度,并提出了一个方差缩减变体(SdLBFGS-VR),在SVM和神经网络任务上优于SVRG和标准SdLBFGS。

ABSTRACT

In this paper we study stochastic quasi-Newton methods for nonconvex stochastic optimization, where we assume that noisy information about the gradients of the objective function is available via a stochastic first-order oracle (SFO). We propose a general framework for such methods, for which we prove almost sure convergence to stationary points and analyze its worst-case iteration complexity. When a randomly chosen iterate is returned as the output of such an algorithm, we prove that in the worst-case, the SFO-calls complexity is $O(ε^{-2})$ to ensure that the expectation of the squared norm of the gradient is smaller than the given accuracy tolerance $ε$. We also propose a specific algorithm, namely a stochastic damped L-BFGS (SdLBFGS) method, that falls under the proposed framework. {Moreover, we incorporate the SVRG variance reduction technique into the proposed SdLBFGS method, and analyze its SFO-calls complexity. Numerical results on a nonconvex binary classification problem using SVM, and a multiclass classification problem using neural networks are reported.

研究动机与目标

  • 解决仅通过随机一阶Oracle(SFO)获得噪声梯度估计时的非凸随机优化挑战。
  • 在较弱条件下,为随机拟牛顿方法构建一个通用框架,确保全局收敛至驻点。
  • 设计一种阻尼L-BFGS变体(SdLBFGS),在不依赖凸性的情况下保持Hessian近似的正定性。
  • 将方差缩减(SVRG)技术整合进SdLBFGS框架,以提升收敛速度与稳定性。
  • 在SVM与深度神经网络的非凸分类问题上,验证所提方法的有效性。

提出的方法

  • 提出一种通用的随机拟牛顿框架,其中通过阻尼BFGS更新计算搜索方向,以保持Hessian近似的正定性。
  • 使用随机一阶Oracle(SFO)获取噪声梯度估计,避免在每次迭代中计算完整梯度。
  • 引入阻尼技术,确保即使在曲率条件 $ s_{k-1}^T y_{k-1} < 0 $ 被违反时,Hessian近似仍保持正定。
  • 通过将SdLBFGS方法与SVRG方差缩减技术结合,提出SdLBFGS-VR,周期性地计算完整梯度。
  • 在SdLBFGS-VR中使用固定步长,在SdLBFGS中使用递减步长以确保收敛,同时采用SVRG的外层循环结构以降低梯度方差。
  • 以随机选择的迭代点作为输出,并对最坏情况下的SFO调用复杂度进行理论分析。

实验结果

研究问题

  • RQ1能否设计一种随机拟牛顿方法,在仅通过SFO访问的情况下,实现非凸随机优化中对驻点的全局收敛?
  • RQ2此类方法在达到ε-近似驻点时的最坏情况SFO调用复杂度是多少?
  • RQ3阻尼L-BFGS更新如何在不依赖凸性的情况下保持Hessian近似的正定性?
  • RQ4将方差缩减(SVRG)集成到SdLBFGS框架中是否能提升收敛速度与稳定性?
  • RQ5SdLBFGS-VR在真实世界非凸分类问题上的性能与SVRG和标准SdLBFGS相比如何?

主要发现

  • 所提出的SdLBFGS方法在适当的步长条件下,几乎必然收敛至驻点。
  • 为实现 $ \text{E}[ orm{\nabla f(x)}^2] \leq \epsilon $ 的最坏情况SFO调用复杂度为 $ O(\epsilon^{-2}) $,与已知最优的随机梯度方法复杂度一致。
  • SdLBFGS-VR作为方差缩减变体,在RCV1与MNIST数据集上始终优于SVRG与标准SdLBFGS。
  • 数值结果表明,SdLBFGS-VR对批量大小与内存大小的敏感性较低,且在较大内存下性能略有提升。
  • 在相同步长下,SdLBFGS-VR相比SVRG能实现更优的目标函数值下降,且比使用固定步长的SdLBFGS更稳定。
  • 当使用更大内存或更大批量时,$ s_{k-1}^T y_{k-1} < 0 $ 的迭代次数显著减少,表明曲率估计得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。