[论文解读] Stochastic Quasi-Newton Methods for Nonconvex Stochastic Optimization
本文提出了一种用于非凸随机优化的随机阻尼L-BFGS(SdLBFGS)方法,基于一种通用的随机拟牛顿方法框架,几乎必然收敛至驻点。该方法在寻找ε-近似驻点时达到O(ε⁻²)的SFO调用复杂度,并提出了一个方差缩减变体(SdLBFGS-VR),在SVM和神经网络任务上优于SVRG和标准SdLBFGS。
In this paper we study stochastic quasi-Newton methods for nonconvex stochastic optimization, where we assume that noisy information about the gradients of the objective function is available via a stochastic first-order oracle (SFO). We propose a general framework for such methods, for which we prove almost sure convergence to stationary points and analyze its worst-case iteration complexity. When a randomly chosen iterate is returned as the output of such an algorithm, we prove that in the worst-case, the SFO-calls complexity is $O(ε^{-2})$ to ensure that the expectation of the squared norm of the gradient is smaller than the given accuracy tolerance $ε$. We also propose a specific algorithm, namely a stochastic damped L-BFGS (SdLBFGS) method, that falls under the proposed framework. {Moreover, we incorporate the SVRG variance reduction technique into the proposed SdLBFGS method, and analyze its SFO-calls complexity. Numerical results on a nonconvex binary classification problem using SVM, and a multiclass classification problem using neural networks are reported.
研究动机与目标
- 解决仅通过随机一阶Oracle(SFO)获得噪声梯度估计时的非凸随机优化挑战。
- 在较弱条件下,为随机拟牛顿方法构建一个通用框架,确保全局收敛至驻点。
- 设计一种阻尼L-BFGS变体(SdLBFGS),在不依赖凸性的情况下保持Hessian近似的正定性。
- 将方差缩减(SVRG)技术整合进SdLBFGS框架,以提升收敛速度与稳定性。
- 在SVM与深度神经网络的非凸分类问题上,验证所提方法的有效性。
提出的方法
- 提出一种通用的随机拟牛顿框架,其中通过阻尼BFGS更新计算搜索方向,以保持Hessian近似的正定性。
- 使用随机一阶Oracle(SFO)获取噪声梯度估计,避免在每次迭代中计算完整梯度。
- 引入阻尼技术,确保即使在曲率条件 $ s_{k-1}^T y_{k-1} < 0 $ 被违反时,Hessian近似仍保持正定。
- 通过将SdLBFGS方法与SVRG方差缩减技术结合,提出SdLBFGS-VR,周期性地计算完整梯度。
- 在SdLBFGS-VR中使用固定步长,在SdLBFGS中使用递减步长以确保收敛,同时采用SVRG的外层循环结构以降低梯度方差。
- 以随机选择的迭代点作为输出,并对最坏情况下的SFO调用复杂度进行理论分析。
实验结果
研究问题
- RQ1能否设计一种随机拟牛顿方法,在仅通过SFO访问的情况下,实现非凸随机优化中对驻点的全局收敛?
- RQ2此类方法在达到ε-近似驻点时的最坏情况SFO调用复杂度是多少?
- RQ3阻尼L-BFGS更新如何在不依赖凸性的情况下保持Hessian近似的正定性?
- RQ4将方差缩减(SVRG)集成到SdLBFGS框架中是否能提升收敛速度与稳定性?
- RQ5SdLBFGS-VR在真实世界非凸分类问题上的性能与SVRG和标准SdLBFGS相比如何?
主要发现
- 所提出的SdLBFGS方法在适当的步长条件下,几乎必然收敛至驻点。
- 为实现 $ \text{E}[ orm{\nabla f(x)}^2] \leq \epsilon $ 的最坏情况SFO调用复杂度为 $ O(\epsilon^{-2}) $,与已知最优的随机梯度方法复杂度一致。
- SdLBFGS-VR作为方差缩减变体,在RCV1与MNIST数据集上始终优于SVRG与标准SdLBFGS。
- 数值结果表明,SdLBFGS-VR对批量大小与内存大小的敏感性较低,且在较大内存下性能略有提升。
- 在相同步长下,SdLBFGS-VR相比SVRG能实现更优的目标函数值下降,且比使用固定步长的SdLBFGS更稳定。
- 当使用更大内存或更大批量时,$ s_{k-1}^T y_{k-1} < 0 $ 的迭代次数显著减少,表明曲率估计得到改善。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。