[论文解读] A Proximal Stochastic Quasi-Newton Algorithm
该论文提出了一种近似随机拟牛顿算法,用于最小化由光滑的分量函数平均项和具有简单近似映射的非光滑正则项组成的复合凸函数。通过利用缩放近似更新引入二阶曲率信息,并采用多阶段方差减少方案,该方法在不存储完整梯度的情况下实现了线性收敛,其收敛速率与针对光滑问题的最先进随机方法相当。
In this paper, we discuss the problem of minimizing the sum of two convex functions: a smooth function plus a non-smooth function. Further, the smooth part can be expressed by the average of a large number of smooth component functions, and the non-smooth part is equipped with a simple proximal mapping. We propose a proximal stochastic second-order method, which is efficient and scalable. It incorporates the Hessian in the smooth part of the function and exploits multistage scheme to reduce the variance of the stochastic gradient. We prove that our method can achieve linear rate of convergence.
研究动机与目标
- 解决目标函数为光滑数据平均函数与非光滑正则项之和的大规模复合凸优化问题。
- 开发一种利用二阶信息但避免计算完整梯度的随机优化方法。
- 在存在非光滑正则项的情况下实现线性收敛速率,将方差减少随机方法的效率扩展至拟牛顿设置。
- 设计一种可扩展算法,每轮迭代仅需存储小批量数据,无需存储所有分量梯度。
提出的方法
- 该算法使用缩放近似映射,将光滑分量函数的海森矩阵曲率信息融入其中。
- 采用受SVRG启发的多阶段方案,以降低随机梯度的方差,提升收敛稳定性。
- 在每次迭代中,通过小批量分量函数计算随机海森矩阵近似,实现高效的二阶更新。
- 更新规则结合拟牛顿步与近似算子,以处理非光滑正则项,确保收敛至最优解。
- 一个关键创新是使用由正定矩阵H诱导的加权范数来定义近似映射,从而增强收敛特性。
- 通过在各阶段间采用递归方差减少机制,避免存储完整梯度。
实验结果
研究问题
- RQ1随机拟牛顿方法能否在非光滑复合优化问题中实现线性收敛?
- RQ2在存在非光滑正则项的随机设置下,如何高效地融入二阶信息?
- RQ3在存在非光滑项的情况下,方差减少能否有效应用于拟牛顿方法?
- RQ4在使用多阶段方案时,近似随机拟牛顿方法的收敛速率如何?
- RQ5所提方法是否通过避免存储完整梯度来保持可扩展性?
主要发现
- 所提算法实现了线性收敛速率,与应用于光滑问题的最先进随机方法的最优收敛速率相当。
- 该方法无需存储所有分量函数的完整梯度,仅依赖每轮迭代的小批量数据。
- 通过多阶段方差减少策略证明了收敛速率,该策略降低了随机海森矩阵近似的偏差。
- 在标准假设下建立了算法的收敛性:每个分量函数的强凸性及其梯度的Lipschitz连续性。
- 理论分析表明,期望的次优性间隙在各阶段几何递减,收敛因子ρ < 1。
- 即使正则项为非光滑,该方法仍能实现线性收敛,通过结合近似更新与曲率感知的海森矩阵近似实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。