[论文解读] Momentum with Variance Reduction for Nonconvex Composition Optimization
该论文提出了一种基于SPIDER的方差减少技术的新型动量算法,用于非凸复合优化。该算法在有限和与在线设置下均实现了近似最优的样本复杂度,相比以往的Katyusha风格方法减少了近端映射的计算次数,并在梯度支配条件下实现了线性收敛,显著加速了现有方法的收敛速度。
Composition optimization is widely-applied in nonconvex machine learning. Various advanced stochastic algorithms that adopt momentum and variance reduction techniques have been developed for composition optimization. However, these algorithms do not fully exploit both techniques to accelerate the convergence and are lack of convergence guarantee in nonconvex optimization. This paper complements the existing literature by developing various momentum schemes with SPIDER-based variance reduction for non-convex composition optimization. In particular, our momentum design requires less number of proximal mapping evaluations per-iteration than that required by the existing Katyusha momentum. Furthermore, our algorithm achieves near-optimal sample complexity results in both non-convex finite-sum and online composition optimization and achieves a linear convergence rate under the gradient dominant condition. Numerical experiments demonstrate that our algorithm converges significantly faster than existing algorithms in nonconvex composition optimization.
研究动机与目标
- 解决非凸复合优化中基于动量的方差减少缺乏收敛性保证的问题。
- 相比现有的Katyusha风格动量方法,减少每次迭代的近端映射计算次数。
- 在非凸有限和与在线复合优化中实现近似最优的样本复杂度。
- 为带有动量与方差减少的在线非凸复合优化问题提供可证明的收敛性保证。
- 在保持非凸设置下理论最优性的同时,显著加速实际收敛速度。
提出的方法
- 为非凸复合问题提出一种新型动量方案,与基于SPIDER的方差减少技术相结合。
- 设计一种新型动量更新机制,每轮迭代仅需一次近端映射计算,从而降低计算开销。
- 采用两级采样策略:在周期性间隔内使用完整梯度,其余时间使用随机梯度,利用SPIDER的低方差梯度估计。
- 引入一种混合超参数选择规则,平衡收敛速度与稳定性,确保理论保证。
- 采用递归动量更新机制,结合自适应步长与梯度追踪,以减少方差并加速收敛。
- 通过望远镜级数与李雅普诺夫分析推导理论边界,建立在非凸与梯度支配条件下的收敛性。
实验结果
研究问题
- RQ1能否设计一种结合SPIDER方差减少的动量方案,用于非凸复合优化,并具备可证明的收敛性?
- RQ2与现有的Katyusha风格动量方法相比,能否减少每次迭代的近端映射计算次数?
- RQ3所提出的算法是否在有限和与在线非凸复合优化中均实现了近似最优的样本复杂度?
- RQ4在梯度支配条件下,该算法是否能实现线性收敛?
- RQ5该算法是否在实际性能上显著优于现有最先进方法?
主要发现
- 所提算法在有限和复合优化问题中实现了近似最优的样本复杂度 O(√max(N,n)ε⁻² + N + n)。
- 对于在线复合优化,样本复杂度为 O(ε⁻³),与理论下限相比仅相差对数因子。
- 该算法每轮迭代仅需一次近端映射计算,相比以往基于Katyusha的方法(需两次)显著降低了计算成本。
- 在梯度支配条件下,算法实现了线性收敛速率,表现出快速的实际收敛性能。
- 数值实验结果表明,该算法在非凸复合优化设置下收敛速度显著快于现有算法。
- 理论分析建立了期望收敛性,给出了子优性间隙与梯度范数的显式边界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。