[论文解读] Finite-Sum Smooth Optimization with SARAH
本文提出了一种改进的SARAH算法,用于有限和光滑非凸优化,当 $ n \leq \mathcal{O}(\epsilon^{-2}) $ 时,总梯度复杂度达到理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的常数倍。对于凸问题,提出了SARAH++,具有次线性和线性收敛速率,并提出一种实用的自适应变体(SARAH Adaptive),无需调参即可提升性能,已在covtype和ijcnn1等真实数据集上得到验证。
The total complexity (measured as the total number of gradient computations) of a stochastic first-order optimization algorithm that finds a first-order stationary point of a finite-sum smooth nonconvex objective function $F(w)=\frac{1}{n} \sum_{i=1}^n f_i(w)$ has been proven to be at least $Ω(\sqrt{n}/ε)$ for $n \leq \mathcal{O}(ε^{-2})$ where $ε$ denotes the attained accuracy $\mathbb{E}[ \| abla F( ilde{w})\|^2] \leq ε$ for the outputted approximation $ ilde{w}$ (Fang et al., 2018). In this paper, we provide a convergence analysis for a slightly modified version of the SARAH algorithm (Nguyen et al., 2017a;b) and achieve total complexity that matches the lower-bound worst case complexity in (Fang et al., 2018) up to a constant factor when $n \leq \mathcal{O}(ε^{-2})$ for nonconvex problems. For convex optimization, we propose SARAH++ with sublinear convergence for general convex and linear convergence for strongly convex problems; and we provide a practical version for which numerical experiments on various datasets show an improved performance.
研究动机与目标
- 填补非凸有限和优化中随机一阶方法收敛复杂度的空白。
- 在平均光滑条件下,使非凸问题的总梯度复杂度达到理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的匹配水平。
- 为凸问题设计一种实用且高效的变体,以提升收敛性和性能。
- 提出一种自适应变体(SARAH Adaptive),可动态调整步长并提前终止内层循环,避免冗余更新。
提出的方法
- 通过将每个外层循环的输出设为最终迭代点 $ w_{m+1}^{(s)} $,而非随机中间点,来改进原始SARAH算法。
- 使用递归的方差缩减梯度估计器:$ v_t^{(s)} = \nabla f_{i_t}(w_t^{(s)}) - \nabla f_{i_t}(w_{t-1}^{(s)}) + v_{t-1}^{(s)} $,以保持低方差的梯度估计。
- 引入SARAH++,采用基于 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 的动态停止准则,确保高效的内层循环终止。
- 提出SARAH Adaptive,采用自适应步长 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $,使其随当前梯度范数缩放。
- 应用自适应步长和停止条件,以避免微小的冗余更新,提升收敛速度。
- 在每个外层循环开始时使用完整梯度,并通过 $ w_{t+1}^{(s)} = w_t^{(s)} - \eta v_t^{(s)} $ 更新迭代点。
实验结果
研究问题
- RQ1改进的SARAH算法能否在非凸有限和问题中实现与已知理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 匹配的总梯度复杂度?
- RQ2SARAH++ 相较于标准SARAH,在凸和强凸问题中是否提供了更优的收敛速率?
- RQ3SARAH的自适应变体能否动态调整步长和内层循环长度,以提升实际性能?
- RQ4SARAH Adaptive 在不同数据集和学习率设置下,与SARAH和SARAH++相比性能如何?
主要发现
- 改进的SARAH算法在非凸问题中实现了总梯度复杂度 $ \mathcal{O}(\sqrt{n}/\epsilon) $,当 $ n \leq \mathcal{O}(\epsilon^{-2}) $ 时,与理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的常数倍相匹配。
- SARAH++ 对于一般凸问题实现了次线性收敛,对于强凸问题实现了线性收敛,且具有理论保证。
- 在covtype和ijcnn1数据集上的数值实验表明,SARAH++ 在收敛速度和精度方面均优于标准SARAH。
- SARAH Adaptive 虽无理论分析,但在实践中表现出优于SARAH和SARAH++的性能,尤其在无需学习率调优时表现更优。
- 停止准则 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 显著提升了效率,通过防止不必要的微小更新。
- 自适应步长 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ 确保 $ \eta_t^{(s)} \leq \frac{1}{L} $,从而保持稳定性和收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。