Skip to main content
QUICK REVIEW

[论文解读] Finite-Sum Smooth Optimization with SARAH

Lam M. Nguyen, Marten van Dijk|arXiv (Cornell University)|Jan 22, 2019
Stochastic Gradient Optimization Techniques被引用 7
一句话总结

本文提出了一种改进的SARAH算法,用于有限和光滑非凸优化,当 $ n \leq \mathcal{O}(\epsilon^{-2}) $ 时,总梯度复杂度达到理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的常数倍。对于凸问题,提出了SARAH++,具有次线性和线性收敛速率,并提出一种实用的自适应变体(SARAH Adaptive),无需调参即可提升性能,已在covtype和ijcnn1等真实数据集上得到验证。

ABSTRACT

The total complexity (measured as the total number of gradient computations) of a stochastic first-order optimization algorithm that finds a first-order stationary point of a finite-sum smooth nonconvex objective function $F(w)=\frac{1}{n} \sum_{i=1}^n f_i(w)$ has been proven to be at least $Ω(\sqrt{n}/ε)$ for $n \leq \mathcal{O}(ε^{-2})$ where $ε$ denotes the attained accuracy $\mathbb{E}[ \| abla F( ilde{w})\|^2] \leq ε$ for the outputted approximation $ ilde{w}$ (Fang et al., 2018). In this paper, we provide a convergence analysis for a slightly modified version of the SARAH algorithm (Nguyen et al., 2017a;b) and achieve total complexity that matches the lower-bound worst case complexity in (Fang et al., 2018) up to a constant factor when $n \leq \mathcal{O}(ε^{-2})$ for nonconvex problems. For convex optimization, we propose SARAH++ with sublinear convergence for general convex and linear convergence for strongly convex problems; and we provide a practical version for which numerical experiments on various datasets show an improved performance.

研究动机与目标

  • 填补非凸有限和优化中随机一阶方法收敛复杂度的空白。
  • 在平均光滑条件下,使非凸问题的总梯度复杂度达到理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的匹配水平。
  • 为凸问题设计一种实用且高效的变体,以提升收敛性和性能。
  • 提出一种自适应变体(SARAH Adaptive),可动态调整步长并提前终止内层循环,避免冗余更新。

提出的方法

  • 通过将每个外层循环的输出设为最终迭代点 $ w_{m+1}^{(s)} $,而非随机中间点,来改进原始SARAH算法。
  • 使用递归的方差缩减梯度估计器:$ v_t^{(s)} = \nabla f_{i_t}(w_t^{(s)}) - \nabla f_{i_t}(w_{t-1}^{(s)}) + v_{t-1}^{(s)} $,以保持低方差的梯度估计。
  • 引入SARAH++,采用基于 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 的动态停止准则,确保高效的内层循环终止。
  • 提出SARAH Adaptive,采用自适应步长 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $,使其随当前梯度范数缩放。
  • 应用自适应步长和停止条件,以避免微小的冗余更新,提升收敛速度。
  • 在每个外层循环开始时使用完整梯度,并通过 $ w_{t+1}^{(s)} = w_t^{(s)} - \eta v_t^{(s)} $ 更新迭代点。

实验结果

研究问题

  • RQ1改进的SARAH算法能否在非凸有限和问题中实现与已知理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 匹配的总梯度复杂度?
  • RQ2SARAH++ 相较于标准SARAH,在凸和强凸问题中是否提供了更优的收敛速率?
  • RQ3SARAH的自适应变体能否动态调整步长和内层循环长度,以提升实际性能?
  • RQ4SARAH Adaptive 在不同数据集和学习率设置下,与SARAH和SARAH++相比性能如何?

主要发现

  • 改进的SARAH算法在非凸问题中实现了总梯度复杂度 $ \mathcal{O}(\sqrt{n}/\epsilon) $,当 $ n \leq \mathcal{O}(\epsilon^{-2}) $ 时,与理论下界 $ \Omega(\sqrt{n}/\epsilon) $ 的常数倍相匹配。
  • SARAH++ 对于一般凸问题实现了次线性收敛,对于强凸问题实现了线性收敛,且具有理论保证。
  • 在covtype和ijcnn1数据集上的数值实验表明,SARAH++ 在收敛速度和精度方面均优于标准SARAH。
  • SARAH Adaptive 虽无理论分析,但在实践中表现出优于SARAH和SARAH++的性能,尤其在无需学习率调优时表现更优。
  • 停止准则 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 显著提升了效率,通过防止不必要的微小更新。
  • 自适应步长 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ 确保 $ \eta_t^{(s)} \leq \frac{1}{L} $,从而保持稳定性和收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。