Skip to main content
QUICK REVIEW

[论文解读] On the Convergence of SARAH and Beyond

Bingcong Li, Meng Ma|arXiv (Cornell University)|Jun 5, 2019
Stochastic Gradient Optimization Techniques参考文献 39被引用 4
一句话总结

本文提出 L2S(无环 SARAH),一种用于机器学习中有限和问题最小化的新型方差缩减算法。通过利用递归梯度估计器和统一的分析框架,L2S 实现了最优收敛速率:强凸问题下为 O((n+κ)ln(1/ε)),凸与非凸问题下为 O(n + √n/ε),并使用与 n 无关的步长实现了可证明的收敛性,从而解决了 SARAH 的一个关键局限性。

ABSTRACT

The main theme of this work is a unifying algorithm, extbf{L}oop extbf{L}ess extbf{S}ARAH (L2S) for problems formulated as summation of $n$ individual loss functions. L2S broadens a recently developed variance reduction method known as SARAH. To find an $ε$-accurate solution, L2S enjoys a complexity of ${\cal O}\big( (n+κ) \ln (1/ε)\big)$ for strongly convex problems. For convex problems, when adopting an $n$-dependent step size, the complexity of L2S is ${\cal O}(n+ \sqrt{n}/ε)$; while for more frequently adopted $n$-independent step size, the complexity is ${\cal O}(n+ n/ε)$. Distinct from SARAH, our theoretical findings support an $n$-independent step size in convex problems without extra assumptions. For nonconvex problems, the complexity of L2S is ${\cal O}(n+ \sqrt{n}/ε)$. Our numerical tests on neural networks suggest that L2S can have better generalization properties than SARAH. Along with L2S, our side results include the linear convergence of the last iteration for SARAH in strongly convex problems.

研究动机与目标

  • 解决 SARAH 在凸问题中使用与 n 无关的步长时缺乏理论保证的问题。
  • 为方差缩减方法提供统一的收敛性分析,特别是扩展 SARAH 的适用范围。
  • 开发一种新算法 L2S,实现在无需循环结构或额外假设下的最优收敛速率。
  • 建立 SARAH 在强凸设置下最后迭代的线性收敛性。
  • 在深度学习实验中展示 L2S 相较于 SARAH 在泛化性能上的改进。

提出的方法

  • 提出 L2S,即 SARAH 的无环变体,使用无需周期性计算完整梯度的递归梯度估计器。
  • 引入一种新颖的分析技术,通过望远镜求和论证来界定递归梯度估计器的方差。
  • 通过分析梯度的期望范数并利用压缩论证将其与初始误差关联,推导收敛速率。
  • 采用与 n 无关的步长策略,适用于凸问题,从而避免对 n 相关的调参需求。
  • 将该方法应用于凸与非凸问题,包括神经网络训练,并提供理论保证。
  • 通过从内层循环中均匀随机选择迭代点来实现 L2S,以确保收敛至 ε-精确解。

实验结果

研究问题

  • RQ1能否设计一种方差缩减方法,在无需循环结构或周期性完整梯度计算的情况下实现最优收敛?
  • RQ2L2S 是否在凸问题中实现了与 SARAH 相同的收敛速率,同时允许使用与 n 无关的步长?
  • RQ3SARAH 在强凸问题中的最后迭代收敛行为如何?
  • RQ4L2S 是否在深度学习设置中相较 SARAH 展现出更优的泛化性能?
  • RQ5L2S 在凸、强凸与非凸问题下的最优 IFO 复杂度是多少?

主要发现

  • L2S 在强凸问题中实现了 O((n + κ)ln(1/ε)) 的 IFO 复杂度,与已知最佳速率一致。
  • 在凸问题中,L2S 以与 n 无关的步长实现了 O(n + √n/ε) 的复杂度,相较于 SARAH 是理论上的改进。
  • L2S 在非凸问题中实现了 O(n + √n/ε) 的复杂度,与方差缩减方法的最佳已知速率一致。
  • 本文证明了 SARAH 在强凸情况下最后迭代的线性收敛性,这一结果此前尚未建立。
  • 神经网络上的数值实验表明,L2S 的泛化性能优于 SARAH,表明其具有实际优势。
  • 分析结果确认,L2S 在凸问题中无需额外假设即可支持与 n 无关的步长,与先前工作不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。