Skip to main content
QUICK REVIEW

[论文解读] A unified variance-reduced accelerated gradient method for convex optimization

Guanghui Lan, Zhize Li|arXiv (Cornell University)|May 29, 2019
Stochastic Gradient Optimization Techniques参考文献 26被引用 16
一句话总结

本文提出 Varag,一种用于凸有限和优化的新方差缩减加速梯度方法,可在光滑凸与强凸问题中实现最优收敛速率。通过根据条件数动态调整步长并采用统一框架,Varag 在满足误差界条件的问题中实现最优线性收敛——即使正则化项不具强凸性——同时可扩展至随机有限和设置,保持最优复杂度界。

ABSTRACT

We propose a novel randomized incremental gradient algorithm, namely, VAriance-Reduced Accelerated Gradient (Varag), for finite-sum optimization. Equipped with a unified step-size policy that adjusts itself to the value of the condition number, Varag exhibits the unified optimal rates of convergence for solving smooth convex finite-sum problems directly regardless of their strong convexity. Moreover, Varag is the first accelerated randomized incremental gradient method that benefits from the strong convexity of the data-fidelity term to achieve the optimal linear convergence. It also establishes an optimal linear rate of convergence for solving a wide class of problems only satisfying a certain error bound condition rather than strong convexity. Varag can also be extended to solve stochastic finite-sum problems.

研究动机与目标

  • 开发一种统一的一阶方法,实现光滑凸与强凸有限和问题的最优收敛速率。
  • 克服先前加速方法对正则化项强凸性的依赖,使数据保真项中的强凸性也能带来优势。
  • 为满足误差界条件的广泛问题类建立最优线性收敛。
  • 将方法扩展至随机有限和问题,在分布式设置中保持最优采样与通信复杂度。

提出的方法

  • Varag 采用统一的步长策略,根据条件数自适应调整,实现对不同问题类别的最优收敛。
  • 采用新颖的方差缩减梯度估计器,结合控制变量与类似动量的加速机制,以降低梯度噪声。
  • 算法以周期运行,内层迭代使用近端梯度步长与随时间减少方差的随机梯度估计器。
  • 根据问题参数与期望精度,动态调整每轮的批量大小与迭代次数。
  • 通过访问分量函数的噪声梯度,将方法扩展至随机有限和问题,同时保持最优复杂度。
  • 理论分析采用李雅普诺夫函数与递归误差界,建立在各种条件下的收敛速率。

实验结果

研究问题

  • RQ1单一的方差缩减加速方法能否在光滑凸与强凸有限和问题中均实现最优收敛速率?
  • RQ2当正则化项不具强凸性时,此类方法能否仍从数据保真项的强凸性中获益?
  • RQ3在误差界条件而非强凸性下,求解有限和问题的最优采样与通信复杂度为何?
  • RQ4该方法能否扩展至随机有限和问题,同时保持最优收敛速率?
  • RQ5何种最优步长策略可统一不同问题类别的收敛性能?

主要发现

  • Varag 在光滑且强凸的有限和问题中实现最优复杂度 O((m + L/μ)log(1/ε)),达到下界。
  • 即使正则化项不具强凸性,Varag 仍为满足误差界条件的问题建立最优线性收敛。
  • 对于光滑凸问题,Varag 在分布式设置中实现采样复杂度 O(mCσ²/(Lε)) 与通信复杂度 O(m log(1/ε))。
  • 在随机有限和问题中,Varag 保持最优采样复杂度 O(Cσ²D₀/(Lε²)) 与通信复杂度 O(m log m + √(mD₀/ε))。
  • 数值实验表明,Varag 在每轮梯度调用的训练损失上优于 Prox-SVRG,与 Katyusha 相当,且因每轮近端映射次数更少,CPU 成本更低。
  • 该方法是首个能从数据保真项中强凸性获益的加速 RIG 方法,使实际机器学习问题(如岭回归)实现更快收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。