Skip to main content
QUICK REVIEW

[论文解读] An Optimal Hybrid Variance-Reduced Algorithm for Stochastic Composite Nonconvex Optimization

Deyi Liu, Lam M. Nguyen|arXiv (Cornell University)|Aug 20, 2020
Stochastic Gradient Optimization Techniques参考文献 7被引用 6
一句话总结

该论文提出了一种新颖的单循环、混合方差缩减近端梯度算法,用于随机复合非凸优化,仅需每轮迭代两次随机梯度评估,即可实现最优的随机预言机复杂度。通过用基于动量的SARAH风格更新替代独立估计器,该方法降低了计算成本,并在常数因子内达到理论下界复杂度,实现了期望梯度范数平方的 $ O(1/T^{2/3}) $ 收敛速率。

ABSTRACT

In this note we propose a new variant of the hybrid variance-reduced proximal gradient method in [7] to solve a common stochastic composite nonconvex optimization problem under standard assumptions. We simply replace the independent unbiased estimator in our hybrid- SARAH estimator introduced in [7] by the stochastic gradient evaluated at the same sample, leading to the identical momentum-SARAH estimator introduced in [2]. This allows us to save one stochastic gradient per iteration compared to [7], and only requires two samples per iteration. Our algorithm is very simple and achieves optimal stochastic oracle complexity bound in terms of stochastic gradient evaluations (up to a constant factor). Our analysis is essentially inspired by [7], but we do not use two different step-sizes.

研究动机与目标

  • 开发一种更简单、更高效的随机优化算法,用于复合非凸问题,实现最优预言机复杂度。
  • 将每轮迭代的随机梯度评估次数从先前工作的三次减少到两次,提升计算效率。
  • 消除对独立阻尼步长的依赖,相比先前的混合方法,简化了算法结构。
  • 在随机梯度评估次数方面实现最优收敛速率,与理论下界在常数因子内一致。
  • 将方差缩减方法的适用范围扩展至更广泛场景,如自适应步长、小批量设置以及非光滑正则化项,且无需有界梯度假设。

提出的方法

  • 提出一种新估计器 $ v_t $,结合动量与方差缩减,对当前和历史梯度项使用相同的样本 $ \xi_t $,灵感来源于动量-SARAH估计器。
  • 引入一种单循环算法,避免对独立阻尼步长的需求,相比先前的混合方法,更新规则更简洁。
  • 采用固定步长 $ \eta $ 的近端梯度步长,其中 $ x_{t+1} = \mathrm{prox}_{\eta\psi}(x_t - \eta v_t) $,确保收敛至驻点。
  • 使用大小为 $ \tilde{b} = \mathcal{O}(T^{1/3}) $ 的初始小批量计算初始梯度估计器 $ v_0 $,以降低初始阶段的方差。
  • 通过李雅普诺夫函数分析收敛性,并推导出梯度映射期望平方范数 $ \mathbb{E}[\|G_\eta(\overline{x}_T)\|^2] $ 的上界,该指标衡量驻性。
  • 采用常数步长 $ \eta = \mathcal{O}(T^{-1/3}) $ 和权重 $ \beta = \mathcal{O}(T^{-2/3}) $,以平衡收敛性与方差缩减。

实验结果

研究问题

  • RQ1能否设计一种更简单、单循环的方差缩减算法,用于随机复合非凸优化,实现最优预言机复杂度?
  • RQ2如何在不牺牲收敛速率的前提下,将每轮迭代的随机梯度评估次数从三次减少到两次?
  • RQ3在估计器中对当前和过去梯度项使用相同样本,对收敛性和方差缩减有何影响?
  • RQ4能否通过消除对独立阻尼步长的需求,使算法更简洁,同时保持最优收敛性?
  • RQ5在初始小批量大小、步长和动量权重之间,实现以随机梯度评估次数衡量的最佳收敛速率的最优权衡是什么?

主要发现

  • 所提算法在梯度映射期望平方范数上实现了最优的 $ \mathcal{O}(T^{-2/3}) $ 收敛速率,与理论下界在常数因子内一致。
  • 随机预言机复杂度为 $ \mathcal{T}_{\nabla f} = \left\lceil \frac{\Delta_0^{1/2}}{2\varepsilon} + \frac{2\Delta_0^{3/2}}{\varepsilon^3} \right\rceil $,其中 $ \Delta_0 = 4L[F(x_0) - F^\star] + 4\sigma^2 $,该复杂度在常数因子内最优。
  • 该算法每轮迭代仅使用两次随机梯度评估,优于先前方法所需的三次评估。
  • 该方法在无需有界梯度假设的前提下实现收敛,与某些先前工作不同,因此可适用于更广泛的问题类别。
  • 即使使用自适应权重 $ \beta_t $,收敛速率仍保持 $ \mathcal{O}(T^{-2/3}) $,但若使用自适应方案,速率会退化至 $ \mathcal{O}(\log T / T^{2/3}) $。
  • 分析表明,初始方差 $ \mathbb{E}[\|v_0 - \nabla f(x_0)\|^2] $ 可通过大小为 $ \tilde{b} = \mathcal{O}(T^{1/3}) $ 的小批量控制,该大小足以实现最优复杂度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。