QUICK REVIEW
[论文解读] Complexity of finding near-stationary points of convex functions stochastically
Damek Davis, Dmitriy Drusvyatskiy|arXiv (Cornell University)|Feb 21, 2018
Sparse and Compressive Sensing Techniques参考文献 12被引用 7
一句话总结
本文提出了一种用于凸优化的随机次梯度方法,通过Moreau包络的梯度,实现了接近最优的收敛速率 $\widetilde{O}(\varepsilon^{-2})$,用于寻找近似驻点。通过结合渐进正则化与迭代平均,该方法改进了先前的 $O(\varepsilon^{-2.5})$ 速率,在光滑情况下提供了Nesterov加速方法的随机对应版本。
ABSTRACT
In a recent paper, we showed that the stochastic subgradient method applied to a weakly convex problem, drives the gradient of the Moreau envelope to zero at the rate $O(k^{-1/4})$. In this supplementary note, we present a stochastic subgradient method for minimizing a convex function, with the improved rate $\widetilde O(k^{-1/2})$.
研究动机与目标
- 弥合光滑与非光滑凸随机优化在寻找近似驻点收敛速率方面的差距。
- 开发一种高效的随机算法,用于寻找Moreau包络梯度较小的点,该梯度可作为原始非光滑问题近似驻点的代理。
- 将Allen-Zhu提出的渐进正则化技术扩展至凸函数的随机次梯度设置。
- 实现与光滑凸优化中已知最优的 $\widetilde{O}(\varepsilon^{-2})$ 复杂度相匹配的收敛速率。
提出的方法
- 使用Moreau包络 $\varphi_\lambda(x)$ 作为非光滑凸函数 $\varphi$ 的光滑近似,其梯度范数 $\|\nabla\varphi_\lambda(x)\|$ 衡量近似驻点性。
- 采用渐进正则化策略:迭代求解正则化参数 $\mu_i = 2^i \mu$ 逐渐增大的正则化子问题。
- 使用带有迭代平均的随机次梯度下降以降低方差并提升收敛性。
- 引入双层结构:内层循环最小化正则化函数,外层循环逐步增强正则化强度。
- 利用近端点 $\mathrm{prox}_{\lambda\varphi}(x)$ 将 $\|\nabla\varphi_\lambda(x)\|$ 与附近点的次梯度范数关联,确保有意义的驻点保证。
- 应用随机化取整步骤,将正则化解映射回原始定义域,同时保持期望收敛性。
实验结果
研究问题
- RQ1在随机、非光滑设置下,是否可以实现已知于光滑凸优化中的 $\widetilde{O}(\varepsilon^{-2})$ 收敛速率,用于寻找 $\varepsilon$-驻点?
- RQ2Allen-Zhu(2017)提出的渐进正则化技术能否被适配至凸函数的随机次梯度方法?
- RQ3在随机次梯度设置下,正则化强度、迭代次数与收敛速率之间的最优权衡是什么?
- RQ4在非光滑情况下,Moreau包络的梯度范数与附近点的真实次梯度范数之间有何关系?
主要发现
- 该算法在调用随机次梯度预言机和投影映射 $O\left(\frac{\log^3(\rho D / \varepsilon)(L^2 + \rho^2 D^2)}{\varepsilon^2}\right)$ 次后,可实现期望梯度范数 $\mathbb{E}\|\nabla\varphi_{1/(2\rho)}(\bar{z})\| \leq \varepsilon$。
- 收敛速率为 $\widetilde{O}(\varepsilon^{-2})$,与光滑凸优化中的最优速率一致,并优于随机非光滑情况下的先前 $O(\varepsilon^{-2.5})$ 速率。
- 对于强凸函数,通过渐进正则化与平均,该方法实现了 $\widetilde{O}(\varepsilon^{-2})$ 速率,且显式依赖于强凸参数 $\mu$。
- 通过添加小的二次正则化,该方法对非强凸问题也具有鲁棒性,最终解通过凸组合映射回原可行域,以保持可行性与收敛性。
- 分析表明,$\|\nabla\varphi_\lambda(x)\|$ 控制了与近似驻点 $\widehat{x} = \mathrm{prox}_{\lambda\varphi}(x)$ 的距离,从而证明其作为驻点度量的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。