[论文解读] Convergence of a Stochastic Gradient Method with Momentum for Non-Smooth Non-Convex Optimization
该论文首次为非光滑、非凸且带约束的优化问题建立了带有Polyak动量的随机次梯度方法的收敛速率。通过构造一种新颖的李雅普诺夫函数,该方法在无需调节动量参数的情况下,实现了到驻点的 O(1/√K) 收敛速率,将已知的复杂度界扩展至带约束和非光滑情形。
Stochastic gradient methods with momentum are widely used in applications and at the core of optimization subroutines in many popular machine learning libraries. However, their sample complexities have not been obtained for problems beyond those that are convex or smooth. This paper establishes the convergence rate of a stochastic subgradient method with a momentum term of Polyak type for a broad class of non-smooth, non-convex, and constrained optimization problems. Our key innovation is the construction of a special Lyapunov function for which the proven complexity can be achieved without any tuning of the momentum parameter. For smooth problems, we extend the known complexity bound to the constrained case and demonstrate how the unconstrained case can be analyzed under weaker assumptions than the state-of-the-art. Numerical results confirm our theoretical developments.
研究动机与目标
- 填补非光滑、非凸问题中随机动量方法理论理解的空白。
- 在非凸或光滑性假设之外的设定下,为带有Polyak动量的随机次梯度方法建立样本复杂度界。
- 开发一种无需调节动量参数的收敛性分析框架。
- 将已知的复杂度结果扩展至带约束、非光滑及非凸优化问题。
提出的方法
- 该方法使用带有Polyak型动量的随机次梯度,通过迭代和动量向量的递归更新定义。
- 构造一种特殊的李雅普诺夫函数以分析收敛性,该函数结合了目标函数和与动量相关的项。
- 利用 ρ-弱凸函数的概念(即 f(x) + ρ‖x‖² 为凸函数)来处理非光滑性。
- 通过范数展开和正则化目标函数 Fλ(x) = f(x) + λ⁻¹‖x‖² 的凸性性质,推导出关键不等式。
- 通过在迭代过程中对不等式求和,并有界地控制 Fλ 的梯度范数的期望,推导出收敛速率。
- 使用统一的随机索引 k* 分析梯度范数的期望,从而获得高概率收敛界。
实验结果
研究问题
- RQ1在非光滑、非凸问题中,带有动量的随机梯度方法能否实现收敛速率?
- RQ2是否可能在不假设光滑性或凸性的情况下,为基于动量的方法建立样本复杂度界?
- RQ3能否构造一种李雅普诺夫函数,以确保在不调节动量参数情况下的收敛性?
- RQ4与无约束情形相比,动量方法在带约束、非光滑、非凸设定下的表现如何?
- RQ5能否通过正则化目标函数,将分析扩展至弱凸函数?
主要发现
- 该方法实现了到驻点的 O(1/√K) 收敛速率,以正则化目标函数 Fλ 的梯度的期望平方范数衡量。
- 收敛界在无需调节动量参数的情况下成立,其依赖于所构造的李雅普诺夫函数。
- 对于光滑问题,该分析在弱于先前工作的假设下,将已知的复杂度界扩展至带约束情形。
- 该结果在紧致性意义上是紧的,即收敛速率与光滑凸问题的已知界一致。
- 数值结果验证了理论收敛行为,并证实了动量方法在非光滑、非凸设定下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。