[论文解读] Stochastic subGradient Methods with Linear Convergence for Polyhedral Convex Optimization
本文提出重启随机梯度下降(RSGD),一种新颖的随机次梯度方法,可实现多面体凸优化问题的线性收敛——即非光滑且非强凸问题,其上图(epigraph)为多面体。通过整合多种重启策略,RSGD 克服了随机次梯度方法通常存在的次线性收敛速度,这是该类问题中首个实现线性收敛速率的结果。
In this paper, we show that simple {Stochastic} subGradient Decent methods with multiple Restarting, named {\bf RSGD}, can achieve a extit{linear convergence rate} for a class of non-smooth and non-strongly convex optimization problems where the epigraph of the objective function is a polyhedron, to which we refer as {\bf polyhedral convex optimization}. Its applications in machine learning include $\ell_1$ constrained or regularized piecewise linear loss minimization and submodular function minimization. To the best of our knowledge, this is the first result on the linear convergence rate of stochastic subgradient methods for non-smooth and non-strongly convex optimization problems.
研究动机与目标
- 解决在非光滑、非强凸设置下,随机次梯度方法缺乏线性收敛保证的问题。
- 识别一类优化问题——多面体凸问题——即使在非光滑且无强凸性的情况下,也能实现线性收敛。
- 开发一种实用且理论基础扎实的随机算法,使其在该类问题上的收敛速度优于标准次梯度方法。
- 将随机次梯度方法的适用范围扩展至重要机器学习问题,如 $ε$-约束或正则化的分段线性损失最小化以及子模函数最小化。
提出的方法
- 提出一种随机次梯度下降的重启变体(RSGD),通过使用新起点定期重置迭代点。
- 采用基于递减步长调度和收敛性监测的重启策略,以触发重启。
- 利用目标函数上图的多面体结构,确保每次重启后次梯度方法能线性收敛。
- 在假设目标函数的上图是多面体的前提下分析收敛行为,从而能够利用其几何性质。
- 使用随机次梯度预言机以处理大规模或在线设置,保持计算效率。
- 引入基于到最优解集距离的收敛准则,在进展停滞时触发重启。
实验结果
研究问题
- RQ1随机次梯度方法能否在非光滑且非强凸问题上实现线性收敛?
- RQ2在目标函数满足何种结构假设时,可保证随机次梯度方法的线性收敛?
- RQ3是否可能设计一种重启机制,使多面体凸优化中的收敛速度更快?
- RQ4与标准随机次梯度下降相比,所提出的 RSGD 方法在该类问题上的收敛速率如何?
- RQ5该方法在 $ε$-正则化的分段线性损失最小化等机器学习问题中具有何种实际影响?
主要发现
- RSGD 实现了多面体凸优化问题的线性收敛速率,该类问题包括非光滑和非强凸目标函数。
- 这是首个在无强凸性和光滑性条件下,建立随机次梯度方法线性收敛的已知结果。
- 该方法适用于如 $ε$-约束或正则化的分段线性损失最小化等机器学习问题。
- 每次重启后,收敛速率在迭代次数上呈线性,显著优于标准随机次梯度方法的次线性速率。
- 重启机制确保算法能摆脱收敛缓慢的阶段,从而利用问题的多面体结构。
- 在标准随机次梯度预言机假设和目标函数多面体结构的前提下,理论保证成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。