[论文解读] Stochastic Variance-Reduced ADMM
本文提出 SVRG-ADMM,一种随机方差缩减的 ADMM 算法,在凸问题上实现快速线性收敛,且存储需求极低——与样本量 n 无关——同时为非凸问题提供了收敛性保证。由于能高效重用梯度而无需存储历史梯度或对偶变量,该方法在大规模数据集上相比 SCAS-ADMM 显著提升了速度与可扩展性。
The alternating direction method of multipliers (ADMM) is a powerful optimization solver in machine learning. Recently, stochastic ADMM has been integrated with variance reduction methods for stochastic gradient, leading to SAG-ADMM and SDCA-ADMM that have fast convergence rates and low iteration complexities. However, their space requirements can still be high. In this paper, we propose an integration of ADMM with the method of stochastic variance reduced gradient (SVRG). Unlike another recent integration attempt called SCAS-ADMM, the proposed algorithm retains the fast convergence benefits of SAG-ADMM and SDCA-ADMM, but is more advantageous in that its storage requirement is very low, even independent of the sample size $n$. We also extend the proposed method for nonconvex problems, and obtain a convergence rate of $O(1/T)$. Experimental results demonstrate that it is as fast as SAG-ADMM and SDCA-ADMM, much faster than SCAS-ADMM, and can be used on much bigger data sets.
研究动机与目标
- 为解决 SAG-ADMM 和 SDCA-ADMM 等方差缩减随机 ADMM 方法存储开销高的问题,这些方法的存储需求随样本量 n 增大而增长。
- 以一种保持快速收敛性的同时最小化内存使用的方式,将随机方差缩减梯度(SVRG)方法与 ADMM 相结合。
- 为非凸问题建立所提方法的理论收敛速率,因为此类问题的收敛性保证目前仍较为有限。
- 在大规模和高维机器学习问题上,展示所提方法的实际优越性。
提出的方法
- 提出更紧密地将 SVRG 与 ADMM 集成,利用控制变量减少梯度方差,而无需存储历史梯度。
- 在内层循环中采用固定步长,相比需要递减步长的方法,实现了更快的收敛速度。
- 引入两阶段更新机制:一个阶段在快照点计算完整梯度,另一阶段使用通过控制变量实现方差缩减的随机梯度。
- 通过利用近期关于 ADMM 收敛至驻点的理论成果,将框架扩展至非凸问题。
- 采用小批量随机近似进行梯度计算,以降低每轮迭代的计算成本,同时保持方差缩减效果。
- 采用通过理论证明可优化收敛性的惩罚参数 ρ。
实验结果
研究问题
- RQ1SVRG 能否被有效集成到 ADMM 中,实现在低存储开销下的快速收敛?
- RQ2所提方法在凸问题上是否能保持线性收敛速率,同时避免 SAG-ADMM 的 O(nd) 存储和 SDCA-ADMM 的 O(n) 存储?
- RQ3所提方法能否为非凸问题提供收敛性保证?其收敛速率如何?
- RQ4在大规模数据集上,所提方法与现有随机 ADMM 变体(如 SCAS-ADMM、SAG-ADMM 和 SDCA-ADMM)相比,实际表现如何?
主要发现
- SVRG-ADMM 在强凸问题上实现了线性收敛,收敛速率与 SAG-ADMM 和 SDCA-ADMM 相当,但仅需 O(d) 存储,与样本量 n 无关。
- 在包含 1,000 个任务的 ImageNet 数据集上,SVRG-ADMM 仅需 62.5MB 存储,而 SAG-ADMM 需要 38.2TB,SDCA-ADMM 需要 9.6GB。
- 在 minist8m 和 dna 等大规模数据集上,SVRG-ADMM 比 SCAS-ADMM 收敛更快,后者因顺序求解子问题导致性能显著下降。
- 在 a9a、news20 和 covertype 数据集上,使用 SVRG-ADMM 的非凸图引导融合 Lasso 模型测试误差低于对应的凸模型。
- 根据命题 3 推导出的最优惩罚参数 ρ,在 TV 回归实验中实现了最快收敛,优于其他 ρ 值。
- 在多任务学习中,SVRG-ADMM 以极小的内存开销迅速收敛至高质量解,展现出对大规模问题的卓越可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。