[论文解读] Proximal Splitting Meets Variance Reduction
该论文提出 Vr-Tos,一种方差缩减的近端分裂方法,通过每轮迭代仅需一次近端算子计算,高效处理具有多个非光滑项的优化问题,实现与完整梯度方法相同的渐近收敛速率,同时保持固定步长和低内存开销,尤其适用于具有重叠组Lasso或总变差等复杂惩罚项的大规模问题。
Despite the rise to fame of incremental variance-reduced methods in recent years, their use in nonsmooth optimization is still limited to few simple cases. This is due to the fact that existing methods require to evaluate the proximity operator for the nonsmooth terms, which can be a costly operation for complex penalties. In this work we introduce two variance-reduced incremental methods based on SAGA and SVRG that can efficiently take into account complex penalties which can be expressed as a sum of proximal terms. This includes penalties such as total variation, group lasso with overlap and trend filtering, to name a few. Furthermore, we also develop sparse variants of the proposed algorithms which can take advantage of sparsity in the input data. Like other incremental methods, it only requires to evaluate the gradient of a single sample per iteration, and so is ideally suited for large scale applications. We provide a convergence rate analysis for the proposed methods and show that they converge with a fixed step-size, achieving in some cases the same asymptotic rate as their full gradient variants. Empirical benchmarks on 3 different datasets illustrate the practical advantages of the proposed methods.
研究动机与目标
- 为解决现有随机方差缩减方法在处理复杂非光滑惩罚项(如总变差或重叠组Lasso)时效率低下的问题。
- 弥合近端分裂方法与方差缩减技术之间的鸿沟,实现具有多个非光滑项的大规模优化的高效求解。
- 通过每轮迭代仅需一次近端算子评估,降低计算成本,区别于以往方法在每一步均需计算近端算子。
- 保持固定步长并实现与完整梯度方法相同的渐近收敛速率。
- 支持稀疏数据结构与压缩内存存储,适用于线性参数化损失函数。
提出的方法
- Vr-Tos 将三算子分裂框架与随机方差缩减相结合,采用受 Saga 启发的内存高效梯度估计器。
- 维护一个历史梯度表,并逐步更新,使线性参数化损失下的内存开销降低至 O(n) 个标量。
- 每轮迭代仅对每个非光滑项的近端算子进行一次评估,从而实现对复杂惩罚项的可扩展处理。
- 使用固定步长,确保收敛性,并达到与完整梯度变体相同的渐近收敛速率。
- 引入一种稀疏变体,利用输入数据中的稀疏性,仅存储标量系数而非完整的梯度向量。
- 内存项与对偶变量的初始化具有灵活性,建议从零开始初始化,以在早期迭代中获得类似 SGD 的行为。
实验结果
研究问题
- RQ1能否有效结合方差缩减方法与近端分裂,以在大规模优化中高效处理多个非光滑项?
- RQ2所提方法是否在每轮仅进行一次近端算子评估的前提下,仍能达到与完整梯度方法相同的渐近收敛速率?
- RQ3通过利用梯度表示中的稀疏性,能否显著降低线性参数化问题中的内存开销?
- RQ4在具有复杂惩罚项的大规模数据集上,Vr-Tos 与现有方法(如 Prox-SVRG、Saga 和 STOS)相比,实际表现如何?
- RQ5该方法能否推广至任意数量的非光滑项,同时不牺牲收敛性保证或计算效率?
主要发现
- Vr-Tos 即使在使用固定步长的情况下,也能达到与完整梯度方法相同的渐近收敛速率。
- 该方法每轮迭代仅需一次近端算子评估,无论非光滑项数量多少,均可高效处理复杂惩罚项。
- 在四个大规模数据集上,Vr-Tos 在收敛速度与计算效率方面均优于现有方法(如 Prox-SVRG、Saga 和 STOS)。
- Vr-Tos 的稀疏变体在处理线性参数化损失时,将内存使用量降低至 O(n) 个标量,从而支持高维问题的可扩展性。
- 该方法在不同数据集上均表现出稳定性能,包括包含超过 1.49 亿样本和 5400 万个特征的 KDD12 数据集。
- 实验结果表明,Vr-Tos 的收敛速度优于 SGD-TOS 及其他方差缩减变体,尤其在早期迭代中表现更优,归因于有利的初始化与梯度估计策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。