[论文解读] Variance-Reduced Stochastic Learning under Random Reshuffling
本文首次在随机重排(RR)设置下,为SAGA算法提供了线性收敛的理论证明,解决了方差缩减随机优化中长期存在的开放性问题。此外,本文提出AVRG这一新算法,具备恒定存储和均衡的梯度计算,被证明在RR下可线性收敛,相较于SAGA和SVRG具有更优的实际效率。
Several useful variance-reduced stochastic gradient algorithms, such as SVRG, SAGA, Finito, and SAG, have been proposed to minimize empirical risks with linear convergence properties to the exact minimizer. The existing convergence results assume uniform data sampling with replacement. However, it has been observed in related works that random reshuffling can deliver superior performance over uniform sampling and, yet, no formal proofs or guarantees of exact convergence exist for variance-reduced algorithms under random reshuffling. This paper makes two contributions. First, it resolves this open issue and provides the first theoretical guarantee of linear convergence under random reshuffling for SAGA; the argument is also adaptable to other variance-reduced algorithms. Second, under random reshuffling, the paper proposes a new amortized variance-reduced gradient (AVRG) algorithm with constant storage requirements compared to SAGA and with balanced gradient computations compared to SVRG. AVRG is also shown analytically to converge linearly.
研究动机与目标
- 为解决方差缩减随机算法(如SAGA)在随机重排(RR)下是否能精确收敛至最小值这一长期开放性问题,该问题在实践中已被观察到优于有放回均匀采样。
- 在强凸性和Lipschitz连续梯度的标准假设下,首次为SAGA在RR下的线性收敛提供严格的理论保证。
- 设计一种新的摊销方差缩减梯度(AVRG)算法,该算法在RR下保持线性收敛,同时实现恒定存储和均衡的梯度计算,优于SAGA和SVRG。
- 将理论分析扩展至其他方差缩减算法,证明所提框架不仅适用于SAGA,还具备可扩展性。
提出的方法
- 提出一种新颖的李雅普诺夫函数,结合迭代误差与历史梯度的平均值,用于分析RR下的收敛性。
- 引入递归不等式框架,以边界化迭代的期望平方误差,利用随机重排结构与方差缩减机制的特性。
- 提出AVRG作为新算法,将全梯度计算在各周期内摊销,将存储从SAGA的O(N)降低至O(1)。
- 采用带可调系数γ的参数化李雅普诺夫函数,以平衡误差项与梯度追踪项,从而获得更紧的收敛界。
- 在步长μ的三个关键条件下建立收敛性,包括μ ≤ ν/(9δ²N),确保线性收敛率α < 1。
- 首先将分析应用于SAGA,随后证明该框架可推广至其他算法,包括所提出的AVRG。
实验结果
研究问题
- RQ1在强凸性和Lipschitz连续梯度的标准假设下,SAGA在随机重排下是否能线性收敛至精确最小值?
- RQ2方差缩减算法的理论分析能否从有放回均匀采样推广至在实践中表现更优的随机重排?
- RQ3能否设计一种新的方差缩减算法,使其在RR下保持线性收敛,同时实现恒定存储和均衡的梯度计算?
- RQ4SAGA和AVRG在随机重排下,确保线性收敛的步长μ的充分条件是什么?
- RQ5所提出的AVRG算法在随机重排下,其收敛速度和计算效率相较于SAGA和SVRG如何?
主要发现
- 本文首次在ν-强凸性和δ-Lipschitz连续梯度的标准假设下,为SAGA在随机重排下的线性收敛提供了理论保证。
- 收敛率为线性,速率α = (1 - μνN/4)/(1 - 3γδ²μ²N²),当μ ≤ ν/(9δ²N)时,该值小于1。
- 所提出的AVRG算法将存储从SAGA的O(N)降低至O(1),同时在各次迭代中保持均衡的梯度计算。
- AVRG在随机重排下被理论证明可线性收敛,其收敛率结构与SAGA相同。
- 步长条件μ ≤ ν/(9δ²N)确保所有收敛条件成立,包括李雅普诺夫函数的稳定性和收缩性。
- 该分析框架可推广至其他方差缩减算法,如Finito和SAG,扩展了基于RR优化的理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。