Skip to main content
QUICK REVIEW

[论文解读] One Method to Rule Them All: Variance Reduction for Data, Parameters and Many New Methods

Filip Hanzely, Peter Richtárik|arXiv (Cornell University)|May 27, 2019
Stochastic Gradient Optimization Techniques参考文献 39被引用 10
一句话总结

本文提出了一种统一的方差减少随机优化方法,通过同时减少数据、参数和梯度估计器中的方差,将 SAGA、LSVRG、JacSketch、SEGA 和 ISEGA 等众多现有算法统一起来。作者建立了一个单一的收敛性定理,证明在光滑性和准强凸性条件下实现线性收敛,恢复或改进了已知的收敛速率,并为随机梯度下降与坐标下降方法建立了统一的理论框架。

ABSTRACT

We propose a remarkably general variance-reduced method suitable for solving regularized empirical risk minimization problems with either a large number of training examples, or a large model dimension, or both. In special cases, our method reduces to several known and previously thought to be unrelated methods, such as { t SAGA}, { t LSVRG}, { t JacSketch}, { t SEGA} and { t ISEGA}, and their arbitrary sampling and proximal generalizations. However, we also highlight a large number of new specific algorithms with interesting properties. We provide a single theorem establishing linear convergence of the method under smoothness and quasi strong convexity assumptions. With this theorem we recover best-known and sometimes improved rates for known methods arising in special cases. As a by-product, we provide the first unified method and theory for stochastic gradient and stochastic coordinate descent type methods.

研究动机与目标

  • 解决标准随机梯度下降与坐标下降方法在大规模机器学习问题中因高维数据或模型而产生的收敛性局限性。
  • 将此前看似无关的多种方差减少技术统一到一个通用的算法框架中。
  • 建立一个适用于所有特例的统一收敛性定理,实现对随机梯度下降与坐标下降方法的统一理论分析。
  • 开发一种能同时减少数据采样、参数更新与梯度估计器中方差的方法,提升收敛的稳定性和速度。
  • 通过在框架内选择不同的组件,系统性地推导出具有收敛性保证的新颖高效算法。

提出的方法

  • 该方法基于一种通用的随机更新规则,结合近端梯度步长与一个精心构造的无偏梯度估计器,以同时减少数据、参数和模型更新中的方差。
  • 提出一种新型梯度估计器,通过在函数和坐标上采用随机采样机制,其结构支持任意采样方案和近端算子。
  • 该框架通过算子 M† 和 B 实现基于矩阵的方差减少机制,控制梯度估计器中的方差并确保收敛性。
  • 算法通过线性算子 G(x) 的对偶表示来表示梯度估计器,该算子使用保持无偏性和实现方差控制的随机采样方案 S 进行更新。
  • 一个关键创新是引入一致性条件(零空间约束),即使未计算完整梯度,也能确保估计器保持无偏性并减少方差。
  • 通过一个统一的李雅普诺夫函数分析该方法,该函数同时追踪原始迭代点和对偶梯度估计器误差,从而导出单一收敛性定理。

实验结果

研究问题

  • RQ1能否通过一个统一的算法框架,将 SAGA、LSVRG、JacSketch、SEGA 和 ISEGA 等多样化的方差减少技术统一起来?
  • RQ2在相同框架下,是否存在一个统一的收敛性理论,适用于随机梯度下降与随机坐标下降方法?
  • RQ3所提出的方法能否在收敛速率上实现与现有专用算法相当或更优的线性收敛?
  • RQ4该方法实现线性收敛所需的最小假设是什么?这些假设与光滑性和强凸性有何关联?
  • RQ5如何通过在框架内选择不同的采样与更新规则,系统性地推导出新的高效算法?

主要发现

  • 所提方法在光滑性和准强凸性条件下实现线性收敛,且一个定理即可涵盖所有特例。
  • 该方法恢复了已知算法(如 SAGA、LSVRG 和 SEGA)的最佳已知收敛速率,有时甚至实现改进。
  • 该框架首次为随机梯度下降与随机坐标下降方法提供了统一的理论,表明二者均为同一通用算法的特例。
  • 该方法支持任意采样方案和近端算子,可生成大量具有收敛性保证的新算法。
  • 在强增长条件下,收敛速率与已知速率同阶,表明其在不同问题场景下均具有鲁棒性和高效性。
  • 通过调节采样与算子结构,该方法可推导出具有优异性质的新算法,例如在数据和参数更新中均实现方差降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。