QUICK REVIEW
[论文解读] Improved Optimization of Finite Sums with Minibatch Stochastic Variance Reduced Proximal Iterations
Jialei Wang, Tong Zhang|arXiv (Cornell University)|Jun 21, 2017
Stochastic Gradient Optimization Techniques参考文献 45被引用 7
一句话总结
本文提出了一种新颖的小批量随机优化方法,通过结合方差减少的一阶梯度与子采样海森矩阵近似,加速有限和经验风险最小化中的收敛。通过在小批量设置下整合随机方差减少与近似二阶信息,该方法实现了改进的迭代复杂度——在强凸性和光滑性条件下达到理论下界——展示了相较于最先进的方法(如SVRG和Catalyst加速算法)更快的收敛速度和更优的实验性能。
ABSTRACT
We present novel minibatch stochastic optimization methods for empirical risk minimization problems, the methods efficiently leverage variance reduced first-order and sub-sampled higher-order information to accelerate the convergence speed. For quadratic objectives, we prove improved iteration complexity over state-of-the-art under reasonable assumptions. We also provide empirical evidence of the advantages of our method compared to existing approaches in the literature.
研究动机与目标
- 为机器学习中常见的大规模数据集有限和问题开发一种更快的优化算法。
- 通过在小批量设置下结合方差减少与子采样二阶信息,提升收敛速度。
- 在强凸性和光滑性条件下,实现与一阶和近端预言机方法理论下界匹配的改进迭代复杂度。
- 通过实证验证该方法在性能上优于现有方法(如SVRG、SDCA和Catalyst加速算法)。
提出的方法
- 提出一种利用一阶梯度和子采样海森矩阵信息的小批量随机方差减少近端迭代方法。
- 采用带动量项的递归更新策略,以减少梯度估计的方差并提升收敛性。
- 通过数据子批量近似海森矩阵,以避免完整海森矩阵计算,从而近似曲率信息。
- 采用带精心选择步长η的近端式更新,以平衡梯度与海森矩阵的贡献。
- 引入李雅普诺夫函数δt以追踪次优性,并利用矩阵伯恩斯坦不等式与递推分析推导收敛界。
- 在分析中采用Catalyst风格加速,以在条件数较高的情形下获得更优的收敛速率。
实验结果
研究问题
- RQ1将方差减少的随机梯度与子采样海森矩阵近似相结合,是否能在有限和优化中实现更快的收敛?
- RQ2所提方法是否实现了在强凸性和光滑性条件下,一阶和近端预言机方法的理论迭代复杂度下界?
- RQ3小批量大小如何影响算法的收敛速率与计算效率?
- RQ4该方法在实践中是否能优于最先进的算法(如SVRG和Catalyst加速方法)?
- RQ5海森矩阵近似的质量与采样策略对收敛稳定性与速度有何影响?
主要发现
- 在强凸性和光滑性条件下,所提方法实现了O((n + √(nL/λ)) log(1/ϵ))的改进迭代复杂度,与Woodworth和Srebro(2016)建立的理论下界一致。
- 该方法表现出线性收敛,其收敛速率依赖于条件数√(L/λ),在高条件数情形下优于标准SVRG。
- 实验结果表明,在逻辑回归与岭回归任务中,该方法相比SVRG、SDCA和Catalyst加速方法表现出更快的收敛速度和更低的目标函数次优性。
- 在适当的参数设置下,该算法可在O(1/√(λη) log(36))次迭代内将期望目标次优性减半,表明其具备指数收敛性。
- 理论分析证实,该方法的收敛速率在第一阶和近端预言机模型下不可再改进,从而确立了其最优性。
- 通过使用小批量海森矩阵近似,该方法保持了较低的每次迭代成本,避免了完整海森矩阵计算的高成本,同时保持了快速收敛性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。