Skip to main content
QUICK REVIEW

[论文解读] Simple Stochastic Gradient Methods for Non-Smooth Non-Convex Regularized Optimization

Michael R. Metel, Akiko Takeda|arXiv (Cornell University)|Jan 24, 2019
Sparse and Compressive Sensing Techniques参考文献 24被引用 8
一句话总结

本文提出了两种新颖的随机梯度算法——MBSGA(适用于一般随机优化)和VRSGA(适用于有限和问题),旨在优化具有非光滑非凸正则化的光滑非凸损失函数。与先前工作相比,这些方法在非渐近收敛复杂度方面表现更优,其中VRSGA实现O(n^{2/3}ε^{-3})次梯度调用和O(ε^{-3})次近端操作,理论与实践表现均优于现有最先进方法。

ABSTRACT

Our work focuses on stochastic gradient methods for optimizing a smooth non-convex loss function with a non-smooth non-convex regularizer. Research on this class of problem is quite limited, and until recently no non-asymptotic convergence results have been reported. We present two simple stochastic gradient algorithms, for finite-sum and general stochastic optimization problems, which have superior convergence complexities compared to the current state-of-the-art. We also compare our algorithms' performance in practice for empirical risk minimization.

研究动机与目标

  • 解决光滑非凸损失函数与非光滑非凸正则化结合时,随机优化缺乏非渐近收敛结果的问题。
  • 在这些具有挑战性的条件下,为有限和与一般随机优化设置开发实用且理论可靠的算法。
  • 改进现有方法的收敛复杂度,特别是梯度调用与近端算子调用的次数。
  • 证明尽管存在理论上的复杂度权衡,更简单的算法在实践中仍可能优于更复杂的算法。
  • 在多个数据集和正则化方法上,全面比较理论收敛速率与实际性能。

提出的方法

  • 为一般随机优化提出一种小批量随机梯度算法(MBSGA),采用无偏随机梯度,并结合递减步长的近端步骤。
  • 为有限和问题提出一种方差缩减随机梯度算法(VRSGA),基于SVRG框架,并引入近端算子以处理非凸正则化。
  • 通过界定期望次优性与达到ϵ-临界点所需的迭代次数,建立非渐近收敛保证。
  • 采用一种新颖的分析框架,同时考虑损失函数与正则化项的非凸性,同时保持f(w)梯度的Lipschitz连续性。
  • 通过初始迭代的采样估计MBSGA中的方差界σ,以确保在理论假设下的收敛性。
  • 在真实世界数据集上实现并比较算法,使用标准机器学习基准(包括a9a和MNIST),进行一致的参数调优与运行时间记录。

实验结果

研究问题

  • RQ1我们能否在光滑非凸损失与非光滑非凸正则化结合的设定下,实现随机梯度方法的非渐近收敛?
  • RQ2所提算法的收敛复杂度与当前最先进方法相比如何,特别是在梯度调用与近端操作方面的表现?
  • RQ3更简单的算法(MBSGA)是否在实际性能上优于更复杂的方差缩减方法(如VRSGA、SSDC-SVRG)?
  • RQ4参数调优对真实世界机器学习任务中收敛速度与目标函数值减少的影响如何?
  • RQ5理论收敛保证是否可在标准数据集(如a9a和MNIST)上,结合非凸正则化(如SCAD或MCP)得到实证验证?

主要发现

  • 所提出的MBSGA算法在一般随机优化中实现O(ε^{-5})次梯度调用与O(ε^{-4})次近端操作复杂度,优于Xu等人(2018)的O(ε^{-8})复杂度。
  • 针对有限和问题的VRSGA算法实现O(n^{2/3}ε^{-3})次梯度调用与O(ε^{-3})次近端操作,显著优于Xu等人(2018)的SSDC-SVRG方法的O(nε^{-4})复杂度。
  • 在a9a与MNIST数据集上的数值实验表明,MBSGA在单位时间内目标函数值减少方面优于所有其他算法,尽管其结构简单。
  • 实证结果表明,MBSGA作为实现最简单的算法,取得了最佳的实际性能,表明理论复杂度并不总能预测真实世界效率。
  • 收敛分析在标准假设下成立:f(w)具有Lipschitz连续梯度,且g(w)的近端算子可高效计算。
  • 研究证实,结合非凸正则化(如SCAD、MCP和log-sum惩罚)与光滑非凸损失(如Lorenz损失)可实现更好的稀疏性与泛化性能,优于凸替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。