Skip to main content
QUICK REVIEW

[论文解读] A Smoothing Stochastic Gradient Method for Composite Optimization

Qihang Lin, Xi Chen|arXiv (Cornell University)|Aug 31, 2010
Stochastic Gradient Optimization Techniques参考文献 19被引用 10
一句话总结

本文提出了一种用于复合凸优化问题的平滑随机梯度方法,其目标函数由基于期望的平滑部分和非平滑部分组成。当非平滑项具有特定的max-结构时,通过引入平滑技术,该方法实现了$O(1/ar{N})$的收敛速率,并在合成数据上的岭回归和逻辑回归问题中得到数值验证。

ABSTRACT

We consider the unconstrained optimization problem whose objective function is composed of a smooth and a non-smooth conponents where the smooth component is the expectation a random function. This type of problem arises in some interesting applications in machine learning. We propose a stochastic gradient descent algorithm for this class of optimization problem. When the non-smooth component has a particular structure, we propose another stochastic gradient descent algorithm by incorporating a smoothing method into our first algorithm. The proofs of the convergence rates of these two algorithms are given and we show the numerical performance of our algorithm by applying them to regularized linear regression problems with different sets of synthetic data.

研究动机与目标

  • 解决目标函数为平滑凸函数(定义为期望)与非平滑凸函数之和的复合优化问题。
  • 开发一种随机梯度下降算法,以高效处理精确梯度计算成本过高的大规模问题。
  • 通过为具有结构的非平滑分量引入平滑技术,将一阶方法扩展到投影步骤无闭式解的情形。
  • 在梯度方差和Lipschitz连续性标准假设下,建立所提随机算法的理论收敛速率。
  • 通过在合成数据上的正则化回归问题中进行数值实验,展示算法的可扩展性和效率。

提出的方法

  • 提出一种使用无偏随机梯度$G(x,\xi)$的随机梯度下降算法,用于平滑分量$f(x) = \mathbb{E}[F(x,\xi)]$,满足$\mathbb{E}[\|\nabla f(x) - G(x,\xi)\|^2] \leq \sigma^2$。
  • 当非平滑分量$h(x)$具有形式$h(x) = \max_{v \in Q} v^T A x$时,引入一种平滑技术,构造$\phi(x) = f(x) + h(x)$的平滑近似。
  • 应用Nesterov的平滑方案,将非平滑问题转化为平滑问题,从而实现高效的基于梯度的优化。
  • 采用受先前随机逼近方法启发的自适应步长,与使用随机次梯度的加速方案不同。
  • 采用带投影映射的投影梯度更新,该映射可直接计算(当存在闭式解时)或通过子程序求解。
  • 将算法应用于正则化线性和逻辑回归,使用$\ell_1$-范数和层次范数作为正则化项。

实验结果

研究问题

  • RQ1对于具有基于期望的平滑目标函数和非平滑分量的复合凸优化问题,随机梯度方法能否实现$O(1/\sqrt{N})$的收敛速率?
  • RQ2为具有结构的非平滑分量引入平滑技术,是否能提升随机梯度方法的收敛性和实际性能?
  • RQ3在收敛速度和可扩展性方面,所提算法与现有随机一阶方法(如AC-SA和标准SG)相比表现如何?
  • RQ4平滑方法是否能在标准投影映射难以计算的情况下实现闭式投影?
  • RQ5在大规模合成正则化回归问题上,算法的实证性能如何?

主要发现

  • 所提随机梯度方法实现了$O(1/\sqrt{N})$的收敛速率,与无强凸性假设下非加速随机方法的最佳已知速率一致。
  • 当非平滑分量具有形式$h(x) = \max_{v \in Q} v^T A x$时,基于平滑技术的变体表现出更快的收敛速度和更优的数值性能。
  • 在$K=1000$,$p=20$,$N=50,000$次迭代的$\ell_1$-正则化逻辑回归中,SSG由于采用了激进的步长选择,优于SG和AC-SA。
  • 在$K=1000$,$p=32$的层次范数正则化逻辑回归中,SSG比SG和AC-SA更高效,因为它允许闭式投影,而后者需要迭代子程序。
  • 在合成数据上的数值结果证实了所提算法在不同正则化结构下的可扩展性和鲁棒性。
  • 即使投影映射无闭式解,通过利用平滑技术实现高效优化,算法仍表现出有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。