Skip to main content
QUICK REVIEW

[论文解读] Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes

Steffen Dereich, Sebastian Kassing|arXiv (Cornell University)|Feb 16, 2021
Stochastic Gradient Optimization Techniques参考文献 77被引用 10
一句话总结

该论文在弱假设下(包括赫尔德连续梯度和 $L^p$-鞅噪声)建立了满足 Łojasiewicz 不等式的目标函数的随机梯度下降(SGD)和动量 SGD 的几乎必然收敛性。关键结果是:当目标函数为解析函数时(例如具有解析激活函数的神经网络),若输入和输出数据具有紧致紧支集,则 SGD 在有界性事件下几乎必然收敛。

ABSTRACT

In this article, we consider convergence of stochastic gradient descent schemes (SGD), including momentum stochastic gradient descent (MSGD), under weak assumptions on the underlying landscape. More explicitly, we show that on the event that the SGD stays bounded we have convergence of the SGD if there is only a countable number of critical points or if the objective function satisfies Lojasiewicz-inequalities around all critical levels as all analytic functions do. In particular, we show that for neural networks with analytic activation function such as softplus, sigmoid and the hyperbolic tangent, SGD converges on the event of staying bounded, if the random variables modelling the signal and response in the training are compactly supported.

研究动机与目标

  • 在目标函数的弱正则性假设下,建立随机梯度下降(SGD)和动量 SGD 的几乎必然收敛性。
  • 将收敛结果扩展到标准 SGD 之外的更广泛类别的随机逼近方案,包括带有动量的方案。
  • 证明对于具有解析激活函数(例如 sigmoid、ReLU、softplus)的神经网络,若训练数据具有紧致紧支集且迭代序列保持有界,则 SGD 几乎必然收敛。
  • 证明具有解析激活函数(如深度学习中的解析激活)的目标函数满足局部 Łojasiewicz 不等式,从而支持收敛性分析。
  • 提供一个适用于更广范围函数(包括具有可数个临界点的函数)的一般收敛框架,该框架基于 Łojasiewicz 型不等式。

提出的方法

  • 采用一种通用的随机逼近框架,其中更新规则为 $ X_n = X_{n-1} + \theta_n (\Gamma_n + D_n) $,其中 $ \Gamma_n $ 为漂移项(例如 $ -\nabla f(X_{n-1}) $),$ D_n $ 为 $ L^p $-鞅差序列。
  • 对目标函数 $ f $ 施加广义的 Łojasiewicz 条件,确保在临界点附近梯度足够快地增长。
  • 采用一种新颖的证明技术,基于局部解析性和导数的统一估计,证明解析函数在局部满足 Łojasiewicz 不等式。
  • 利用解析函数的复合(例如 ReLU、sigmoid、softplus)与仿射映射的复合仍为解析映射的事实,因此网络输出关于参数是解析的。
  • 证明当激活函数 $ \rho $、损失函数 $ \mathcal{L} $ 以及输入/输出分布均为解析且具有紧致紧支集时,期望损失 $ f(\Theta) = \mathbb{E}[\mathcal{L}(\mathcal{R}(\Theta,X),Y)] $ 是解析的。
  • 应用 Łojasiewicz 不等式推导出梯度趋于零,并在有界性条件下得出参数序列的收敛性。

实验结果

研究问题

  • RQ1当目标函数非强凸时,随机梯度下降在何种条件下几乎必然收敛?
  • RQ2动量 SGD 是否可被纳入与标准 SGD 相同的收敛分析框架中?在何种条件下其收敛?
  • RQ3具有解析激活函数的神经网络是否满足 Łojasiewicz 不等式,从而提供收敛保证?
  • RQ4为确保期望损失的解析性及由此带来的收敛性,对数据分布(如紧致紧支集)需要施加何种假设?
  • RQ5当存在连续统的临界点时,收敛性如何受到影响?Łojasiewicz 不等式是否仍能保证收敛?

主要发现

  • 对于具有赫尔德连续梯度和 $ L^p $-鞅噪声($ p \in (1,2] $)的 $ C^1 $ 目标函数,几乎必然有 $ \nabla f(X_n) \to 0 $。
  • 若临界点集合为可数集且迭代序列保持有界,则 $ X_n $ 几乎必然收敛。
  • 对于满足 Łojasiewicz 不等式的目际函数(例如解析函数),当 $ (X_n) $ 保持有界时,SGD 几乎必然收敛。
  • 当激活函数 $ \rho $、损失函数 $ \mathcal{L} $ 以及输入/输出分布均为解析且具有紧致紧支集时,期望损失函数 $ f(\Theta) = \mathbb{E}[\mathcal{L}(\mathcal{R}(\Theta,X),Y)] $ 是解析的。
  • 具有解析激活函数(例如 sigmoid、softplus、tanh)且数据具有紧致紧支集的神经网络,其目标函数满足局部 Łojasiewicz 不等式,从而可提供收敛保证。
  • 该论文提出了一套新的收敛性证明框架,不同于以往工作(如 Tadic, 2015),其核心依赖于解析性与导数估计,而非李雅普诺夫函数或 ODE 近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。