Skip to main content
QUICK REVIEW

[论文解读] Scaling Limit of Neural Networks with the Xavier Initialization and Convergence to a Global Minimum

Justin Sirignano, Konstantinos Spiliopoulos|arXiv (Cornell University)|Jul 9, 2019
Stochastic Gradient Optimization Techniques参考文献 16被引用 7
一句话总结

该论文证明,当隐藏单元数 $N$ 和训练步数 $TN$ 趋近无穷大时,采用 Xavier 初始化($1/\sqrt{N}$ 缩放)的单层神经网络在分布上收敛至一个随机常微分方程(SDE)。尽管在有限 $N$ 情况下优化景观是非凸的,但在温和条件下,极限系统会最小化一个凸二次目标函数,并收敛至全局最小值,训练损失为零。

ABSTRACT

We analyze single-layer neural networks with the Xavier initialization in the asymptotic regime of large numbers of hidden units and large numbers of stochastic gradient descent training steps. The evolution of the neural network during training can be viewed as a stochastic system and, using techniques from stochastic analysis, we prove the neural network converges in distribution to a random ODE with a Gaussian distribution. The limit is completely different than in the typical mean-field results for neural networks due to the $\frac{1}{\sqrt{N}}$ normalization factor in the Xavier initialization (versus the $\frac{1}{N}$ factor in the typical mean-field framework). Although the pre-limit problem of optimizing a neural network is non-convex (and therefore the neural network may converge to a local minimum), the limit equation minimizes a (quadratic) convex objective function and therefore converges to a global minimum. Furthermore, under reasonable assumptions, the matrix in the limiting quadratic objective function is positive definite and thus the neural network (in the limit) will converge to a global minimum with zero loss on the training set.

研究动机与目标

  • 严格分析在 Xavier 初始化下,使用随机梯度下降训练的单层神经网络的标度极限。
  • 解决一个开放问题:尽管预极限模型中参数存在相关性,神经网络输出是否在 $N \to \infty$ 时收敛。
  • 证明尽管有限-$N$ 优化是非凸的,但极限系统会最小化一个凸二次目标函数。
  • 建立极限系统收敛至全局最小值且训练损失为零的条件。
  • 通过将 Xavier 初始化与大-$N$ 极限下收敛至全局最优解的性质相联系,为 Xavier 初始化在深度学习中的经验成功提供理论基础。

提出的方法

  • 使用随机分析和弱收敛技术,研究经验测度 $\nu_k^N$ 和网络输出 $g_k^N$ 的联合演化。
  • 引入缩放过程 $h_t^N = g_{\lfloor Nt \rfloor}^N$ 和 $\mu_t^N = \nu_{\lfloor Nt \rfloor}^N$,以在连续时间下分析系统。
  • 证明 $(\mu_t^N, h_t^N)$ 在分布上收敛至由高斯过程驱动的随机 ODE 的解。
  • 应用 Prokhorov 定理和 Skorokhod 空间 $D_E([0,T])$ 中的相对紧致性,建立有限维分布的弱收敛。
  • 将极限目标函数表征为一个矩阵 $A$ 的二次型,该矩阵在温和假设下被证明是正定的。
  • 利用极限系统最小化凸二次目标函数的事实,证明其收敛至全局最小值且损失为零。

实验结果

研究问题

  • RQ1尽管预极限模型中存在参数相关性,神经网络输出 $g^N(x)$ 是否在 $N \to \infty$ 时收敛?
  • RQ2在大-$N$ 范围内采用 Xavier 初始化时,随机梯度下降动力学的极限行为是什么?
  • RQ3与使用 $1/N$ 缩放而非 $1/\sqrt{N}$ 的典型平均场模型相比,极限系统有何不同?
  • RQ4即使有限-$N$ 问题为非凸,能否证明极限系统最小化一个凸目标函数?
  • RQ5在何种条件下,极限二次目标函数为正定,从而确保收敛至全局最小值且训练损失为零?

主要发现

  • 当 $N \to \infty$ 时,神经网络输出 $g_k^N(x)$ 在分布上收敛至一个随机 ODE 的解,其极限依赖于初始分布 $\mu_0$ 和数据分布 $\pi$。
  • 极限系统最小化一个凸二次目标函数,意味着尽管有限-$N$ 问题为非凸,系统仍会收敛至全局最小值。
  • 在温和假设下(如在数据点上特征映射 $\sigma(W \cdot x)$ 的线性无关性),极限二次目标函数中的矩阵 $A$ 为正定。
  • 当 $A$ 为正定时,极限系统以几乎必然的方式实现零训练损失,这是由于目标函数的凸性及严格最小化性质。
  • 在极限下,收敛至全局最小值是确定的,为 Xavier 初始化在深度学习中成功提供了理论依据。
  • Xavier 初始化中的 $1/\sqrt{N}$ 缩放导致的极限与典型平均场模型中 $1/N$ 缩放的极限有本质不同,导致非退化的随机 ODE 极限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。