Skip to main content
QUICK REVIEW

[论文解读] Non-asymptotic approximations of neural networks by Gaussian processes

Ronen Eldan, Dan Mikulincer|arXiv (Cornell University)|Feb 17, 2021
Markov Chains and Monte Carlo Methods参考文献 30被引用 5
一句话总结

本文首次为宽度有限但足够宽的神经网络在随机权重初始化下,提供了其可被高斯过程近似的非渐近、定量界。通过在无限维空间中利用运输距离的函数中心极限定理,该研究建立了依赖于激活函数特性的收敛速率——多项式激活函数依赖其多项式次数,一般激活函数依赖其光滑性,从而为尼尔(Neal)经典的渐近结果提供了一个严谨的有限宽度类比。

ABSTRACT

We study the extent to which wide neural networks may be approximated by Gaussian processes when initialized with random weights. It is a well-established fact that as the width of a network goes to infinity, its law converges to that of a Gaussian process. We make this quantitative by establishing explicit convergence rates for the central limit theorem in an infinite-dimensional functional space, metrized with a natural transportation distance. We identify two regimes of interest; when the activation function is polynomial, its degree determines the rate of convergence, while for non-polynomial activations, the rate is governed by the smoothness of the function.

研究动机与目标

  • 通过提供定量近似界,弥合渐近结果(无限宽度极限)与实际有限宽度神经网络之间的差距。
  • 在无限维函数空间中建立功能性中心极限定理(CLT),而不仅限于有限维的边缘分布。
  • 利用运输度量,推导出随机初始化的宽神经网络被高斯过程近似的显式收敛速率。
  • 表明收敛速率取决于激活函数:多项式激活函数依赖其多项式次数,一般激活函数依赖其光滑性。
  • 通过利用神经网络架构的结构特性,将复杂的泛函逼近问题简化为有限维设置,从而统一并扩展先前的工作。

提出的方法

  • 作者将具有随机初始化的两层神经网络建模为单位球面上的随机过程,使用独立同分布的标准高斯权重和 Rademacher 符号。
  • 在 $ L^2(\mathbb{S}^{n-1}) $ 中的随机过程空间上定义一种运输距离(Wasserstein-2),以比较网络的分布与极限高斯过程之间的差异。
  • 对于多项式激活函数,将网络嵌入高维张量空间,并应用近期在高维中心极限定理中取得的、具有显式误差界的结果。
  • 对于一般光滑激活函数,使用激活函数的多项式逼近,并以激活函数的光滑性来界定误差,从而将问题简化为多项式情形。
  • 应用希勒(Hille)定理和埃尔米特多项式展开,以控制激活函数傅里叶系数的衰减。
  • 最终的界通过结合逼近理论中的误差项与概率集中性结果导出,得到以网络宽度 $k$、输入维度 $n$ 和激活函数光滑性表示的显式速率。

实验结果

研究问题

  • RQ1在函数空间中,而非仅在有限个输入点上,随机初始化的宽神经网络以多快的速度收敛到高斯过程?
  • RQ2在非渐近情形下,收敛速率由什么决定——激活函数特性还是网络宽度?
  • RQ3能否在无限维空间中,使用运输度量,建立具有显式、定量边界的功能性中心极限定理?
  • RQ4多项式与非多项式激活函数之间的收敛速率有何不同?
  • RQ5在多大程度上,可通过逼近理论将一般激活函数的分析简化为多项式情形?

主要发现

  • 对于具有 $d$ 次多项式激活函数的两层网络,网络与极限高斯过程之间的 Wasserstein-2 距离被限制为 $O(k^{-1/6})$,外加一个依赖于激活函数傅里叶系数 $L^2$-范数的项。
  • 对于 ReLU 激活函数,收敛速率为 $O\left(\left(\frac{1}{k^{1/6}} + \left(\frac{\log n \log \log k}{\log k}\right)^2\right)\right)$,其中 $k^{-1/6}$ 项占主导地位。
  • 对于如 tanh 等光滑激活函数,收敛速率呈指数级快速:$O\left(\exp\left(-C^{-1}\sqrt{\frac{\log k}{\log n \log \log k}}\right)\right)$,远快于多项式速率。
  • 收敛速率不随输入点数量的增加而恶化,使得该边界对任意有限输入集合的联合分布均具有鲁棒性。
  • 分析表明,对于非多项式情形,激活函数的光滑性决定了收敛速率,例如对 $\tanh$ 有 $R_\sigma(d) \leq e^{-C\sqrt{d}}$,从而导致超多项式收敛。
  • 结果建立了尼尔(Neal)经典中心极限定理的有限宽度、定量类比,首次实现了对宽神经网络的函数型、非渐近高斯过程近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。