QUICK REVIEW
[论文解读] Asymptotics of Wide Networks from Feynman Diagrams
Ethan Dyer, Guy Gur-Ari|arXiv (Cornell University)|Sep 25, 2019
advanced mathematical theories参考文献 36被引用 45
一句话总结
本文提出一种通用的、图式方法(受 Feynman 图的启发)来界定宽度神经网络相关函数的渐近行为,并将其应用于训练动力学,从而得到有限宽度修正及更紧的 SGD/NTK 结果。
ABSTRACT
Understanding the asymptotic behavior of wide networks is of considerable interest. In this work, we present a general method for analyzing this large width behavior. The method is an adaptation of Feynman diagrams, a standard tool for computing multivariate Gaussian integrals. We apply our method to study training dynamics, improving existing bounds and deriving new results on wide network evolution during stochastic gradient descent. Going beyond the strict large width limit, we present closed-form expressions for higher-order terms governing wide network training, and test these predictions empirically.
研究动机与目标
- 激发对宽度(大宽度)神经网络及其训练行为的理解。
- 引入一种利用图式方法来界定网络相关函数渐近性的通用方法。
- 将该方法应用于训练动力学,以收窄对梯度流和 SGD 演化的界限。
- 提供无限宽极限的有限宽度修正并连接到 Neural Tangent Kernel (NTK) 动力学。
提出的方法
- 将相关函数定义为网络输出及对参数的导数的集合平均。
- 将 Feynman 图技巧适配以通过一个假设的尺度界(Conjecture 1)来界定大宽度行为。
- 证明该猜想对深线性网络是精确的,并为具有非线性(ReLU, tanh)和非高斯初始化的网络提供证据/部分证明。
- 通过在无限宽极限周围展开并求解核和网络映射的耦合方程,推导训练动力学的有限宽度修正。
- 制定并应用 Feynman 规则以计算图式贡献并界定它们对 n 的依赖。
- 在大宽度极限下,SGD 更新对学习率呈线性,并计算 NTK 与网络演化的主要有限宽度修正。
实验结果
研究问题
- RQ1使用图式方法,在大宽度极限下,宽网络的相关函数是否可以被界定?
- RQ2有限宽度修正如何在梯度流与 SGD 下改变 Neural Tangent Kernel 与网络演化?
- RQ3所提出的界限是否超越深层线性网络,扩展到具有 ReLU、tanh 等非线性激活的网络?
- RQ4训练动力学以及 NTK 与 Hessian 的谱属性的首阶有限宽度修正是什么?
主要发现
- 一个一般性猜想给出相关函数的界限,其随着宽度变化的指数由收缩图的簇组件(偶/奇)决定。
- 对于深层线性网络,已证明该猜想;对于带 ReLU 的网络或具有光滑激活的一隐层网络,在某些条件下成立。
- 在训练动力学中,NTK 在梯度流和 SGD 下,直到 O(n^{-1}) 修正,保持不变。
- 网络映射和 NTK 的主要有限宽度修正以闭式形式推导出来,表示为 O_s 函数和对 NTK 谱的积分。
- 实验结果(如两类 MNIST)验证了 O(n^{-1}) 标度以及跨激活与初始化方案的预测有限宽度修正。
- 此方法相较于以往结果在核演化上的界限更紧,并在大宽度区域显示 SGD 的学习率线性行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。