[论文解读] Finite size corrections for neural network Gaussian processes
该论文表明,对于具有单个隐藏层的大规模、有限宽度全连接神经网络,在初始化时其输出分布可被高斯过程扰动所良好近似,扰动项为四阶埃奇沃斯多项式。该扰动的幅度与隐藏单元数N成反比,证实了埃奇沃斯展开作为无限宽度高斯过程极限的有限尺寸修正的有效性。
There has been a recent surge of interest in modeling neural networks (NNs) as Gaussian processes. In the limit of a NN of infinite width the NN becomes equivalent to a Gaussian process. Here we demonstrate that for an ensemble of large, finite, fully connected networks with a single hidden layer the distribution of outputs at initialization is well described by a Gaussian perturbed by the fourth Hermite polynomial for weights drawn from a symmetric distribution. We show that the scale of the perturbation is inversely proportional to the number of units in the NN and that higher order terms decay more rapidly, thereby recovering the Edgeworth expansion. We conclude by observing that understanding how this perturbation changes under training would reveal the regimes in which the Gaussian process framework is valid to model NN behavior.
研究动机与目标
- 弥合无限宽度神经网络高斯过程与实际有限宽度网络之间的差距。
- 量化有限宽度神经网络在初始化时输出分布偏离高斯性的程度。
- 确定埃奇沃斯展开是否能准确描述神经网络输出中的有限尺寸效应。
- 评估非高斯修正在训练过程中的稳定性,以评估高斯过程框架在建模神经网络动力学时的有效性。
提出的方法
- 通过特征函数分析推导单隐藏层神经网络在N个隐藏单元下的输出分布。
- 应用埃奇沃斯展开以建模超出高斯近似的高阶累积量,重点关注四阶累积量。
- 使用第三类埃奇沃斯多项式描述输出分布中对高斯分布的主导阶修正。
- 通过采样10^8个N=128的网络进行实证验证,并将经验累积分布函数与预测的扰动高斯分布进行比较。
- 在N ∈ [8, 148]范围内测量扰动幅度随N的变化,拟合偏差为α·N^−1的标度关系。
- 采用Glorot均匀初始化和ReLU激活函数,以确保所有实验中初始化的方差有限且一致。
实验结果
研究问题
- RQ1有限宽度神经网络在初始化时,其输出分布如何偏离高斯过程?
- RQ2在有限宽度网络中,对高斯近似的主导阶修正的函数形式是什么?
- RQ3非高斯修正项的幅度如何随隐藏单元数N变化?
- RQ4该扰动在训练过程中是否保持稳定或发生显著演化?这对高斯过程框架的有效性有何启示?
- RQ5埃奇沃斯展开能否准确描述大规模但有限宽度神经网络的输出分布?
主要发现
- 有限宽度神经网络在初始化时的输出分布最准确地由高斯过程扰动第三类埃奇沃斯多项式描述,而非摘要中所述的第四类——通过累积分布函数比较已确认此更正。
- 扰动幅度近似按N^−1.07缩放,证实其与网络宽度成反比衰减。
- 对N=128的10^8个网络进行经验累积分布函数分析,与预测的扰动高斯模型高度一致。
- 主导阶修正由第三类埃奇沃斯多项式主导,更高阶项衰减更快,与埃奇沃斯展开一致。
- 在初始化条件下,扰动保持稳定,表明有限尺寸效应可系统性量化,对高斯过程框架在训练期间的有效性具有启示意义。
- 结果表明,只要通过有限尺寸修正考虑非高斯修正,高斯过程对有限网络仍为强有力近似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。