Skip to main content
QUICK REVIEW

[论文解读] On Random Kernels of Residual Architectures

Etai Littwin, Tomer Galanti|arXiv (Cornell University)|Jan 28, 2020
Advanced Neural Network Applications参考文献 17被引用 4
一句话总结

该论文推导了残差(ResNet)和密集连接(DenseNet)架构中神经正切核(NTK)的有限宽度和深度修正,表明当宽度和深度在适当初始化下同时增长时,这些网络会收敛到无限宽度NTK范式。与普通网络不同,ResNets和DenseNets以极低的参数复杂度——分别为O(L)和O(L²)——实现了有界的NTK方差,从而即使在有限尺寸下也能通过随机梯度特征实现有效的核回归。

ABSTRACT

We derive finite width and depth corrections for the Neural Tangent Kernel (NTK) of ResNets and DenseNets. Our analysis reveals that finite size residual architectures are initialized much closer to the "kernel regime" than their vanilla counterparts: while in networks that do not use skip connections, convergence to the NTK requires one to fix the depth, while increasing the layers' width. Our findings show that in ResNets, convergence to the NTK may occur when depth and width simultaneously tend to infinity, provided with a proper initialization. In DenseNets, however, convergence of the NTK to its limit as the width tends to infinity is guaranteed, at a rate that is independent of both the depth and scale of the weights. Our experiments validate the theoretical results and demonstrate the advantage of deep ResNets and DenseNets for kernel regression with random gradient features.

研究动机与目标

  • 理解残差连接和密集连接如何影响有限宽度、有限深度网络中神经正切核(NTK)向其无限宽度极限的收敛性。
  • 解决普通全连接网络的局限性,即收敛到NTK范式需要随深度增加宽度,导致高参数复杂度。
  • 表征残差和密集架构中NTK收敛的速度,尤其关注对角项和非对角项。
  • 通过在MNIST和小型UCI数据集上使用随机梯度特征进行的实证实验,验证理论推导的收敛速度。
  • 证明即使在固定宽度下,深层ResNets和DenseNets在核回归中也优于普通架构,这是由于深度带来的NTK稳定性提升。

提出的方法

  • 为ReLU前馈网络引入前向-后向范数传播对偶性,以分析NTK条目方差。
  • 通过逐层激活和梯度的递归分析,推导ResNets和DenseNets的NTK有限宽度和深度修正。
  • 使用矩分析计算期望平方NTK值及其方差,重点关注对角项的E[G(x,x)]和E[G(x,x)²]。
  • 通过E[G(x,x)²]/E[G(x,x)]²的上下界,建立NTK归一化方差的界,结合宽度n和深度L。
  • 以普通ReLU网络的结果作为基准情况,通过跳跃连接的递归分解,将结果扩展到残差和密集架构。
  • 在MNIST和UCI数据集上,通过使用随机梯度特征G(x;w)作为核近似,开展核回归性能的实证评估。

实验结果

研究问题

  • RQ1在残差和密集架构中,NTK收敛到其无限宽度极限的速度如何依赖于宽度和深度?
  • RQ2当宽度和深度同时增长时,ResNets和DenseNets能否实现NTK收敛,而普通网络则不能?
  • RQ3与普通网络相比,有限深度的ResNets和DenseNets为维持有界NTK方差所需的参数复杂度是多少?
  • RQ4在ResNets和DenseNets中,使用随机梯度特征的核回归性能如何随深度变化,与普通架构相比如何?
  • RQ5在残差和密集网络中,完整NTK矩阵的联合分布行为如何?与仅分析对角项的结果相比有何不同?

主要发现

  • 对于ResNets,当宽度和深度在适当初始化下同时趋于无穷大时,NTK收敛到极限,其参数复杂度可低至O(L)。
  • 对于DenseNets,随着宽度增加,NTK收敛到其无限宽度极限,且收敛速度与深度和权重尺度无关。
  • 在ResNets中,对角NTK项G(x,x)的归一化方差按exp(5m/n + C/n ∑ αl/(1+αl))缩放,当宽度和深度共同增长时,该值保持有界。
  • 在DenseNets中,归一化方差被限制在max{1, 1/(L log²L) · exp(C/n)}以内,表明即使在固定宽度下,增加深度也能提升核近似质量。
  • 实证结果表明,对于固定宽度的ResNets和DenseNets,使用随机梯度特征的核回归性能随深度提升而改善,并趋近于无限宽度极限,而普通网络则表现出性能退化。
  • 在MNIST和小型UCI数据集上的实证结果验证了NTK方差的理论界,证实深层残差和密集架构在有限尺寸下仍能保持稳定的NTK行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。