[论文解读] Finite Depth and Width Corrections to the Neural Tangent Kernel
本文推导了ReLU网络中神经正切核(NTK)的精确有限深度与有限宽度修正,表明其均值与方差均随深度与宽度之比呈指数级增长。关键发现是,即使在无限过参数化极限下,NTK仍保持非确定性,并在训练过程中演化,从而在懒惰训练范式中实现数据相关的特征学习。
We prove the precise scaling, at finite depth and width, for the mean and variance of the neural tangent kernel (NTK) in a randomly initialized ReLU network. The standard deviation is exponential in the ratio of network depth to width. Thus, even in the limit of infinite overparameterization, the NTK is not deterministic if depth and width simultaneously tend to infinity. Moreover, we prove that for such deep and wide networks, the NTK has a non-trivial evolution during training by showing that the mean of its first SGD update is also exponential in the ratio of network depth to width. This is sharp contrast to the regime where depth is fixed and network width is very large. Our results suggest that, unlike relatively shallow and wide networks, deep and wide ReLU networks are capable of learning data-dependent features even in the so-called lazy training regime.
研究动机与目标
- 理解有限深度与有限宽度ReLU网络中神经正切核(NTK)的统计行为,特别是其与无限宽度极限的偏离情况。
- 分析NTK的均值与方差随深度与宽度变化的标度规律,尤其是在两者均趋于无穷的联合极限下。
- 研究在深层与宽网络中,NTK是否在训练过程中演化,从而挑战懒惰训练范式中核冻结的假设。
- 量化NTK的一阶随机梯度下降(SGD)更新,揭示其对深度与宽度之比的依赖性。
- 证明即使在懒惰训练下,深层宽ReLU网络仍能实现数据相关的特征学习,与无限宽度理论的预测相反。
提出的方法
- 通过权重与激活相关性的图解展开,推导出随机初始化的深层ReLU网络中NTK的精确期望与方差。
- 对路径梯度及其重叠进行逐层递归分析,将NTK建模为计算图中路径之和。
- 通过路径图中边多重集与环结构的组合计数,计算NTK的矩,利用四阶累积量μ₄引入高阶累积量。
- 提出一种依赖于层宽与深度的加权路径计数方案,捕捉波动的指数级标度特性。
- 在大宽度极限下使用渐近展开,分离出NTK的主导阶修正项,包括依赖于深度与宽度之比的项。
- 通过计算损失关于网络参数梯度的期望,分析NTK的一阶SGD更新,揭示其对深度与宽度的指数依赖性。
实验结果
研究问题
- RQ1有限深度与宽度如何影响ReLU网络中NTK的均值与方差?
- RQ2在深度与宽度均趋于无穷的联合极限下,NTK是否仍保持确定性,还是波动持续存在?
- RQ3在深层宽网络中,NTK的一阶SGD更新的标度规律如何?其对深度与宽度的依赖性如何?
- RQ4尽管在无限宽度极限下NTK近似冻结,深层宽ReLU网络是否仍能在懒惰训练范式中实现数据相关的特征学习?
- RQ5深度与宽度之比在决定NTK的统计行为及其训练过程中的演化中起什么作用?
主要发现
- NTK的标准差随网络深度与宽度之比呈指数级增长,表明即使在无限过参数化极限下,NTK仍保持随机性。
- NTK一阶SGD更新的均值也随深度与宽度之比呈指数级增长,表明其在训练过程中存在非平凡的演化。
- 在深层宽网络中,NTK的有限宽度修正不可忽略;即使在宽度极限下,核仍保持非确定性。
- NTK的方差与更新幅度对深度与宽度之比具有指数级敏感性,表明深层宽网络能够学习数据相关的特征。
- 与固定深度、大宽度情形下NTK近似确定且冻结不同,深层宽网络表现出显著的核可变性与演化特性。
- 结果表明,深层宽ReLU网络在懒惰训练范式中具备特征学习能力,挑战了此类网络仅为核方法的常规观点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。