[论文解读] Order and Chaos: NTK views on DNN Normalization, Checkerboard and Boundary Artifacts
本文使用神经正切核(NTK)分析深度神经网络,识别出由网络架构选择决定的两种状态——有序态与混沌态。研究发现,层归一化(Layer Normalization)与批归一化(Batch Normalization)均会使网络进入混沌态,从而避免生成对抗网络(GANs)中的棋盘效应与模式崩溃。同时,本文提出基于图的参数化方法与层依赖的学习率,以在不使用批归一化的情况下提升训练稳定性与生成样本质量。
We analyze architectural features of Deep Neural Networks (DNNs) using the so-called Neural Tangent Kernel (NTK), which describes the training and generalization of DNNs in the infinite-width setting. In this setting, we show that for fully-connected DNNs, as the depth grows, two regimes appear: "order", where the (scaled) NTK converges to a constant, and "chaos", where it converges to a Kronecker delta. Extreme order slows down training while extreme chaos hinders generalization. Using the scaled ReLU as a nonlinearity, we end up in the ordered regime. In contrast, Layer Normalization brings the network into the chaotic regime. We observe a similar effect for Batch Normalization (BN) applied after the last nonlinearity. We uncover the same order and chaos modes in Deep Deconvolutional Networks (DC-NNs). Our analysis explains the appearance of so-called checkerboard patterns and border artifacts. Moving the network into the chaotic regime prevents checkerboard patterns; we propose a graph-based parametrization which eliminates border artifacts; finally, we introduce a new layer-dependent learning rate to improve the convergence of DC-NNs. We illustrate our findings on DCGANs: the ordered regime leads to a collapse of the generator to a checkerboard mode, which can be avoided by tuning the nonlinearity to reach the chaotic regime. As a result, we are able to obtain good quality samples for DCGANs without BN.
研究动机与目标
- 理解批归一化与层归一化等归一化技术对深度神经网络训练动态的理论影响。
- 利用NTK框架解释去卷积网络中棋盘效应与边界伪影的成因。
- 提出架构与优化改进方法,使生成对抗网络在不依赖批归一化的情况下避免模式崩溃。
- 建立无限宽网络中有序-混沌相变与深度生成模型实际训练行为之间的联系。
提出的方法
- 在无限宽极限下,利用神经正切核(NTK)分析全连接网络与去卷积网络,研究权重与偏置的贡献。
- 推导不同非线性激活函数与归一化方案下的NTK极限行为,识别出有序态(恒定NTK)与混沌态(Kronecker delta)两种 regime。
- 提出基于图的参数化方法,通过修改权重共享结构,消除去卷积网络中的边界伪影。
- 引入层依赖的学习率,以平衡各层对NTK的贡献,提升深度生成模型的收敛性。
- 采用缩放ReLU非线性激活函数,分析其如何使网络进入有序态,与层归一化导致的混沌态形成对比。
- 在DCGAN上通过数值实验验证理论发现,表明在不使用批归一化的情况下仍可生成高质量样本。
实验结果
研究问题
- RQ1批归一化与层归一化等归一化技术如何影响深度网络中的NTK与训练动态?
- RQ2为何去卷积网络中会出现棋盘效应与边界伪影?其理论解释为何?
- RQ3能否通过架构选择使NTK进入混沌态,以避免生成对抗网络中的模式崩溃?
- RQ4非线性激活函数与参数化方式在决定深度网络中NTK极限行为方面起何作用?
- RQ5如何在NTK框架下为各层的贡献量身定制学习率调度策略,以提升训练稳定性?
主要发现
- 层归一化使全连接网络进入混沌态,此时NTK收敛至Kronecker delta,提升泛化能力并避免模式崩溃。
- 在最终非线性激活后应用批归一化,同样可诱导NTK进入混沌态,从而抑制去卷积网络中的棋盘伪影。
- 标准去卷积网络参数化方式因NTK贡献不均导致边界伪影,而所提出的基于图的参数化方法可有效消除该问题。
- 采用层依赖学习率可平衡各层对NTK的贡献,提升深度生成模型的收敛性。
- 通过非线性激活归一化与合理超参数调优,即使不使用批归一化,简单的DCGAN也能在混沌态下生成高质量样本。
- 采用缩放ReLU的有序态会导致生成器坍缩至棋盘模式,而当网络被推入混沌态时,该问题可被避免。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。