[论文解读] A Deep Conditioning Treatment of Neural Networks
本文通过归一化激活以改善数据条件,提出一种用于神经网络的深度条件化方法,表明深度可使核矩阵的条件数指数级地趋近于1。该方法在过参数化网络中实现了更快的训练速度和更好的泛化性能,对顶层和全连接权重训练均提供了理论保证,并通过实验证实了归一化ReLU(NormReLU)作为批量归一化的一种可行替代方案。
We study the role of depth in training randomly initialized overparameterized neural networks. We give a general result showing that depth improves trainability of neural networks by improving the conditioning of certain kernel matrices of the input data. This result holds for arbitrary non-linear activation functions under a certain normalization. We provide versions of the result that hold for training just the top layer of the neural network, as well as for training all layers, via the neural tangent kernel. As applications of these general results, we provide a generalization of the results of Das et al. (2019) showing that learnability of deep random neural networks with a large class of non-linear activations degrades exponentially with depth. We also show how benign overfitting can occur in deep neural networks via the results of Bartlett et al. (2019b). We also give experimental evidence that normalized versions of ReLU are a viable alternative to more complex operations like Batch Normalization in training deep neural networks.
研究动机与目标
- 理解深度如何通过改善数据条件性来增强过参数化神经网络的可训练性。
- 形式化激活归一化在降低核矩阵条件数方面的作用,且不依赖于激活函数类型。
- 证明深度通过增强核矩阵条件性,可实现优化和泛化性能的指数级提升。
- 表明良性过拟合和随机深度网络中的可学习性由该条件化机制所支持。
- 提出NormReLU作为批量归一化的实用替代方案,并通过在CIFAR-10上的实验进行验证。
提出的方法
- 对激活进行归一化,使得在标准高斯输入下,输出具有零均值和单位方差,且不依赖于基础激活函数。
- 定义非线性系数以量化条件数随深度趋近于1的收敛速率。
- 在懒惰训练框架下,分析顶层训练和全网络训练中核矩阵的条件数。
- 利用神经正切核(NTK)框架,将结果扩展至小学习率下的全权重训练。
- 提出NormReLU作为ReLU的归一化变体,无需架构修改。
- 在全连接网络和ResNet架构上对CIFAR-10进行实验,将NormReLU与批量归一化、层归一化以及SeLU进行对比。
实验结果
研究问题
- RQ1在随机初始化的深度神经网络中,深度如何影响核矩阵的条件性?
- RQ2激活归一化是否能普遍改善不同激活函数下深层网络的可训练性?
- RQ3深度是否能独立于初始数据条件性,实现训练误差的指数级更快收敛?
- RQ4由于条件性改善,良性过拟合是否可能在深度随机神经网络中发生?
- RQ5像NormReLU这样的归一化ReLU变体是否可以替代训练深层网络中的批量归一化?
主要发现
- 核矩阵的条件数随深度呈指数级快速收敛至1,收敛速率由激活函数的非线性系数决定。
- 由于深度带来的条件性改善,使用平方损失的梯度下降可在O(log(1/ε))次迭代内达到ε训练误差,且与初始数据条件性无关。
- 即使在初始化上取常数概率,学习由深度随机神经网络实现的目标函数,仍需指数级多的查询次数。
- 在深度随机网络中,最小范数插值解可实现非平凡的额外风险,证明了良性过拟合的存在。
- NormReLU在CIFAR-10上的测试准确率与批量归一化和层归一化相当,且在更深网络中表现更优。
- 在全连接和残差架构中,归一化ReLU变体在性能上优于或至少匹配SeLU,表明其作为批量归一化的可行替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。