[论文解读] Beyond Signal Propagation: Is Feature Diversity Necessary in Deep Neural Network Initialization?
本文表明,只要保持信号传播和梯度稳定性,即使在权重初始化时所有特征完全相同、缺乏多样性,深度神经网络仍可实现高精度。通过将几乎所有权重初始化为零,并依赖非确定性的GPU运算实现对称性破缺,作者训练出的网络在CIFAR-10上性能与标准随机初始化相当,挑战了权重初始化中特征多样性必要性的传统观点。
Deep neural networks are typically initialized with random weights, with variances chosen to facilitate signal propagation and stable gradients. It is also believed that diversity of features is an important property of these initializations. We construct a deep convolutional network with identical features by initializing almost all the weights to $0$. The architecture also enables perfect signal propagation and stable gradients, and achieves high accuracy on standard benchmarks. This indicates that random, diverse initializations are extit{not} necessary for training neural networks. An essential element in training this network is a mechanism of symmetry breaking; we study this phenomenon and find that standard GPU operations, which are non-deterministic, can serve as a sufficient source of symmetry breaking to enable training.
研究动机与目标
- 探究随机且多样的特征初始化是否确实是深度学习训练成功所必需的。
- 检验假设:仅靠信号传播和梯度稳定性,即使初始特征完全相同,也可能足以实现训练。
- 探索非确定性硬件运算是否可作为具有相同初始特征网络中的充分对称性破缺机制。
- 评估不同对称性破缺机制(如硬件噪声、Dropout、权重量化)在对称初始化网络中对训练成功的影响。
提出的方法
- 作者构建了一个深度卷积网络,几乎将所有权重初始化为零,确保通道间初始特征完全相同。
- 通过使用带零初始化跳跃连接的改进残差块结构,保持网络中信号传播和梯度流动的稳定性。
- 网络在反向传播过程中主要依赖非确定性GPU运算(如浮点数舍入误差)作为对称性破缺的主要来源。
- 他们在不同硬件平台和精度格式(FP32、FP16)上评估训练性能,并对比启用或禁用额外对称性破缺机制(如Dropout)的结果。
- 通过测量梯度扰动范数和各层间特征相关性的衰减,量化训练过程中对称性被打破的速度。
- 比较不同初始化方案和对称性破缺机制(包括硬件噪声、Dropout和量化效应)下的模型精度。
实验结果
研究问题
- RQ1具有完全相同初始特征的深度神经网络是否能在标准基准上实现高测试精度?
- RQ2权重初始化中的特征多样性是否是深度网络成功训练的必要条件?
- RQ3非确定性GPU运算是否足以作为具有相同初始特征网络中学习的充分对称性破缺源?
- RQ4不同对称性破缺机制(如Dropout、硬件噪声、量化)如何影响对称初始化网络中的训练性能?
- RQ5硬件平台或浮点精度的选择是否会影响零初始化网络中对称性破缺的有效性?
主要发现
- 一个所有权重(除一个外)均初始化为零的深度残差网络在CIFAR-10上实现了94.8%的测试精度,与标准随机初始化性能相当。
- 仅靠非确定性GPU运算即可实现对称性破缺并成功训练网络,即使未使用Dropout或其他显式噪声机制。
- 在FP16硬件上,仅靠GPU噪声不足以实现训练,需额外引入如Dropout等机制才能达到高精度。
- 在某些GPU上,仅依赖硬件噪声时,零初始化模型与随机初始化模型之间的精度差距超过70%,表明性能具有显著硬件依赖性。
- 仅在后期层应用Dropout无法破除第一层的对称性,但若在所有层均应用Dropout,则可缩小与随机初始化的精度差距。
- 使用全1矩阵或单位矩阵初始化的网络中,对称性破缺过程更缓慢,需更多训练步数才能达到相近性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。