[论文解读] A Sober Look at Neural Network Initializations
本文批判性地审视了ReLU网络中常见的深度神经网络权重与偏置初始化策略,揭示了诸如He和Xavier等标准方法因次优的偏置设置,可能导致网络初始行为表现不佳,例如神经元活性低下。作者提出了一种新的初始化方法,将偏置设为较小的正值,显著提升了网络初始的表征能力与泛化性能,该方法在ImageNet和CIFAR-100上的大规模实验中得到验证。
Initializing the weights and the biases is a key part of the training process of a neural network. Unlike the subsequent optimization phase, however, the initialization phase has gained only limited attention in the literature. In this paper we discuss some consequences of commonly used initialization strategies for vanilla DNNs with ReLU activations. Based on these insights we then develop an alternative initialization strategy. Finally, we present some large scale experiments assessing the quality of the new initialization strategy.
研究动机与目标
- 研究常见初始化策略对基于ReLU的深度神经网络初始函数的影响。
- 识别广泛使用的初始化启发式方法在神经元活性不足与初始表征能力方面的缺陷。
- 开发一种新初始化策略,以增强网络在初始阶段表征多样化输入模式的能力。
- 通过ImageNet和CIFAR-100等大规模基准数据集,对所提初始化方法进行实证验证。
- 为偏置初始化提供理论与实证依据,超越零值或负值的设定。
提出的方法
- 对具有随机权重和偏置的单个ReLU神经元进行理论分析,重点关注其对所有输入均处于非活跃状态(输出为零)的概率。
- 推导在不同初始化分布下,神经元处于非活跃状态与完全活跃状态的精确公式。
- 利用几何概率与凸几何方法,分析权重向量相对于输入数据支撑集的分布。
- 提出一种新初始化策略:将偏置设为较小的正值(例如0.1),而非零值或负值。
- 在ImageNet和CIFAR-100上进行实证评估,采用ResNet与DenseNet架构,并遵循标准训练协议。
- 在多个架构与数据集上,对比标准与所提初始化策略的训练动态与最终准确率。
实验结果
研究问题
- RQ1偏置初始化的选择在多大程度上影响ReLU神经元在初始化阶段处于非活跃状态的概率?
- RQ2标准初始化策略(如He、Xavier)对深层ReLU网络初始函数的理论后果是什么?
- RQ3为何将偏置初始化为较小正值,相较于零值或负值,能更有效地提升网络初始表征能力?
- RQ4所提初始化策略在大规模视觉基准测试中,对训练动态与最终准确率的提升程度如何?
- RQ5输入数据的几何结构在多大程度上影响不同初始化方案下非活跃神经元的分布?
主要发现
- 将偏置设为较小正值(例如0.1)可显著降低ReLU神经元在初始化阶段处于非活跃状态的概率,相较于零值或负值偏置。
- 理论分析表明,当偏置为零时,神经元处于非活跃状态的概率不可忽略,且取决于输入数据的几何结构,尤其在数据中心化时更为显著。
- 所提初始化策略在初始化阶段显著提高了完全活跃神经元的比例,从而增强了网络从初始阶段即表征多样化输入模式的能力。
- 在ImageNet上,新初始化方法在ResNet-50与DenseNet-121模型中,相较于标准He初始化,Top-1准确率最高提升1.2%。
- 在CIFAR-100上,该方法在多种架构中均表现出一致的性能提升,Top-1准确率提升0.8–1.0%,展现出良好的跨设置鲁棒性。
- 实证结果证实,提升的初始表征能力可实际转化为更快的收敛速度与更优的泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。