[论文解读] Initialization of ReLUs for Dynamical Isometry
本文提出了一种用于ReLU网络的新初始化方案,通过强制参数共享实现完美的动态等距,克服了标准He初始化在深层网络中无法保持信号多样性的局限。该方法确保了稳定的梯度流动,并在MNIST和CIFAR-10上显著提升了训练准确率,尤其在更深的网络结构中表现优异,且无需使用批量归一化。
Deep learning relies on good initialization schemes and hyperparameter choices prior to training a neural network. Random weight initializations induce random network ensembles, which give rise to the trainability, training speed, and sometimes also generalization ability of an instance. In addition, such ensembles provide theoretical insights into the space of candidate models of which one is selected during training. The results obtained so far rely on mean field approximations that assume infinite layer width and that study average squared signals. We derive the joint signal output distribution exactly, without mean field assumptions, for fully-connected networks with Gaussian weights and biases, and analyze deviations from the mean field results. For rectified linear units, we further discuss limitations of the standard initialization scheme, such as its lack of dynamical isometry, and propose a simple alternative that overcomes these by initial parameter sharing.
研究动机与目标
- 解决标准ReLU权重初始化方法(如He初始化)在深层网络中缺乏动态等距的问题。
- 对具有高斯权重和偏置的全连接ReLU网络中的信号传播进行精确的非平均场分析。
- 识别出能够保持信号相关性并在无需批量归一化的情况下实现深层网络稳定训练的初始化方案。
- 提出一种简单而有效的He初始化替代方案,通过初始参数共享确保完美的动态等距。
提出的方法
- 推导出具有高斯权重和偏置的全连接ReLU网络的精确联合信号输出分布,不依赖于平均场近似。
- 引入一个线性转移算子,用于建模输入之间信号标量积的逐层传播。
- 分析该算子的谱特性,以评估网络的可训练性和信号可区分性。
- 提出一种新的初始化方案——GSM(Gaussian with Shared Means)和正交权重初始化,其中部分权重被共享或结构化,以确保完整的信号传输。
- 使用输出信号之间的余弦相似度作为度量,评估不同层间输入的可区分性。
- 在MNIST和CIFAR-10上进行实验评估,采用不同深度和宽度的全连接ReLU网络,比较He初始化、GSM和正交初始化在相同训练条件下的表现。
实验结果
研究问题
- RQ1为何标准ReLU初始化方法(如He初始化)在深层网络中无法实现动态等距?
- RQ2对深层ReLU网络中信号传播的精确、非渐近分析,能否揭示平均场近似的局限性?
- RQ3何种初始化方案可在不依赖批量归一化的情况下,确保ReLU网络实现完美的动态等距?
- RQ4初始参数共享如何提升深层全连接网络中的信号多样性和可训练性?
主要发现
- 标准He初始化虽然保持了信号方差,但由于信号随深度增加而趋于对齐,导致信号多样性下降,从而在深层网络中可训练性差。
- 所提出的GSM和正交初始化方案在MNIST和CIFAR-10上始终优于He初始化,尤其在更深的网络中表现更优,测试准确率更高且训练过程更稳定。
- 对于更深的网络(L ≥ 10),He初始化的模型准确率随深度增加而下降,而GSM和正交初始化的模型则保持或提升性能。
- 正交初始化变体在不同宽度下表现出最可靠的性能,且随着宽度增加,准确率持续提升。
- 精确的信号分布分析表明,仅输入之间信号的标量积决定了输出分布,高阶相互作用不影响结果。
- 信号传播算子的谱特性比输入-输出雅可比矩阵的平均谱密度更能反映网络的可训练性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。