[论文解读] Diagonal Rescaling For Neural Networks
本文提出了一种用于神经网络随机梯度下降的对角缩放方法,通过重参数化对单位激活进行归一化,实现高效的二阶优化。该方法揭示了两个关键洞见:对 RMSProp 和输入规模(fan-in)步长缩放的理论解释,以及快速曲率变化在训练不稳定中的关键作用,从而解释了为何批量归一化有效,以及为何标准二阶方法在缺乏自适应曲率估计时会失效。
We define a second-order neural network stochastic gradient training algorithm whose block-diagonal structure effectively amounts to normalizing the unit activations. Investigating why this algorithm lacks in robustness then reveals two interesting insights. The first insight suggests a new way to scale the stepsizes, clarifying popular algorithms such as RMSProp as well as old neural network tricks such as fanin stepsize scaling. The second insight stresses the practical importance of dealing with fast changes of the curvature of the cost.
研究动机与目标
- 通过使用块对角曲率近似,开发一种在神经网络中具有零计算开销的二阶随机梯度算法。
- 研究尽管理论性能强劲,为何所提出的算法在实际中缺乏鲁棒性。
- 阐明自适应步长缩放在 RMSProp 和输入规模步长缩放等流行优化方法中的作用。
- 理解快速变化曲率对二阶优化的影响及其对批量归一化的影响。
- 通过曲率与归一化的视角,为深度学习优化技术提供统一的见解。
提出的方法
- 通过缩放参数 αi、μi 和 βj 对全连接层进行重参数化,以归一化激活,并将权重更新与输入统计分离。
- 以 βj²gj 和 αi²(xi−μi) 的形式推导权重更新规则,实现在每层仅 O(n+m) 的计算开销下高效计算。
- 对逆 Hessian 应用块对角近似,以基于局部曲率缩放步长,从而提升收敛速度。
- 使用激活统计的运行平均值来估计曲率,但表明当曲率快速变化时该方法可能失效。
- 提出在当前小批量上评估曲率(如批量归一化中所做),以缓解快速曲率变化引起的不稳定性。
- 在重参数化中引入反馈回路,当统计估计不佳时可能导致训练不稳定。
实验结果
研究问题
- RQ1为何一种理论上合理的二阶随机梯度算法在实践中无法稳健收敛?
- RQ2对角缩放如何阐明 RMSProp 和输入规模步长缩放在神经网络训练中的行为?
- RQ3当曲率估计过时时,为何二阶优化会出现突然发散?
- RQ4为何批量归一化相比固定曲率近似能显著提高训练稳定性?
- RQ5在当前小批量上进行自适应曲率估计能否防止二阶优化中的不稳定性?
主要发现
- 所提出的对角缩放算法在小数据集上表现良好,但在大规模 ImageNet 上因快速变化的曲率导致的不稳定性而失败。
- 不稳定性源于对激活统计的固定运行平均值可能过时,导致错误的重参数化并使 ReLU 单元失效。
- 当损失景观具有恒定损失的双曲流形时,假设曲率缓慢变化的二阶方法会失效,因为微小的数值噪声会导致巨大的权重更新。
- 该算法的发散可归因于曲率可能因权重缩放不变性而快速变化,尤其是在大步长下更为显著。
- 在当前小批量上评估曲率(如批量归一化中所做)能显著提高稳定性和性能。
- 这些洞见将 RMSProp、输入规模缩放和批量归一化统一于自适应步长缩放与曲率估计的单一框架之下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。