Skip to main content
QUICK REVIEW

[论文解读] Optimization Theory for ReLU Neural Networks Trained with Normalization Layers

Yonatan Dukler, Quanquan Gu|arXiv (Cornell University)|Jun 11, 2020
Stochastic Gradient Optimization Techniques参考文献 17被引用 13
一句话总结

本文首次为使用梯度下降训练的两层ReLU神经网络在权重归一化(WN)设置下提供了全局收敛性保证,表明WN通过神经正切核(NTK)的长度-方向分解改变了优化景观,从而实现了比未归一化训练更快的收敛速度。该分析建立了线性收敛速率和更紧的过参数化边界,表明与标准训练相比,WN可减少达到收敛所需的宽度。

ABSTRACT

The success of deep neural networks is in part due to the use of normalization layers. Normalization layers like Batch Normalization, Layer Normalization and Weight Normalization are ubiquitous in practice, as they improve generalization performance and speed up training significantly. Nonetheless, the vast majority of current deep learning theory and non-convex optimization literature focuses on the un-normalized setting, where the functions under consideration do not exhibit the properties of commonly normalized neural networks. In this paper, we bridge this gap by giving the first global convergence result for two-layer neural networks with ReLU activations trained with a normalization layer, namely Weight Normalization. Our analysis shows how the introduction of normalization layers changes the optimization landscape and can enable faster convergence as compared with un-normalized neural networks.

研究动机与目标

  • 弥合归一化层在实践中取得的成功与非凸优化中缺乏收敛性保证之间的理论差距。
  • 分析权重归一化相较于未归一化设置如何改变ReLU网络的优化景观。
  • 为使用WN和梯度下降训练的两层ReLU网络建立可证明的全局收敛性。
  • 推导出比先前工作更紧的过参数化边界和改进的收敛速率。
  • 通过在归一化条件下对神经正切核(NTK)的精细化分析,解释WN的实用性。

提出的方法

  • 分析采用参数化形式(V, g, c)的两层ReLU网络,其中权重通过尺度g和方向v/||v||进行重参数化。
  • 在权重归一化下引入NTK的长度-方向分解,揭示了两种不同的收敛模式。
  • 在过参数化设置(m > n)下使用随机初始化和L2损失进行回归任务。
  • 应用神经正切核理论工具,并对先前工作(如[15], [3])的边界进行精细化分析,以研究梯度下降的动力学。
  • 使用概率浓度不等式和几何级数估计来控制参数轨迹和梯度更新。
  • 通过边界化修改后的NTK和梯度下降步长,推导出收敛速率。

实验结果

研究问题

  • RQ1与未归一化训练相比,权重归一化如何改变ReLU网络的优化景观?
  • RQ2能否为使用权重归一化训练的ReLU网络在梯度下降下证明全局收敛性?
  • RQ3归一化对收敛速率和所需过参数化有何影响?
  • RQ4在权重归一化下,神经正切核如何演化,发生了哪些结构变化?
  • RQ5与未归一化情况相比,能否为归一化ReLU网络推导出更紧的过参数化边界?

主要发现

  • 本文首次为使用梯度下降训练的权重归一化两层ReLU网络建立了全局收敛结果。
  • 收敛以线性速率发生,收敛因子相比未归一化训练提高了(1 - ηαωα)的倍数。
  • 通过长度-方向分解改变NTK动态,权重归一化使收敛速度优于未归一化训练。
  • 与未归一化设置相比,所需过参数化程度显著降低,且通过精细化分析得出了更紧的边界。
  • 理论分析证实,WN降低了有效核的条件数,从而在实践中加速了训练。
  • 收敛速度和稳定性的实证改进可通过修改后的NTK结构和对权重尺度的降低敏感性来解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。