Skip to main content
QUICK REVIEW

[论文解读] How Implicit Regularization of ReLU Neural Networks Characterizes the Learned Function -- Part I: the 1-D Case of Two Layers with Random First Layer

Jakob Heiss, Josef Teichmann|arXiv (Cornell University)|Nov 7, 2019
Stochastic Gradient Optimization Techniques参考文献 33被引用 5
一句话总结

该论文表明,通过随机初始化第一层权重并训练第二层权重的两层ReLU神经网络,会隐式地对学习到的函数进行正则化,在ℓ²正则化下收敛到光滑样条插值。对于最小二乘回归,此类网络的早停梯度下降对应于平滑样条回归,揭示了训练中的隐式偏差与函数空间中经典正则化之间的深层联系。

ABSTRACT

In this paper, we consider one dimensional (shallow) ReLU neural networks in which weights are chosen randomly and only the terminal layer is trained. First, we mathematically show that for such networks L2-regularized regression corresponds in function space to regularizing the estimate's second derivative for fairly general loss functionals. For least squares regression, we show that the trained network converges to the smooth spline interpolation of the training data as the number of hidden nodes tends to infinity. Moreover, we derive a novel correspondence between the early stopped gradient descent (without any explicit regularization of the weights) and the smoothing spline regression.

研究动机与目标

  • 理解训练浅层ReLU网络(第一层权重随机)所诱导的隐式正则化。
  • 表征此类网络中ℓ²-正则化回归所学习到的函数。
  • 在无限宽度极限下,建立早停梯度下降与平滑样条回归之间的对应关系。
  • 阐明第一层权重在塑造模型归纳偏差中的作用。
  • 为宽且随机化的ReLU网络的泛化与优化行为提供严格的理论基础。

提出的方法

  • 分析具有随机第一层权重和可训练第二层权重的两层ReLU网络。
  • 通过平均场型分析,利用隐藏单元数趋于无穷的极限推导宏观行为。
  • 应用泛函分析与弱导数,表征所学函数的二阶导数。
  • 建立第二层权重正则化与L²空间中函数二阶导数之间的对应关系。
  • 通过一种新颖的正则化泛函,推导出早停梯度下降与平滑样条回归之间的等价性。
  • 采用带与不带跳跃连接的自适应回归样条,对所学函数进行建模,并比较正则化效果。

实验结果

研究问题

  • RQ1ℓ²-正则化训练具有随机第一层权重的两层ReLU网络时,如何在函数空间中对所学函数进行正则化?
  • RQ2当隐藏单元数趋于无穷时,此类网络收敛到的极限函数类是什么?
  • RQ3此类网络上的早停梯度下降如何与经典平滑样条回归相关联?
  • RQ4第一层权重的分布如何影响模型的隐式偏差?
  • RQ5所学函数能否被表征为具有由第一层权重分布导出的特定正则化项的样条函数?

主要发现

  • 对于ℓ²-正则化回归,随着隐藏单元数趋于无穷,训练后的网络收敛到训练数据的平滑样条插值。
  • 此类网络上的早停梯度下降恰好对应于平滑样条回归,建立了优化动力学与经典正则化之间的直接联系。
  • 所学函数的二阶导数以依赖于第一层权重分布的方式受到正则化,尤其通过权重分布尾部的积分体现。
  • 当第一层权重分布具有重尾(例如在大区间上均匀分布)时,对线性项和绝对值项系数的正则化变得可忽略,导致带与不带跳跃连接的模型行为几乎完全相同。
  • 优化问题的解等价于最小化一个泛函,该泛函结合了训练损失和加权L²范数的二阶导数,权重由第一层权重密度导出。
  • 当第一层权重分布的尾部越来越重时,自适应回归样条在W¹,∞范数下一致收敛到经典平滑样条,无论是否存在跳跃连接。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。