Skip to main content
QUICK REVIEW

[论文解读] Implicit Regularization in Over-parameterized Neural Networks

Masayoshi Kubo, Ryotaro Banno|arXiv (Cornell University)|Mar 5, 2019
Stochastic Gradient Optimization Techniques参考文献 5被引用 8
一句话总结

本文引入梯度间隙偏差和梯度偏转作为统计度量,用于分析过参数化ReLU神经网络中的隐式正则化。结果表明,随机梯度下降(SGD)和随机权重初始化将网络梯度限制为平滑变化,导致网络输出在输入样本之间近乎线性插值——从而在无需显式正则化的情况下实现低复杂度与泛化能力。

ABSTRACT

Over-parameterized neural networks generalize well in practice without any explicit regularization. Although it has not been proven yet, empirical evidence suggests that implicit regularization plays a crucial role in deep learning and prevents the network from overfitting. In this work, we introduce the gradient gap deviation and the gradient deflection as statistical measures corresponding to the network curvature and the Hessian matrix to analyze variations of network derivatives with respect to input parameters, and investigate how implicit regularization works in ReLU neural networks from both theoretical and empirical perspectives. Our result reveals that the network output between each pair of input samples is properly controlled by random initialization and stochastic gradient descent to keep interpolating between samples almost straight, which results in low complexity of over-parameterized neural networks.

研究动机与目标

  • 理解为何过参数化神经网络在无显式正则化的情况下仍能良好泛化。
  • 研究随机梯度下降(SGD)和随机权重初始化在控制网络复杂度中的作用。
  • 开发能够捕捉神经网络梯度在输入样本之间几何行为的统计度量。
  • 通过输入路径上梯度变化的平滑性,解释过参数化网络中低泛化误差的成因。
  • 提供理论与实证证据,表明隐式正则化源于SGD和初始化对梯度波动的约束。

提出的方法

  • 将梯度间隙偏差和梯度偏转定义为Hessian曲率及沿线性输入路径上网络变化的代理指标。
  • 将网络输出的梯度建模为输入对之间线性插值路径上的随机桥过程。
  • 利用该模型对ReLU网络梯度在输入数据上的全局变化进行统计估计。
  • 将该框架应用于标准架构(MLP、VGG、ResNet)和数据集(MNIST、CIFAR10、CIFAR100)以进行实证验证。
  • 利用随机桥模型量化SGD和初始化如何限制梯度波动并强制实现类似线性的插值行为。
  • 通过聚焦于断点(不可微区域)来分析ReLU网络的非光滑行为,其中梯度变化被编码其中。

实验结果

研究问题

  • RQ1SGD和随机初始化如何隐式正则化过参数化ReLU网络?
  • RQ2网络梯度在输入样本之间变化的平滑程度如何?哪些统计度量能捕捉这种变化?
  • RQ3过参数化网络的线性插值行为能否通过输入路径上的梯度动力学来解释?
  • RQ4ReLU网络中的断点在编码全局几何复杂性方面起什么作用?
  • RQ5梯度间隙偏差和梯度偏转与过参数化模型中的泛化能力有何关联?

主要发现

  • 在多种标准架构(MLP、VGG、ResNet)和数据集(MNIST、CIFAR10、CIFAR100)中,梯度间隙偏差和梯度偏转均较小,表明沿输入路径的梯度变化极小。
  • 尽管ReLU激活导致非光滑性,但由于SGD和初始化对梯度波动的控制,网络输出在输入样本之间仍近乎线性插值。
  • 网络梯度沿线性输入路径表现出类似随机桥的行为,表明隐式正则化源于梯度受约束的随机运动。
  • 结果对优化变体具有鲁棒性,适用于普通SGD和带动量的SGD,表明这是训练过程中的基本特性。
  • 研究表明,过参数化网络中的隐式正则化源于对梯度间隙大小和活跃神经元数量的限制,从而防止复杂度过高。
  • 该框架提供了一种可推广的方法,仅通过前向传播映射即可评估深度网络的几何复杂性,适用于广泛架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。