[论文解读] Implicit regularization for deep neural networks driven by an Ornstein-Uhlenbeck like process
本文在独立标签噪声下,研究了随机梯度下降(SGD)训练深层神经网络时出现的一种新颖隐式正则化效应,表明此类训练会隐式最小化数据点上模型梯度的ℓ₂范数平方和。关键结果是:零训练误差解仅被吸引至该隐式正则化器的局部极小值,从而无论初始化如何,均促进‘简单’模型的形成。
We consider networks, trained via stochastic gradient descent to minimize $\ell_2$ loss, with the training labels perturbed by independent noise at each iteration. We characterize the behavior of the training dynamics near any parameter vector that achieves zero training error, in terms of an implicit regularization term corresponding to the sum over the data points, of the squared $\ell_2$ norm of the gradient of the model with respect to the parameter vector, evaluated at each data point. This holds for networks of any connectivity, width, depth, and choice of activation function. We interpret this implicit regularization term for three simple settings: matrix sensing, two layer ReLU networks trained on one-dimensional data, and two layer networks with sigmoid activations trained on a single datapoint. For these settings, we show why this new and general implicit regularization effect drives the networks towards "simple" models.
研究动机与目标
- 解释为何深层神经网络在过参数化和高容量条件下仍能良好泛化。
- 识别随机梯度下降在标签噪声下引入的隐式归纳偏置。
- 形式化描述标签噪声如何使模型趋于‘简单’,且与初始化无关。
- 将SGD在标签噪声下的不动点表征为一种新型隐式正则化器的局部极小值。
提出的方法
- 分析在每个训练步骤中添加独立、零均值、有界的标签噪声时,SGD的动力学行为。
- 将隐式正则化器的形式化表征为训练数据点上模型梯度关于参数的ℓ₂范数平方的平均值。
- 证明仅当参数向量是该正则化器的局部极小值时,零训练误差解才会成为吸引的不动点。
- 将该框架应用于三种场景:矩阵感知、一维数据上的两层ReLU网络,以及单一样本上的两层Sigmoid网络。
- 通过分析与实验方法表明,该正则化器倾向于降低梯度幅值,对应于模型的简单性。
- 证明该正则化器施加了结构约束(如权重共享或神经元置零),从而生成更简单、更具泛化能力的模型。
实验结果
研究问题
- RQ1SGD中的标签噪声如何在深层网络中诱导隐式正则化?
- RQ2SGD结合标签噪声时所涌现的隐式正则化器的数学形式是什么?
- RQ3为何SGD结合标签噪声会收敛到‘简单’模型,而标准SGD不会?
- RQ4这种隐式正则化如何解释过参数化网络中的泛化现象?
- RQ5该隐式正则化器在零训练误差下以何种方式约束模型架构与参数分布?
主要发现
- 隐式正则化器的形式为 $\frac{1}{n}\sum_{i=1}^{n}\|\nabla_{\theta}h(x_{i},\theta)\|_{2}^{2}$,且仅当该表达式在局部极小值时,零训练误差解才会被吸引。
- 在矩阵感知任务中,标签噪声可使模型从任意初始化收敛至最低秩解,复现了先前研究中观察到的隐式秩正则化现象。
- 在一维数据上的两层ReLU网络中,该正则化器倾向于选择激活神经元更少且权重模式对称的模型,从而促进简单性。
- 在单一样本上的两层Sigmoid网络中,该正则化器强制所有非零单元具有相同的激活幅值和相同符号,从而降低模型复杂度。
- 分析表明,‘非排斥’不动点要求所有非零单元共享相同的 $h_i$ 和 $c_i$ 值(符号除外),从而强制实现结构上的简单性。
- 该正则化器的导数在非零区域为单射,意味着在稳定不动点处仅可能存在对称或置零的单元,进一步强化了简单性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。