[论文解读] Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data
本文研究了在高维、近乎正交数据上训练的两层漏失 ReLU 网络中,梯度流与梯度下降的隐式偏差。结果表明,梯度流渐近地产生一个秩至多为二的网络,其近似于一个 $β$-最大间隔解;而使用小初始化的梯度下降能迅速将权重矩阵的稳定秩降低至一个与 $m$、$d$ 或 $n$ 无关的绝对常数,并在整个训练过程中保持低秩结构。
The implicit biases of gradient-based optimization algorithms are conjectured to be a major factor in the success of modern deep learning. In this work, we investigate the implicit bias of gradient flow and gradient descent in two-layer fully-connected neural networks with leaky ReLU activations when the training data are nearly-orthogonal, a common property of high-dimensional data. For gradient flow, we leverage recent work on the implicit bias for homogeneous neural networks to show that asymptotically, gradient flow produces a neural network with rank at most two. Moreover, this network is an $\ell_2$-max-margin solution (in parameter space), and has a linear decision boundary that corresponds to an approximate-max-margin linear predictor. For gradient descent, provided the random initialization variance is small enough, we show that a single step of gradient descent suffices to drastically reduce the rank of the network, and that the rank remains small throughout training. We provide experiments which suggest that a small initialization scale is important for finding low-rank neural networks with gradient descent.
研究动机与目标
- 理解在训练数据为高维且近乎正交时,基于梯度的优化在两层漏失 ReLU 网络中的隐式偏差。
- 分析在该数据条件下,梯度流与梯度下降如何收敛至低秩解。
- 研究初始化尺度如何在有限时间训练中决定训练网络的稳定秩。
- 通过在合成高维数据和 CIFAR-10 上的实验验证理论结果,突出初始化方差的影响。
提出的方法
- 利用最近关于齐次神经网络的研究成果,证明漏失 ReLU 网络上的梯度流在方向上收敛至 $β$-最大间隔问题的 KKT 点。
- 将第一层权重矩阵 $W^{(t)}$ 的稳定秩作为网络复杂度的代理指标,定义为 $\|W^{(t)}\|_F^2 / \|W^{(t)}\|_2^2$。
- 证明在小初始化方差下一梯度下降步骤后,稳定秩从 $O(\min(m,d))$ 降低至一个与 $m$、$d$ 或 $n$ 无关的绝对常数。
- 考虑漏失 ReLU 激活函数的平滑近似,以实现对梯度下降的有限时间分析。
- 通过在合成二元聚类数据和 CIFAR-10 上使用 SGD 的实验,验证结果,比较标准初始化与小初始化的尺度。
- 使用稳定秩作为模型复杂度的度量,并追踪其在训练过程中的演化,以评估隐式偏差。
实验结果
研究问题
- RQ1在高维、近乎正交数据上训练的两层漏失 ReLU 网络中,梯度流是否收敛至低秩解?
- RQ2使用小初始化方差的梯度下降是否能迅速降低并维持权重矩阵中的低稳定秩?
- RQ3权重初始化的尺度如何影响训练网络的稳定秩与泛化行为?
- RQ4在有限时间内,梯度下降的隐式偏差在多大程度上类似于梯度流中观察到的渐近行为?
- RQ5当数据为高维且近乎正交时,稳定秩在梯度下降下是否保持有界?
主要发现
- 对于梯度流,渐近解的秩至多为二,且对应于决策边界中近似 $β$-最大间隔线性预测器。
- 在小初始化方差下一梯度下降步骤后,权重矩阵的稳定秩从 $O(\min(m,d))$ 降低至一个与 $m$、$d$ 或 $n$ 无关的绝对常数。
- 在整个训练过程中,若使用小方差初始化,网络的稳定秩始终保持在某个绝对常数以内。
- 在高维合成数据上的实验确认,小初始化可迅速降低稳定秩,而较大初始化则保持高秩。
- 在 CIFAR-10 上,使用标准 TensorFlow 初始化时,稳定秩保持在 74 以上,但当方差减小为 1/50 时,其降至 3.25,且仅在过拟合时上升至 10 以上。
- 更小的学习率使稳定秩下降得更快,且使用小学习率进行更长训练可进一步降低秩,表明步长与初始化尺度之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。