[论文解读] Implicit Regularization Towards Rank Minimization in ReLU Networks
本文研究了ReLU神经网络中的隐式正则化,表明虽然梯度流(GF)在浅层ReLU网络(例如深度为2、宽度为2)中不会引发秩最小化,但在特定条件下,其在更深、过参数化的网络中会实现这一目标。关键结果表明,使用平方损失或指数尾部损失训练的深层ReLU网络中的梯度流,通过倾向于小的谱范数与Frobenius范数比值以及最大边缘化,表现出对低秩权重矩阵的隐式偏好。
We study the conjectured relationship between the implicit regularization in neural networks, trained with gradient-based methods, and rank minimization of their weight matrices. Previously, it was proved that for linear networks (of depth 2 and vector-valued outputs), gradient flow (GF) w.r.t. the square loss acts as a rank minimization heuristic. However, understanding to what extent this generalizes to nonlinear networks is an open problem. In this paper, we focus on nonlinear ReLU networks, providing several new positive and negative results. On the negative side, we prove (and demonstrate empirically) that, unlike the linear case, GF on ReLU networks may no longer tend to minimize ranks, in a rather strong sense (even approximately, for "most" datasets of size 2). On the positive side, we reveal that ReLU networks of sufficient depth are provably biased towards low-rank solutions in several reasonable settings.
研究动机与目标
- 研究ReLU网络中的梯度流(GF)是否像在线性网络中那样,诱导出对低秩权重矩阵的隐式正则化。
- 确定在何种条件下,非线性ReLU网络中的梯度流表现出对低秩解的偏向,特别是在过参数化设置下。
- 对比浅层ReLU网络(其中秩最小化不成立)与深层网络(其中秩最小化成立)中梯度流的行为差异。
- 形式化二分类中边缘最大化与深层ReLU网络中秩最小化之间的联系。
- 为不同网络架构和训练目标下的秩最小化偏向的存在或缺失,提供理论与实证证据。
提出的方法
- 分析深度为2、宽度为2的ReLU网络在平方损失下的梯度流动力学,证明当输入夹角位于(π/2, π)且输出线性无关时,GF不会收敛到低秩解。
- 提出一种具有平衡权重矩阵的等效深层ReLU网络构造方法,以分析梯度流下的范数与秩行为。
- 证明在使用平方损失训练的深层ReLU网络中,GF收敛到的解中,权重矩阵的谱范数与Frobenius范数的平均比值接近1,意味着稳定秩最小化。
- 证明在使用指数尾部损失训练的深层ReLU网络中,边缘最大化意味着秩最小化,因为当权重矩阵为低秩时边缘达到最大。
- 利用AM-GM不等式与范数平衡论证,推导谱范数与Frobenius范数比值的下界,将范数最小化与秩最小化联系起来。
- 通过实证验证理论发现,包括浅层网络中秩最小化失败与深层网络中成功的情况。
实验结果
研究问题
- RQ1在使用平方损失训练的深度为2、宽度为2的ReLU网络中,梯度流是否诱导出对低秩权重矩阵的隐式正则化?
- RQ2在深层ReLU网络中,梯度流在何种条件下会偏向低秩解,特别是在过参数化设置下?
- RQ3是否存在二分类中边缘最大化与深层ReLU网络中秩最小化之间的正式联系?
- RQ4梯度流在ReLU网络中的隐式偏好是否可由稳定秩最小化来表征?在何种假设下成立?
- RQ5ReLU网络的深度与宽度如何影响梯度流产生低秩权重矩阵的倾向?
主要发现
- 对于使用平方损失训练的深度为2、宽度为2的ReLU网络,当输入夹角位于(π/2, π)且输出线性无关时,即使近似成立,梯度流也不会收敛到低秩解。
- 实证结果表明,在此类浅层网络中,GF以至少常数概率无法产生低秩解,这一结论适用于合理的近似秩度量。
- 在使用平方损失训练的深层ReLU网络中,GF收敛到的解中,权重矩阵的谱范数与Frobenius范数的平均比值接近1,表明存在稳定秩最小化。
- 在使用指数尾部损失训练的深层ReLU网络中,边缘最大化意味着秩最小化,因为当权重矩阵为低秩时边缘达到最大。
- 理论分析表明,深层网络中的范数最小化可导致低稳定秩,且该行为在平衡权重矩阵构造下得以保持。
- 本文确立了深层过参数化ReLU网络表现出对低秩解的隐式偏好,即使浅层网络不具备这一特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。