[论文解读] The Low-Rank Simplicity Bias in Deep Networks
本文提出深度神经网络表现出一种低秩简化偏差,由于此类函数在更深架构中的体积更大,网络倾向于选择有效秩较低的嵌入表示。实证结果表明,更深的网络泛化性能更好,即使在噪声或高秩任务下,也因隐式偏向低秩表征而提升在CIFAR和ImageNet上的性能,且模型容量保持不变。
Modern deep neural networks are highly over-parameterized compared to the data on which they are trained, yet they often generalize remarkably well. A flurry of recent work has asked: why do deep networks not overfit to their training data? In this work, we make a series of empirical observations that investigate and extend the hypothesis that deeper networks are inductively biased to find solutions with lower effective rank embeddings. We conjecture that this bias exists because the volume of functions that maps to low effective rank embedding increases with depth. We show empirically that our claim holds true on finite width linear and non-linear models on practical learning paradigms and show that on natural data, these are often the solutions that generalize well. We then show that the simplicity bias exists at both initialization and after training and is resilient to hyper-parameters and learning methods. We further demonstrate how linear over-parameterization of deep non-linear models can be used to induce low-rank bias, improving generalization performance on CIFAR and ImageNet without changing the modeling capacity.
研究动机与目标
- 探究尽管参数量庞大,为何过参数化的深度网络仍能良好泛化,以挑战经典过拟合的预期。
- 检验深度是否在线性与非线性模型中均诱导出对低秩解的偏好。
- 测试该低秩简化偏差是否在不同初始化、训练过程、超参数和学习方法下保持稳定。
- 探索如何通过线性过参数化来诱导低秩偏差,从而在不改变模型容量的前提下提升泛化性能。
- 评估在噪声监督和标签污染条件下,该简化偏差的鲁棒性。
提出的方法
- 在不同秩(1至64)和深度(1至20层)的线性回归任务上,通过实证评估训练和测试损失,测量收敛至零损失的情况。
- 使用奇异值分解(SVD)计算倒数第二层嵌入的有效秩,以量化学习表征的秩。
- 在非线性模型中引入线性过参数化以诱导低秩偏差,并在CIFAR-10和ImageNet上评估性能。
- 通过静态和随机噪声注入的噪声最小二乘实验,测试在标签污染条件下低秩偏差的鲁棒性。
- 通过随机网络采样分析深度线性模型中权重矩阵秩与核(Gram矩阵)秩之间的关系。
- 应用带有学习率调度的SGD训练不同噪声水平和深度的模型,比较测试性能与有效秩。
实验结果
研究问题
- RQ1在深度网络中增加深度是否会导致对低有效秩解的偏好,即使在拟合高秩线性函数时?
- RQ2该低秩简化偏差是否存在于网络初始化阶段,并在不同优化器和超参数下经训练后仍被保留?
- RQ3能否通过在非线性模型中引入线性过参数化来诱导低秩偏差,并在不改变容量的前提下提升泛化性能?
- RQ4在标签噪声设置下,低秩偏差如何影响泛化性能,特别是在静态噪声与随机噪声下有何差异?
- RQ5在深度线性模型中,权重矩阵的有效秩与核(Gram)矩阵的有效秩之间存在何种关系?
主要发现
- 更深的网络无法拟合高秩线性函数(秩为64),且随着深度增加,训练损失持续上升,而浅层网络可实现零损失。
- 更深网络中特征嵌入的有效秩始终低于浅层网络,表明存在系统性的低秩偏差。
- 该低秩简化偏差在初始化阶段即存在,并在训练后仍保持不变,且对不同优化器、学习率和超参数具有鲁棒性。
- 在噪声最小二乘实验中,更深的网络泛化性能优于浅层网络:它们对噪声的拟合能力更弱,且测试误差更低,尤其在随机噪声下表现更优。
- 即使在噪声观测下,更深网络仍收敛至有效秩更低的解,表明深度可作为对抗标签噪声的正则化手段。
- 在深度线性模型中,权重矩阵的有效秩与Gram矩阵的有效秩之间存在强线性关系,支持了权重秩与核秩之间理论关联的成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。