[论文解读] The Implicit Bias of Depth: How Incremental Learning Drives Generalization
本文形式化了深度线性模型中的增量学习动态,表明深度通过按大小顺序渐进学习奇异值或权重,诱导出一种朝向更简单、稀疏解的隐式偏差。核心贡献是一项动力学深度分离结果:浅层模型需要指数级小的初始化才能实现增量学习,而深层模型仅需多项式级小的初始化即可实现,使该现象在实际训练设置中成为可能。
A leading hypothesis for the surprising generalization of neural networks is that the dynamics of gradient descent bias the model towards simple solutions, by searching through the solution space in an incremental order of complexity. We formally define the notion of incremental learning dynamics and derive the conditions on depth and initialization for which this phenomenon arises in deep linear models. Our main theoretical contribution is a dynamical depth separation result, proving that while shallow models can exhibit incremental learning dynamics, they require the initialization to be exponentially small for these dynamics to present themselves. However, once the model becomes deeper, the dependence becomes polynomial and incremental learning can arise in more natural settings. We complement our theoretical findings by experimenting with deep matrix sensing, quadratic neural networks and with binary classification using diagonal and convolutional linear networks, showing all of these models exhibit incremental learning.
研究动机与目标
- 形式化深度学习中增量学习动态的概念,即模型按复杂度顺序依次学习特征或奇异值。
- 研究模型深度与初始化尺度如何影响线性模型中增量学习的出现。
- 建立理论基础,解释为何深层模型尽管容量相似,仍比浅层模型泛化能力更强。
- 通过实证方法在多种架构中验证增量学习,包括矩阵感知、二次网络和卷积网络。
提出的方法
- 将增量学习动态定义为在优化过程中奇异值或特征权重按大小递减顺序依次收敛。
- 通过简化深度线性模型分析梯度流动态,推导出增量学习出现的条件。
- 证明一项动力学深度分离结果:浅层模型需要指数级小的初始化才能实现增量学习,而深层模型仅需多项式级小的初始化。
- 通过矩阵感知、二次神经网络以及具有对角或卷积参数化的线性网络,将理论发现扩展至更深的模型。
- 使用小数据集上的梯度下降进行实证训练,展示在各类架构中均存在增量学习,追踪奇异值或傅里叶系数的演化过程。
- 通过傅里叶变换建立卷积网络与对角网络之间的联系,将动态与朝稀疏解的隐式偏差关联起来。
实验结果
研究问题
- RQ1在深度线性模型中,增量学习在何种条件下会出现?
- RQ2模型深度如何影响实现增量学习所需的初始化尺度?
- RQ3增量学习动态是否可在实际模型(如矩阵感知和卷积网络)中观察到?
- RQ4优化动态与朝稀疏、泛化性解的隐式偏差之间存在何种关系?
- RQ5与浅层模型相比,深度的隐式偏差在泛化能力方面有何差异?
主要发现
- 浅层模型(深度为2)需要指数级小的初始化才能使增量学习动态出现,这使得该现象在实际设置中极不可能发生。
- 深层模型仅需多项式级小的初始化即可表现出增量学习,使其在更自然的训练范式中成为可能。
- 在矩阵感知、二次网络以及对角/卷积线性网络上的实证结果均清晰显示了增量学习,其中较大的奇异值或特征权重被优先学习。
- 在二分类任务中,当以小权重初始化时,深层模型与稀疏真实解的相关性更强,而浅层模型则收敛至最大间隔解。
- 卷积网络在频域中表现出增量学习,即大振幅的傅里叶系数在小振幅系数之前被学习,这与对角网络中的动态一致。
- 理论与实证结果共同证实,深度的隐式偏差源于梯度下降的动力学,通过按大小顺序逐个学习组件,从而偏好更简单的解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。