[论文解读] Implicit Bias in Deep Linear Classification: Initialization Scale vs Training Accuracy
本文通过在指数损失上使用梯度流分析深度线性分类中的隐性偏差,表明从核到丰富(非核)范式的转变关键取决于初始化规模和训练精度。研究发现,只有在极高的训练精度下(例如,超过 10⁻¹⁰⁰)才会出现丰富范式,而在实际训练精度和中等初始化规模下,隐性偏差更为复杂,无法被标准渐近极限所捕捉。
We provide a detailed asymptotic study of gradient flow trajectories and their implicit optimization bias when minimizing the exponential loss over "diagonal linear networks". This is the simplest model displaying a transition between "kernel" and non-kernel ("rich" or "active") regimes. We show how the transition is controlled by the relationship between the initialization scale and how accurately we minimize the training loss. Our results indicate that some limit behaviors of gradient descent only kick in at ridiculous training accuracies (well beyond $10^{-100}$). Moreover, the implicit bias at reasonable initialization scales and training accuracies is more complex and not captured by these limits.
研究动机与目标
- 理解初始化规模与训练精度如何共同影响深度线性网络在指数损失最小化过程中的隐性偏差。
- 调和核范式在大初始化规模下出现与丰富范式在分类中看似与初始化规模无关之间的表面矛盾。
- 表征深度线性分类中核范式与非核(丰富)范式之间的转变,特别是其对深度、宽度和训练精度的依赖性。
- 对对角线线性网络中的梯度流轨迹进行详细渐近分析,以映射不同超参数范式下的隐性偏差。
提出的方法
- 分析对角线线性网络在指数损失下的梯度流轨迹,通过渐近分析建模隐性偏差。
- 使用归一化梯度下降更新规则以在极低损失值下稳定训练,避免数值溢出和下溢。
- 引入一种基于最小logit值的重加权方案,以稳定梯度计算,确保即使损失低于 10⁻¹⁰⁰⁰ 时也能保持数值稳定。
- 通过K(t)与K(0)之间的切线核余弦相似度来衡量接近核范式程度,跟踪优化过程中的变化。
- 通过相对于最优预测器的额外ℓ₁-和ℓ₂-范数来量化隐性偏差,与核极限和丰富极限进行比较。
- 通过在不同深度D、初始化规模α和目标精度ϵ下进行模拟,绘制范式之间的过渡区域。
实验结果
研究问题
- RQ1深度线性分类中的隐性偏差如何依赖于初始化规模与训练精度的相互作用?
- RQ2在何种训练精度下,优化轨迹会脱离核范式并进入丰富(非核)范式?
- RQ3尽管核范式依赖于初始化规模,为何丰富范式在分类中似乎与初始化规模无关?
- RQ4深度如何影响损失和切线核动力学中从核范式到丰富范式的转变?
- RQ5在核极限与丰富极限之间的中间范式中,隐性偏差的本质是什么,它与两种极端情况有何不同?
主要发现
- 丰富范式仅在训练精度低于约 10⁻¹⁰⁰ 时才能实现,这意味着即使初始化规模较大,标准训练过程仍处于核范式。
- 随着初始化规模增大,核范式出现,但仅当训练精度被限制在有限阈值(例如,ϵ ≈ 10⁻¹⁰)时成立,而非在无限训练时间的极限下。
- 在实际训练精度下(例如,ϵ = 10⁻¹⁰),隐性偏差更为复杂,无法被ℓ₂(核)或ℓ₁(丰富)极限所捕捉。
- 增加深度会加速脱离核范式,使在更高损失值下更早进入丰富范式。
- 在核范式中,切线核几乎保持不变,但在退出核范式后发生显著变化,证实其作为范式转变诊断工具的作用。
- 通过基于最小logit值的重加权方案实现数值稳定,使在极低损失值下进行模拟时避免数值问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。