[论文解读] Infinite-width limit of deep linear neural networks
该论文在最大更新参数化(μP)下建立了深度线性神经网络的无限宽极限,证明了梯度下降动力学在无限维空间中收敛到确定性的连续时间轨迹。它展示了线性预测器以指数速率收敛到最小ℓ²-范数解,并通过显式矩阵关系和宽度极限下的正交基表征了极限动力学。
This paper studies the infinite-width limit of deep linear neural networks initialized with random parameters. We obtain that, when the number of neurons diverges, the training dynamics converge (in a precise sense) to the dynamics obtained from a gradient descent on an infinitely wide deterministic linear neural network. Moreover, even if the weights remain random, we get their precise law along the training dynamics, and prove a quantitative convergence result of the linear predictor in terms of the number of neurons. We finally study the continuous-time limit obtained for infinitely wide linear neural networks and show that the linear predictors of the neural network converge at an exponential rate to the minimal $\ell_2$-norm minimizer of the risk.
研究动机与目标
- 为深度神经网络无限宽极限中的开放问题提供解答,特别是关于适定性、连续时间极限以及收敛到极小化器的问题。
- 研究在最大更新参数化(μP)下,深度线性神经网络在无限宽极限下的训练动力学,该参数化方式保留了特征学习能力。
- 对线性预测器和权重分布的极限行为提供严格且量化的表征。
- 在无限宽极限下建立一个可处理的、显式的结构,从而能够分析收敛性和极小化器的选择。
提出的方法
- 使用随机矩阵理论中的矩方法,分析无限宽极限下随机矩阵和向量的演化。
- 通过层索引序列构造正交基,以分解网络的权重矩阵和激活空间。
- 推导出权重矩阵作用于基向量的显式递推关系,从而得到无限维矩阵表示Λ₁和Λ₂。
- 通过适当缩放时间和宽度,建立训练动力学的连续时间极限,得到极限下的常微分方程组。
- 应用矩方法,证明线性预测器收敛到最小ℓ²-范数解的定量收敛速率。
- 通过基和矩阵结构的推广,将三层次网络的结果扩展到更深的网络。
实验结果
研究问题
- RQ1深度线性网络在梯度下降下的无限宽极限是否对应于无限维空间中适定的连续时间轨迹?
- RQ2无限宽极限是否收敛到风险的极小化器?如果是,是哪一个——特别是在存在多个极小化器的情况下?
- RQ3极限动力学能否由确定性系统描述?在极限下权重的分布律是否可以被表征?
- RQ4在无限宽极限下,线性预测器收敛到最小ℓ²-范数解的速率是多少?
- RQ5层间矩阵关系在极限下如何演化?能否通过显式的无限维算子来表达?
主要发现
- 在μP下,深度线性网络的梯度下降在无限宽极限下收敛到无限维空间中的确定性连续时间梯度流。
- 线性预测器在无限宽极限下以指数速率收敛到风险的最小ℓ²-范数解。
- 极限动力学由显式的无限维矩阵算子Λ₁和Λ₂控制,这些算子编码了在宽度极限下层之间的相互作用。
- 矩方法得出了对非高斯初始化也普遍适用的定量收敛速率,而不仅限于高斯初始化。
- 极限下的权重矩阵由一个精确的演化律表征,该律沿训练轨迹确定性地演化。
- 该分析从三层次网络推广到更深的架构,极限下保持相同的结构特性和收敛性质。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。