[论文解读] On the Global Convergence of Training Deep Linear ResNets
该论文建立了在固定输入和输出线性变换下训练深层线性残差网络(ResNets)的梯度下降(GD)和随机梯度下降(SGD)的全局收敛性。证明了在隐藏权重零初始化下,只要输入/输出变换满足论文推导出的通用条件,两种算法均能收敛至全局最小值;进一步表明,当网络宽度满足 $ m = \Omega(kr\kappa^2) $ 时,高斯随机变换可保证收敛,相比先前工作将宽度要求提高了 $ O(\kappa L) $ 倍。
We study the convergence of gradient descent (GD) and stochastic gradient descent (SGD) for training $L$-hidden-layer linear residual networks (ResNets). We prove that for training deep residual networks with certain linear transformations at input and output layers, which are fixed throughout training, both GD and SGD with zero initialization on all hidden weights can converge to the global minimum of the training loss. Moreover, when specializing to appropriate Gaussian random linear transformations, GD and SGD provably optimize wide enough deep linear ResNets. Compared with the global convergence result of GD for training standard deep linear networks (Du & Hu 2019), our condition on the neural network width is sharper by a factor of $O(κL)$, where $κ$ denotes the condition number of the covariance matrix of the training data. We further propose a modified identity input and output transformations, and show that a $(d+k)$-wide neural network is sufficient to guarantee the global convergence of GD/SGD, where $d,k$ are the input and output dimensions respectively.
研究动机与目标
- 解决训练深层线性ResNets时SGD缺乏理论收敛保证的问题。
- 在输入和输出变换的温和条件下,建立深层线性ResNets的GD和SGD的全局收敛性。
- 与先前关于标准深层线性网络的工作相比,提供更严格的宽度要求以实现全局收敛。
- 分析在存在随机梯度(引入不确定性)时GD和SGD的优化轨迹。
- 提出一种改进的恒等输入/输出变换,使得仅需 $ (d+k) $ 宽度的网络即可实现全局收敛。
提出的方法
- 为具有固定线性输入和输出变换的 $ L $-隐藏层深层线性ResNets制定训练目标。
- 使用梯度流分析,推导出优化轨迹上受限制的梯度界和光滑性性质。
- 通过控制权重矩阵的谱范数,证明这些性质在GD和SGD下依然成立,即使在随机梯度下亦然。
- 应用矩阵扰动理论和Frobenius范数界,分析邻近权重矩阵之间损失的差异。
- 利用Jensen不等式和矩阵范数不等式,对损失函数的二阶项在泰勒展开中进行有界。
- 引入一种改进的恒等输入/输出变换,将实现全局收敛所需的网络宽度减少至 $ d+k $。
实验结果
研究问题
- RQ1在何种输入和输出变换条件下,GD能对深层线性ResNets实现全局收敛?
- RQ2SGD能否保证对深层线性ResNets实现全局收敛?在何种条件下?
- RQ3与先前关于标准深层线性网络的工作相比,本研究中实现全局收敛所需的网络宽度有何不同?
- RQ4高斯随机线性变换是否能确保足够宽的深层线性ResNets中GD和SGD的全局收敛?
- RQ5是否存在一种变换方案,使得仅需 $ d+k $ 宽度的网络即可实现全局收敛,且与深度无关?
主要发现
- 当输入和输出变换满足本文推导出的通用条件时,GD和SGD在所有隐藏权重零初始化下,能全局收敛至全局最小值。
- 当使用适当的高斯随机线性变换时,若网络宽度满足 $ m = \Omega(kr\kappa^2) $,则GD以高概率在 $ O(\kappa \log(1/\epsilon)) $ 次迭代内收敛至全局最小值,误差不超过 $ \epsilon $。
- 与先前关于标准深层线性网络的工作相比,所需网络宽度提高了 $ O(\kappa L) $ 倍,使条件显著更严格。
- 当使用改进的恒等输入和输出变换时,$ (d+k) $ 宽度的网络可保证全局收敛,其中 $ d $ 和 $ k $ 分别为输入和输出维度。
- 分析证明了受限梯度界和光滑性性质在整个GD和SGD的优化轨迹上均成立,即使在存在随机性的情况下也能实现全局收敛。
- 数值实验和理论界均表明,当满足宽度条件时,收敛速率与深度无关,凸显了宽度在稳定训练中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。