[论文解读] Robustness in deep learning: The good (width), the bad (depth), and the ugly (initialization)
本文通过扰动稳定性度量,研究了宽度、深度和初始化对深度神经网络平均鲁棒性的影响。结果表明,在过参数化设置下,宽度能提升鲁棒性,但在参数化不足时反而会损害鲁棒性;而深度的影响则高度依赖于初始化方式——在LeCun初始化下,懒惰训练中深度有助于提升鲁棒性,但在He或NTK初始化下则会降低鲁棒性。
We study the average robustness notion in deep neural networks in (selected) wide and narrow, deep and shallow, as well as lazy and non-lazy training settings. We prove that in the under-parameterized setting, width has a negative effect while it improves robustness in the over-parameterized setting. The effect of depth closely depends on the initialization and the training mode. In particular, when initialized with LeCun initialization, depth helps robustness with the lazy training regime. In contrast, when initialized with Neural Tangent Kernel (NTK) and He-initialization, depth hurts the robustness. Moreover, under the non-lazy training regime, we demonstrate how the width of a two-layer ReLU network benefits robustness. Our theoretical developments improve the results by [Huang et al. NeurIPS21; Wu et al. NeurIPS21] and are consistent with [Bubeck and Sellke NeurIPS21; Bubeck et al. COLT21].
研究动机与目标
- 解决关于过参数化是否提升或损害对抗鲁棒性的理论矛盾。
- 分析宽度、深度和初始化在决定深度神经网络平均鲁棒性中的作用。
- 在不同训练范式(懒惰与非懒惰)和初始化方案下,建立扰动稳定性的理论边界。
- 将先前关于鲁棒性的研究结果扩展至包含过参数化与参数化不足设置下宽度、深度和初始化的相互作用。
- 通过全连接网络、卷积网络和残差网络的实验验证理论发现。
提出的方法
- 提出一种扰动稳定性度量,定义为网络输出对输入扰动(在ℓ₂球内,半径为ε)的梯度范数的期望值。
- 推导出在不同初始化方案(LeCun、He、NTK)和训练范式(懒惰与非懒惰)下,深层ReLU网络的扰动稳定性理论上限。
- 利用渐近分析方法,研究在参数化不足与过参数化设置下,宽度和深度对鲁棒性的影响。
- 将分析应用于非懒惰训练范式下的两层ReLU网络,推导出优于先前工作的边界。
- 采用神经正切核(NTK)理论和随机矩阵理论,刻画训练过程中梯度范数的行为。
- 通过全连接网络、卷积网络和ResNet架构的实验,验证理论预测结果,涵盖多种宽度、深度和初始化方式。
实验结果
研究问题
- RQ1在参数化不足与过参数化设置下,网络宽度如何影响平均鲁棒性?
- RQ2深度如何影响鲁棒性?这种影响是否依赖于初始化方案?
- RQ3训练范式(懒惰与非懒惰)在决定深层网络鲁棒性方面起到什么作用?
- RQ4不同的初始化方法(LeCun、He和NTK)如何影响深层网络的扰动稳定性?
- RQ5能否将扰动稳定性理论边界的分析,从两层网络扩展至非懒惰训练范式下的更一般设置?
主要发现
- 在过参数化设置下,增加宽度可提升鲁棒性;而在参数化不足设置下,宽度先损害鲁棒性,随后才开始提升,表明存在一个相变现象。
- 在LeCun初始化和懒惰训练下,深度通过指数方式提升鲁棒性,其边界按(√2/2)^{L−2}缩放。
- 在He初始化和NTK初始化下,深度会以多项式方式降低鲁棒性,其边界分别随√(L³m/d)(He)和√(L³m/o)e^{−m/L³}(NTK)增长。
- 在非懒惰训练范式下,两层ReLU网络的宽度可提升鲁棒性,与改进自Huang等人(2021)和Wu等人(2021)的理论边界一致。
- 全连接网络、卷积网络和ResNet架构的实验结果验证了理论趋势:在非懒惰设置下,鲁棒性随宽度增加;在He和NTK初始化下,鲁棒性随深度变化显著。
- 非懒惰范式下的理论边界不够紧密,提示在非两层网络设置下,对深层网络的分析仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。