Skip to main content
QUICK REVIEW

[论文解读] Truth or Backpropaganda? An Empirical Investigation of Deep Learning Theory

Micah Goldblum, Jonas Geiping|arXiv (Cornell University)|Oct 1, 2019
Adversarial Robustness in Machine Learning参考文献 49被引用 8
一句话总结

该论文通过实证研究挑战了深度学习理论中的核心假设:在真实世界的神经网络中存在次优局部极小值,低范数参数并不能保证更好的泛化性能,ResNets由于跳跃连接和批量归一化而违背了宽网络理论,且高秩权重矩阵在泛化能力和对抗鲁棒性方面通常优于低秩矩阵。

ABSTRACT

We empirically evaluate common assumptions about neural networks that are widely held by practitioners and theorists alike. In this work, we: (1) prove the widespread existence of suboptimal local minima in the loss landscape of neural networks, and we use our theory to find examples; (2) show that small-norm parameters are not optimal for generalization; (3) demonstrate that ResNets do not conform to wide-network theories, such as the neural tangent kernel, and that the interaction between skip connections and batch normalization plays a role; (4) find that rank does not correlate with generalization or robustness in a practical setting.

研究动机与目标

  • 检验关于深度学习的广泛接受的理论假设(如局部极小值的近似最优性、低范数参数的优越性,以及宽网络极限的有效性)是否在实践中成立。
  • 研究在卷积神经网络中,尤其是对抗训练条件下,低秩权重矩阵是否能提升泛化能力或鲁棒性。
  • 评估跳跃连接和批量归一化等网络结构组件如何破坏经典深度学习理论的预测。
  • 通过展示非零范数偏差可提升性能,挑战权重衰减或低范数解为最优泛化的假设。

提出的方法

  • 基于损失曲面结构的理论分析,构建了全连接网络和卷积网络中次优局部极小值的显式示例。
  • 设计了一种基于有效秩(r(W) = ||W||_*/||W||_F)的秩调控技术,以在训练过程中控制权重矩阵的秩。
  • 在CIFAR-10和CIFAR-100数据集上,对ResNet-18及其无跳跃连接版本分别应用自然训练和对抗训练(PGD,ϵ=8/255 和 ϵ=1/255)。
  • 利用奇异值分解及Sedghi等人(2018)提出的快速方法,高效计算卷积滤波器的有效秩。
  • 将采用RankMin(低秩)和RankMax(高秩)目标训练的模型,与标准训练和对抗训练基线模型进行对比。
  • 通过对比带与不带残差连接的模型,分析批量归一化与跳跃连接在ResNets中的相互作用。

实验结果

研究问题

  • RQ1在真实深度神经网络的损失曲面中是否存在次优局部极小值?能否通过激活模式和权重配置的理论分析显式构造?
  • RQ2在现代深度网络中,低范数参数初始化或优化是否真正对泛化最优?
  • RQ3宽网络理论(如神经正切核)在实际架构(如ResNets)中的适用程度如何?
  • RQ4在卷积网络中,权重矩阵的低秩结构是否能增强泛化能力或对抗鲁棒性?
  • RQ5跳跃连接和批量归一化在多大程度上影响了关于泛化与优化的理论预测的有效性?

主要发现

  • 在真实深度神经网络的损失曲面中存在次优局部极小值,且可通过激活模式与权重配置的理论分析显式构造。
  • 在训练过程中将参数偏向非零范数可提升CIFAR-10和CIFAR-100上的测试准确率,这与“低范数解泛化性能更优”的假设相矛盾。
  • ResNets不满足宽网络理论,特别是神经正切核框架,这是由于跳跃连接与批量归一化的相互作用所致。
  • 高秩权重矩阵(RankMax)在对抗鲁棒性方面优于低秩矩阵(RankMin),在CIFAR-10上ϵ=8/255时达到74.92%的鲁棒准确率,高于RankMin的73.19%和标准对抗训练的74.27%。
  • 低秩权重矩阵与提升对抗鲁棒性之间无相关性;事实上,高秩模型在鲁棒性基准测试中通常优于低秩模型。
  • 滤波器的有效秩在训练过程中下降,初始权重的秩高于训练后模型,表明优化过程降低了秩,但这种降低并未带来性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。