Skip to main content
QUICK REVIEW

[论文解读] Neural networks trained with SGD learn distributions of increasing complexity

Maria Refinetti, Alessandro Ingrosso|arXiv (Cornell University)|Nov 21, 2022
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

本文提出了一种随机梯度下降(SGD)训练的神经网络中的分布简化偏差(DSB),表明这些网络在初期依赖低阶输入统计量(如均值和协方差)之后才利用高阶统计量。在ResNet18、ViT和DenseNet121模型上,基于CIFAR10和ImageNet预训练模型的实证验证表明,DSB可解释泛化动态:在越来越复杂的数据克隆(高斯分布、WGAN、cifar5m)上训练的网络,仅在逐步延长的训练时间后才能复制原始CIFAR10模型的测试准确率,证实了对统计复杂度的分层利用。

ABSTRACT

The ability of deep neural networks to generalise well even when they interpolate their training data has been explained using various "simplicity biases". These theories postulate that neural networks avoid overfitting by first learning simple functions, say a linear classifier, before learning more complex, non-linear functions. Meanwhile, data structure is also recognised as a key ingredient for good generalisation, yet its role in simplicity biases is not yet understood. Here, we show that neural networks trained using stochastic gradient descent initially classify their inputs using lower-order input statistics, like mean and covariance, and exploit higher-order statistics only later during training. We first demonstrate this distributional simplicity bias (DSB) in a solvable model of a neural network trained on synthetic data. We empirically demonstrate DSB in a range of deep convolutional networks and visual transformers trained on CIFAR10, and show that it even holds in networks pre-trained on ImageNet. We discuss the relation of DSB to other simplicity biases and consider its implications for the principle of Gaussian universality in learning.

研究动机与目标

  • 研究SGD训练的神经网络在训练过程中是否优先学习低阶输入统计量(如均值和协方差),然后再利用高阶统计特征。
  • 理解数据结构在简化偏差中的作用,特别是统计矩如何影响泛化动态。
  • 测试在日益复杂的近似数据(如高斯混合、GAN、扩散模型)上训练的神经网络是否仅在更长的训练时间后才能复制在真实数据上训练的模型的泛化性能。
  • 建立一种新的简化偏差形式——分布简化偏差(DSB),将关注点从模型容量转移到数据分布特征。

提出的方法

  • 在合成数据上训练单个神经元模型,以在可解设置中解析地展示分布简化偏差(DSB)的出现。
  • 在CIFAR10上评估ResNet18、ViT和DenseNet121,使用数据克隆:高斯混合、WGAN生成的图像以及cifar5m扩散生成的图像。
  • 比较在真实CIFAR10与日益复杂的克隆数据上训练的网络的测试准确率和损失轨迹,以推断网络在每个训练阶段依赖的统计特征。
  • 使用数据近似的层级结构——高斯分布(仅捕捉均值和协方差)、WGAN(捕捉高阶统计量)和cifar5m(高保真、逼真的图像)——以探测学习过程中统计依赖性的演变。
  • 使用标准超参数(如权重衰减5e-4、余弦学习率、动量0.9)通过SGD训练模型,并在原始CIFAR10测试集上评估泛化性能。
  • 在CIFAR100上使用高斯克隆重现结果,以在更高类别设置下测试DSB,尽管由于计算限制,未实现完整的高阶近似。

实验结果

研究问题

  • RQ1使用SGD训练的神经网络是否在访问数据的高阶统计特征之前,优先利用低阶输入统计量(如均值和协方差)?
  • RQ2数据分布的复杂度(以对高阶矩的保真度衡量)如何影响神经网络在训练过程中的泛化动态?
  • RQ3是否可以通过在日益复杂的克隆数据上训练,复制在真实数据上训练的网络的泛化性能?如果是,这一过程在训练的哪个阶段发生?
  • RQ4分布简化偏差(DSB)在不同架构(包括卷积网络和视觉Transformer)中是否稳健?它在ImageNet预训练模型中是否依然存在?
  • RQ5数据结构(特别是低内在维度和高阶统计依赖性)如何与SGD训练中的简化偏差相互作用?

主要发现

  • 在高斯混合数据(仅捕捉每个CIFAR10类的均值和协方差)上训练的ResNet18,在前约50次SGD步长内,其在CIFAR10上的测试准确率与在真实CIFAR10上训练的基线模型相当。
  • 在cifar5m数据克隆(高保真、基于扩散的图像)上训练的ResNet18,仅在约2000次训练步长后才达到与真实CIFAR10模型相当的泛化性能,表明对复杂统计量的利用存在延迟。
  • 基于WGAN的克隆数据比高斯混合捕捉了更复杂的结构,导致中间泛化动态,其性能在约1000次步长后与真实CIFAR10模型对齐。
  • 在CIFAR100上,两层网络和LeNet在高斯克隆上的初始准确率与真实数据相当,但深层模型早期出现偏差,表明DSB在高维、高类别设置下稳定性较低。
  • 在标准模型和ImageNet预训练模型中均观察到分布简化偏差(DSB),表明其是SGD训练在不同架构和数据设置下的普遍特性。
  • 结果支持一种统计复杂度的层级结构:网络首先利用低阶统计量进行分类,随后随着训练推进逐步整合高阶依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。