Skip to main content
QUICK REVIEW

[论文解读] Let's Agree to Agree: Neural Networks Share Classification Order on Real Datasets

Guy Hacohen, Leshem Choshen|arXiv (Cornell University)|May 26, 2019
Machine Learning and Data Classification被引用 6
一句话总结

该论文表明,深度神经网络在真实世界数据集(如CIFAR-100和ImageNet)上,即使使用不同的优化器或随机初始化,也会在不同架构和训练运行中以相同的顺序学习样本。关键发现是,这种共享的学习顺序是由数据集结构驱动的,而非训练动态,因为合成数据集和标签打乱的数据集会破坏这一模式,且非神经网络模型(如AdaBoost)则以不同的顺序学习。

ABSTRACT

We report a series of robust empirical observations, demonstrating that deep Neural Networks learn the examples in both the training and test sets in a similar order. This phenomenon is observed in all the commonly used benchmarks we evaluated, including many image classification benchmarks, and one text classification benchmark. While this phenomenon is strongest for models of the same architecture, it also crosses architectural boundaries -- models of different architectures start by learning the same examples, after which the more powerful model may continue to learn additional examples. We further show that this pattern of results reflects the interplay between the way neural networks learn benchmark datasets. Thus, when fixing the architecture, we show synthetic datasets where this pattern ceases to exist. When fixing the dataset, we show that other learning paradigms may learn the data in a different order. We hypothesize that our results reflect how neural networks discover structure in natural datasets.

研究动机与目标

  • 研究不同模型和训练运行中,神经网络是否以一致顺序学习样本。
  • 确定这种一致学习顺序是由优化动态(如SGD)引起,还是数据集固有结构所致。
  • 通过与非神经学习范式比较,检验这种学习顺序是否为神经网络独有。
  • 评估学习顺序是否与数据复杂性相关,即是否越简单的样本越早被学习。

提出的方法

  • 在CIFAR-100、MNIST和ImageNet等标准基准数据集上,对多种架构的神经网络模型进行实证比较,分析其分类顺序。
  • 将'分类顺序'定义为每个测试样本首次被模型正确分类的训练轮次(epoch)。
  • 使用皮尔逊相关系数(Pearson correlation)分析不同模型之间以及神经网络与非神经网络之间的学习顺序相关性。
  • 通过使用不同的优化器、学习率和随机种子训练模型,测试学习顺序对训练超参数的鲁棒性。
  • 构建无内在结构的合成数据集,以检验学习顺序是否依然存在。
  • 在原始像素和预训练Inception-V3模型提取的特征上,使用线性弱学习器训练AdaBoost,以与神经网络的学习顺序进行比较。

实验结果

研究问题

  • RQ1在相同基准数据集上训练的不同神经网络模型,是否无论架构或训练超参数如何,都以相同的顺序学习样本?
  • RQ2观察到的学习顺序是否由随机优化(如SGD)导致,还是数据集潜在结构的产物?
  • RQ3当在无泛化信号的合成数据集或标签打乱的数据集上训练时,这种学习顺序是否仍然存在?
  • RQ4非神经学习模型(如使用线性分类器的AdaBoost)是否与神经网络以相同的顺序学习相同样本?
  • RQ5学习顺序是否与数据复杂性相关,即是否越简单的样本在所有模型中都更早被学习?

主要发现

  • 相同架构的模型学习样本的顺序高度相关,多个基准上的皮尔逊相关系数均高于0.9。
  • 即使架构不同的模型,最初也以相同顺序学习样本,更强的模型仅在较弱模型完成共享样本集后才开始学习额外样本。
  • 在无自然结构的合成数据集上,共享学习顺序被打破,表明该现象并非SGD或优化过程的产物。
  • 在标签被打乱的数据集中,泛化不可能实现,模型以不同顺序记忆样本,表明该模式依赖于真实数据集的结构。
  • 使用线性分类器的AdaBoost学习样本的顺序与神经网络显著不同,即使使用预训练网络的迁移特征,相关性也较低(r = 0.35)。
  • 只要训练集来自同一数据分布,学习顺序在不同训练集上依然保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。