Skip to main content
QUICK REVIEW

[论文解读] A Decade's Battle on Dataset Bias: Are We There Yet?

Zhuang Liu, Kaiming He|arXiv (Cornell University)|Mar 13, 2024
Artificial Intelligence in Healthcare被引用 8
一句话总结

这篇论文表明现代神经网络能够在来自多个大型且多样的数据集的图像中,准确识别其源自哪个数据集,甚至在规模较大、去标注程度较低的数据中仍存在持续的数据集偏差。

ABSTRACT

We revisit the "dataset classification" experiment suggested by Torralba & Efros (2011) a decade ago, in the new era with large-scale, diverse, and hopefully less biased datasets as well as more capable neural network architectures. Surprisingly, we observe that modern neural networks can achieve excellent accuracy in classifying which dataset an image is from: e.g., we report 84.7% accuracy on held-out validation data for the three-way classification problem consisting of the YFCC, CC, and DataComp datasets. Our further experiments show that such a dataset classifier could learn semantic features that are generalizable and transferable, which cannot be explained by memorization. We hope our discovery will inspire the community to rethink issues involving dataset bias.

研究动机与目标

  • 激发对现代架构中数据集偏差与模型能力之间关系的再思考。
  • 以实证方式评估当前数据集是否保留模型可利用的可区分来源签名。
  • 研究学习到的数据集判别特征是否能迁移到下游语义任务。
  • 检查数据规模、数据增广、模型架构和自监督预训练如何影响数据集分类性能。

提出的方法

  • 通过将每个数据集视为N类图像分类问题中的一个类别来定义并操作化数据集分类任务。
  • 汇集多样化的大规模数据集(YFCC、CC、DataComp、WIT、LAION、ImageNet),并在每个数据集1M样本上训练ConvNeXt及其他架构。
  • 对保留验证集的图像在不同数据集组合上评估数据集分类准确性。
  • 通过伪影实验(色彩抖动、噪声、模糊、低分辨率)测试对低级伪影的鲁棒性。
  • 将全监督训练与伪数据集设置进行对比,以区分记忆化与泛化。
  • 探索自监督预训练(MAE)随后线性探测,以评估数据集判别特征的迁移。

实验结果

研究问题

  • RQ1现代神经网络是否能够可靠地从大规模、多样数据集中识别图像的源数据集?
  • RQ2学习到的数据集判别特征是否能迁移到语义图像分类任务?
  • RQ3数据集分类的高准确性是由于记忆还是可泛化的模式?
  • RQ4数据增强、模型规模和自监督预训练如何影响数据集分类性能?

主要发现

  • 神经网络在跨数据集组合上的数据集分类准确性很高,例如在 YFCC+CC+DataComp 的保留验证集上达到 84.7%。
  • 准确性通常随训练数据增多和增强力度增强而提升,表明是可泛化的模式而非记忆。
  • 即使是较小的模型也能实现强数据集分类性能(例如 ConvNeXt Tiny 27M 参数达到 84.7%)。
  • 伪数据集实验表明记忆化不是现实数据集分类任务的主要驱动因素;在伪设置中模型难以泛化。
  • 自监督预训练配合线性探测在数据集分类方面带来显著迁移(高达78.4%),通过线性探测数据集判别特征在 ImageNet 上也提供非平凡的提升。
  • 从数据集分类学习到的特征在语义任务上的提升虽非平凡,但不及专门的自监督方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。