Skip to main content
QUICK REVIEW

[论文解读] Does progress on ImageNet transfer to real-world datasets?

Alex Chengyu Fang, Simon Kornblith|arXiv (Cornell University)|Jan 11, 2023
Domain Adaptation and Few-Shot Learning被引用 7
一句话总结

本文研究了ImageNet上的进展是否能推广到真实世界图像分类数据集。在六个非网络抓取的数据集中评估了19个预训练模型。研究发现,更高的ImageNet准确率并不能始终提升下游性能;在六个数据集中的四个中,VGG之后的架构改进并未带来显著增益,而特定任务的数据增强方法往往优于更新的架构。

ABSTRACT

Does progress on ImageNet transfer to real-world datasets? We investigate this question by evaluating ImageNet pre-trained models with varying accuracy (57% - 83%) on six practical image classification datasets. In particular, we study datasets collected with the goal of solving real-world tasks (e.g., classifying images from camera traps or satellites), as opposed to web-scraped benchmarks collected for comparing models. On multiple datasets, models with higher ImageNet accuracy do not consistently yield performance improvements. For certain tasks, interventions such as data augmentation improve performance even when architectures do not. We hope that future benchmarks will include more diverse datasets to encourage a more comprehensive approach to improving learning algorithms.

研究动机与目标

  • 评估SOTA ImageNet模型改进是否可泛化至真实世界图像分类任务。
  • 比较ImageNet准确率作为非网络抓取数据集下游性能预测指标的有效性,与网络抓取基准相比。
  • 评估方法论干预(如数据增强或更多训练数据)带来的增益是否超过架构改进。
  • 探究其他非网络抓取数据集上的表现是否能比仅依靠ImageNet准确率更好地预测可迁移性。

提出的方法

  • 在六个真实世界图像分类数据集上评估了19个ImageNet预训练模型,其ImageNet top-1准确率范围为56.5%至83.4%。
  • 使用线性回归建模下游准确率与ImageNet准确率的关系,通过计算斜率量化迁移强度。
  • 应用F检验评估在其他五个非网络抓取数据集上的平均准确率是否能解释超越ImageNet准确率的额外方差。
  • 使用Spearman等级相关系数比较在logit变换和标准化后,各数据集间模型性能的排序关系。
  • 分析预训练阶段的数据增强策略(如RandAugment、AutoAugment、CutMix)及其对迁移性能的影响。
  • 在迁移图中按预训练阶段的数据增强类型对模型点进行着色,以识别性能趋势中的模式。

实验结果

研究问题

  • RQ1更高的ImageNet准确率是否始终能带来在非网络抓取的真实世界图像分类数据集上的更好性能?
  • RQ2与网络抓取基准相比,VGG之后的架构改进在真实世界数据集上的迁移效果如何?
  • RQ3特定任务干预(如数据增强或额外训练数据)在真实世界任务上是否显著优于新ImageNet架构?
  • RQ4其他非网络抓取数据集上的表现是否能比仅依靠ImageNet准确率更好地预测下游性能?
  • RQ5使用简单增强与自动数据增强策略预训练的模型之间,是否存在系统性的可迁移性差异?

主要发现

  • 在六个真实世界数据集中的四个中,ImageNet准确率与下游准确率之间线性关系的斜率小于0.05,表明VGG之后的架构改进带来的迁移效果微乎其微。
  • Caltech Camera Traps-20(CCT-20)数据集的斜率为0.11,Human Protein Atlas(HPA)数据集的斜率为0.29,表明这两项任务的迁移效果中等。
  • 对于APTOS和Melanoma数据集,仅靠ImageNet准确率解释的方差显著高于其他数据集的平均准确率,表明ImageNet是这些任务的更好预测指标。
  • 在六个数据集中的五个中,ImageNet准确率与其他五个数据集平均准确率的组合能解释比仅ImageNet准确率更多的方差,表明多数据集表现是更强的预测因子。
  • Spearman相关分析显示,五个其他非网络抓取数据集的平均表现比ImageNet准确率更能预测六个数据集中的四个的性能,尤其在Melanoma和Cassava数据集中表现更优。
  • 使用自动增强(如RandAugment、AutoAugment)预训练的模型展现出更强的迁移性能趋势,表明预训练策略对真实世界迁移至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。