Skip to main content
QUICK REVIEW

[论文解读] ImageNet-21K Pretraining for the Masses

Tal Ridnik, Emanuel Ben-Baruch|arXiv (Cornell University)|Apr 22, 2021
Multimodal Machine Learning Applications参考文献 57被引用 4
一句话总结

本文提出了一种新颖、高效且易于使用的 ImageNet-21K 预训练流水线,利用 WordNet 的层次结构将单标签标注转换为语义多标签。通过引入一种名为语义 Softmax 的新型训练方案,该方法在多种模型(包括小型移动架构)上显著优于 ImageNet-1K 及以往的 ImageNet-21K 预训练方法,在仅使用公开可用数据的前提下,实现了 ImageNet-1K 和多个下游任务的最先进性能。

ABSTRACT

ImageNet-1K serves as the primary dataset for pretraining deep learning models for computer vision tasks. ImageNet-21K dataset, which is bigger and more diverse, is used less frequently for pretraining, mainly due to its complexity, low accessibility, and underestimation of its added value. This paper aims to close this gap, and make high-quality efficient pretraining on ImageNet-21K available for everyone. Via a dedicated preprocessing stage, utilization of WordNet hierarchical structure, and a novel training scheme called semantic softmax, we show that various models significantly benefit from ImageNet-21K pretraining on numerous datasets and tasks, including small mobile-oriented models. We also show that we outperform previous ImageNet-21K pretraining schemes for prominent new models like ViT and Mixer. Our proposed pretraining pipeline is efficient, accessible, and leads to SoTA reproducible results, from a publicly available dataset. The training code and pretrained models are available at: https://github.com/Alibaba-MIIL/ImageNet21K

研究动机与目标

  • 解决尽管 ImageNet-21K 的规模和多样性优于 ImageNet-1K,但其长期未被充分利用的问题。
  • 克服在 ImageNet-21K 上预训练的挑战,包括标签非互斥、缺乏标准划分以及高计算成本。
  • 开发一种方法论严谨、高效且可复现的预训练流水线,使高质量的 ImageNet-21K 预训练对所有实践者都可及。
  • 证明即使是小型移动优化模型也能从 ImageNet-21K 预训练中显著获益,挑战仅大型模型能从大规模预训练中获益的假设。

提出的方法

  • 通过标准化图像分辨率、创建训练-验证划分并确保类别级别图像平衡,对 ImageNet-21K 进行预处理。
  • 利用 WordNet 的同义词集(synset)层次结构,将每个单标签转换为一组语义多标签,以表示层次关系。
  • 设计一种名为语义 Softmax 的新型训练方案,该方案在 WordNet 层次结构的多个层级上分别应用 Softmax 操作,并通过层次平衡聚合损失。
  • 将语义 Softmax 集成到专用的知识蒸馏损失中,以进一步提升特征表示能力和下游性能。
  • 将该流水线应用于多种模型,包括 ViT、ResNet、MobileNetV3 和 OFA-595,在多样化下游任务中进行评估。
  • 通过在公开 GitHub 仓库中发布训练代码和预训练模型,确保可复现性。

实验结果

研究问题

  • RQ1能否构建一个标准化、高效且可访问的 ImageNet-21K 预训练流水线,以克服其因规模和质量优越却长期被忽视的历史问题?
  • RQ2与单标签训练相比,利用语义层次结构在 ImageNet-21K 上进行多标签训练是否能提升下游性能?
  • RQ3所提出的语义 Softmax 方法是否能有效利用 ImageNet-21K 标签的层次结构,从而在性能上超越单标签和多标签预训练?
  • RQ4小型移动优化模型是否能从 ImageNet-21K 预训练中获益,从而挑战仅大型模型能利用大规模数据集的观念?
  • RQ5ImageNet-21K 预训练是否能在不依赖私有数据集的情况下,实现在 ImageNet-1K 上的最先进性能?

主要发现

  • 所提出的语义 Softmax 预训练方案在所有测试模型(包括 MobileNetV3 和 OFA-595)上显著优于标准的 ImageNet-1K 预训练,在 iNaturalist 上实现了 2.9% 的绝对性能提升。
  • 使用语义 Softmax 的 ImageNet-21K 预训练在 ImageNet-1K 上实现了 78.0% 的新最先进 top-1 准确率(使用 MobileNetV3),超越了原始报告的 75.2%。
  • 对于 ResNet50,该方法在 ImageNet-1K 上实现了 82.0% 的 top-1 准确率,相比先前工作报告的 76.0% 提升了 6.0%。
  • 语义 Softmax 方法提升了基于 MLP 的模型(如 ViT 和 Mixer)的训练稳定性和性能,这些模型通常因缺乏归纳偏置而难以微调。
  • 即使小型模型也能从 ImageNet-21K 预训练中显著获益,表明大规模预训练并非仅限于大型架构。
  • 该方法在多个下游任务(包括动作识别和 Pascal-VOC)上实现了最先进结果,且未使用私有数据集,仅依赖公开可用的数据与代码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。