Skip to main content
QUICK REVIEW

[论文解读] How to Train Vision Transformer on Small-scale Datasets?

Hanan Gani, Muzammal Naseer|arXiv (Cornell University)|Oct 13, 2022
CCD and CMOS Imaging Sensors被引用 11
一句话总结

本文提出一种自监督预训练方法,直接从小规模数据集中学习归纳偏置,以有效初始化视觉变换器(ViTs)用于微调,从而在无需大规模预训练的情况下实现最先进性能。通过在小规模数据集上使用对比自监督学习(结合局部和全局图像裁剪视图)训练ViT,所学习到的特征可作为强大的权重初始化,其在CIFAR10/100、Tiny-ImageNet以及Aircraft和Cars等细粒度数据集上的表现优于现有方法。

ABSTRACT

Vision Transformer (ViT), a radically different architecture than convolutional neural networks offers multiple advantages including design simplicity, robustness and state-of-the-art performance on many vision tasks. However, in contrast to convolutional neural networks, Vision Transformer lacks inherent inductive biases. Therefore, successful training of such models is mainly attributed to pre-training on large-scale datasets such as ImageNet with 1.2M or JFT with 300M images. This hinders the direct adaption of Vision Transformer for small-scale datasets. In this work, we show that self-supervised inductive biases can be learned directly from small-scale datasets and serve as an effective weight initialization scheme for fine-tuning. This allows to train these models without large-scale pre-training, changes to model architecture or loss functions. We present thorough experiments to successfully train monolithic and non-monolithic Vision Transformers on five small datasets including CIFAR10/100, CINIC10, SVHN, Tiny-ImageNet and two fine-grained datasets: Aircraft and Cars. Our approach consistently improves the performance of Vision Transformers while retaining their properties such as attention to salient regions and higher robustness. Our codes and pre-trained models are available at: https://github.com/hananshafi/vits-for-small-scale-datasets.

研究动机与目标

  • 为解决在小规模数据集上从零训练视觉变换器(ViTs)的挑战,因为缺乏归纳偏置而通常表现不佳。
  • 开发一种自监督预训练策略,直接从小型数据集中学习有用的归纳偏置,从而摆脱对大规模预训练的依赖。
  • 提供一种即插即用的权重初始化方法,在不修改网络架构或损失函数的前提下,提升ViT在多种小规模数据集上的性能。
  • 证明在小数据上进行自监督特征学习可获得比标准ImageNet预训练更好的泛化能力,并增强对显著区域的关注。

提出的方法

  • 在小规模数据集上使用对比自监督学习目标训练视觉变换器,采用双视图裁剪:局部(高分辨率)和全局(低分辨率)图像块。
  • 使用多层感知机(MLP)投影头将来自两个视图的ViT特征映射到共享潜在空间,以支持对比学习。
  • 使用对比损失(如InfoNCE)优化模型,以最大化正样本(增强视图)之间的匹配度,并最小化与负样本对的相似度。
  • 将自监督训练得到的模型权重作为在相同小规模数据集上进行监督微调的初始化,不修改网络架构或损失函数。
  • 采用数据增强策略,包括随机裁剪、颜色抖动和缩放,以生成多样化的局部和全局视图。
  • 评估不同MLP头尺寸、裁剪比例组合及训练策略,以确定最优配置。

实验结果

研究问题

  • RQ1在小规模数据集上进行自监督预训练能否学习到有助于提升下游任务中ViT性能的归纳偏置?
  • RQ2在小规模数据集上从零训练ViT时,自监督预训练与ImageNet预训练或随机初始化相比表现如何?
  • RQ3在小数据上的自监督ViT训练中,哪些超参数(如裁剪比例、MLP头尺寸)对性能影响最大?
  • RQ4所提出的方法是否可普遍适用于不同ViT架构和小规模数据集,而无需修改网络结构?

主要发现

  • 所提出的自监督预训练方法在CIFAR100上达到79.15%的top-1准确率,优于此前SOTA的68.29%(在600个训练周期下取得)。
  • 在Tiny-ImageNet上,该方法达到63.36%的top-1准确率,超过使用SimCLR的SOTA方法(58.87%)和MOCO-V3(52.39%)的性能。
  • 仅使用300个训练周期(200个自监督 + 100个监督)即可实现SOTA性能,优于此前需要600个周期的方法。
  • 3层MLP头(1024维)表现最佳,而更大的头(如65536维)会导致过拟合并降低准确率。
  • 最优的局部-全局裁剪比例组合(如(0.2, 0.4)和(0.5, 1.0))在CIFAR100和Tiny-ImageNet上显著提升性能。
  • 自监督初始化改善了注意力图,增强了模型对显著图像区域的关注能力,提升了鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。