[论文解读] Vision Transformers in 2022: An Update on Tiny ImageNet
本论文采用受DeiT启发的标准化训练协议,在Tiny ImageNet上评估了视觉Transformer模型——ViT、DeiT、CaiT和Swin,实现了91.35%的SOTA准确率(Swin-L/4)。该研究填补了迁移学习基准中的关键空白,引入了此前在视觉Transformer研究中被忽视但作为ImageNet-1k子集具有重要意义的Tiny ImageNet数据集。
The recent advances in image transformers have shown impressive results and have largely closed the gap between traditional CNN architectures. The standard procedure is to train on large datasets like ImageNet-21k and then finetune on ImageNet-1k. After finetuning, researches will often consider the transfer learning performance on smaller datasets such as CIFAR-10/100 but have left out Tiny ImageNet. This paper offers an update on vision transformers' performance on Tiny ImageNet. I include Vision Transformer (ViT) , Data Efficient Image Transformer (DeiT), Class Attention in Image Transformer (CaiT), and Swin Transformers. In addition, Swin Transformers beats the current state-of-the-art result with a validation accuracy of 91.35%. Code is available here: https://github.com/ehuynh1106/TinyImageNet-Transformers
研究动机与目标
- 通过在Tiny ImageNet上评估性能,填补视觉Transformer基准中的空白,该数据集在以往的迁移学习研究中常被忽略。
- 在与DeiT相似的稳定训练方案下,评估现代视觉Transformer在Tiny ImageNet上的迁移能力。
- 通过消融实验与超参数调优,识别出在Tiny ImageNet上最有效的视觉Transformer训练配置。
- 在这一中等规模数据集上,比较ViT、DeiT、CaiT和Swin架构在模型效率、准确率与训练速度方面的表现。
提出的方法
- 使用标准化训练协议(输入分辨率384×384,批量大小128)在Tiny ImageNet上微调ViT、DeiT、CaiT和Swin Transformer。
- 应用Mixup、CutMix和Random Erasing等数据增强技术,并设置指定概率以提升泛化能力。
- 使用标签平滑(ε=0.1)、随机深度(率=0.1)以及AdamW优化器(学习率余弦衰减,权重衰减为0.05)。
- 在RTX 3070(8GB显存)上使用梯度累积,以应对因模型大小导致的批量大小限制。
- 通过移除或替换增强与正则化技术,开展消融实验,以识别最优训练配置。
- 评估其他优化器(带Nesterov动量的SGD),并与AdamW在收敛性和准确率方面进行比较。
实验结果
研究问题
- RQ1当采用DeiT启发的训练协议时,视觉Transformer在Tiny ImageNet上的表现如何?
- RQ2在相同训练制度下,哪种视觉Transformer架构在Tiny ImageNet上达到最高准确率?
- RQ3在Tiny ImageNet上训练视觉Transformer时,数据增强与正则化技术的最佳组合是什么?
- RQ4模型参数量、FLOPs与层数如何与Tiny ImageNet上的训练吞吐量和性能相关联?
- RQ5与RandAugment相比,使用Model EMA或AutoAugment是否能提升Tiny ImageNet上的性能?
主要发现
- Swin-L/4在Tiny ImageNet上实现了91.35%的最高验证准确率,创下新的SOTA结果。
- DeiT-B/16-D在所有模型中训练最快,准确率达到87.29%,表明知识蒸馏在此设置下具有显著有效性。
- 移除RandAugment后,测试准确率略有提升(91.35% vs 91.34%),且收敛更稳定,表明其在此设置下可能为冗余。
- Model EMA将准确率降低至90.83%,与先前研究结果一致,表明其在该数据集上无法提升性能。
- AutoAugment以及两种裁剪方法(RRC与SRC)均未提升性能,反而被更简单的增强策略所超越。
- 尽管参数量和FLOPs更低,CaiT-S/36训练速度最慢,表明层数是训练吞吐量的更强预测因子,而非模型大小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。