Skip to main content
QUICK REVIEW

[论文解读] Improving Vision Transformers for Incremental Learning

Pei Yu, Yinpeng Chen|arXiv (Cornell University)|Dec 12, 2021
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出 ViTIL,一种通过解决三个关键问题来增强视觉变换器(Vision Transformers)在类别增量学习(CIL)中性能的方法:收敛速度慢、对新类别存在偏差,以及分类器层拟合不足。通过结合卷积主干网络、类别平衡微调和分类器的大学习率,ViTIL 在 CIFAR-100 和 ImageNet-1000 上的所有三种增量学习设置中均取得了新的 SOTA 性能,显著优于先前方法。

ABSTRACT

This paper proposes a working recipe of using Vision Transformer (ViT) in class incremental learning. Although this recipe only combines existing techniques, developing the combination is not trivial. Firstly, naive application of ViT to replace convolutional neural networks (CNNs) in incremental learning results in serious performance degradation. Secondly, we nail down three issues of naively using ViT: (a) ViT has very slow convergence when the number of classes is small, (b) more bias towards new classes is observed in ViT than CNN-based architectures, and (c) the conventional learning rate of ViT is too low to learn a good classifier layer. Finally, our solution, named ViTIL (ViT for Incremental Learning) achieves new state-of-the-art on both CIFAR and ImageNet datasets for all three class incremental learning setups by a clear margin. We believe this advances the knowledge of transformer in the incremental learning community. Code will be publicly released.

研究动机与目标

  • 探究将视觉变换器(ViT)直接应用于类别增量学习(CIL)时所面临的挑战,其性能相较于卷积神经网络(CNNs)显著下降。
  • 识别并诊断阻碍 ViT 在 CIL 中表现的三个关键问题:在少量类别下收敛速度慢、对新类别产生更大偏差,以及分类器层出现欠拟合。
  • 利用现有技术提出一种实用且有效的解决方案,无需架构创新即可解决上述问题。
  • 在多种 CIL 协议下,为基于 ViT 的 CIL 在 CIFAR-100 和 ImageNet-1000 上建立新的 SOTA 基线。

提出的方法

  • 用卷积主干网络替代 ViT 中的标准图像块划分主干,以改善初始优化并加速收敛,尤其在早期增量步骤中类别较少时效果显著。
  • 应用类别平衡微调(CBF)以纠正 ViT 中固有的对新类别的偏向,该方法与 MixUp 和 CutMix 等数据增强技术兼容。
  • 为分类器头使用远大于特征提取器的学习率,从而提高 Softmax 温度,缓解分类器中的欠拟合问题。
  • 将上述三个组件——卷积主干、CBF 和大分类器学习率——整合为统一的训练方案,命名为 ViTIL,专为增量学习优化。
  • 采用标准的 CIL 评估协议,包括 B50、B0 和 T20K 设置,并在消融研究中保持一致的超参数。

实验结果

研究问题

  • RQ1为何直接将视觉变换器应用于类别增量学习会导致性能显著下降,相较于 CNNs?
  • RQ2在增量学习中,尤其是早期阶段类别较少时,ViT 模型性能下降的根本原因是什么?
  • RQ3如何有效结合现有技术来解决 ViT 在 CIL 中的收敛速度、类别偏差和分类器欠拟合问题?
  • RQ4简单的现有方法组合是否能在 CIFAR-100 和 ImageNet-1000 基准上超越复杂的 SOTA CIL 模型?

主要发现

  • 在初始 500 个类别、每步新增 100 个类别的 CIL 设置下,ViTIL 在 ImageNet-1000 上达到 69.20% 的 top-1 准确率,优于 LUCIR+DDE 的 1.69%。
  • 在 10 步 CIL 设置下,每步新增 100 个类别,每类旧类别保留 20 个样本,ViTIL 达到 65.13% 的平均增量准确率,领先 PODNet 7.27%。
  • 在总样本数约束设置(T20K)下,ViTIL 达到 68.75% 的准确率,优于 BiC 的 6.28%。
  • 消融研究证实,卷积主干、CBF 和大分类器学习率三个组件在所有 CIL 协议中均独立且持续地贡献性能提升。
  • ViTIL 的平均增量遗忘率显著低于 LUCIR,表明其在不牺牲可塑性的前提下具备更强的稳定性。
  • 即使不使用卷积主干,仅通过偏差校正和大分类器学习率,ViTIL 在 B50 C10 R20 设置下的平均增量准确率仍比 LUCIR 高出 3.66%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。