[论文解读] TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers
TokenMixup 提出了一种高效、基于注意力引导的视觉变换器(Vision Transformers)样本级数据增强方法,通过使用自注意力图替代计算成本高昂的基于梯度的显著性检测,实现了 ×15 的加速,同时提升了性能。该方法引入了通过 ScoreNet 实现的课程学习以及一种多尺度变体——垂直 TokenMixup(Vertical TokenMixup),在从零开始训练的模型中实现了 CIFAR-100 上的最先进准确率。
Mixup is a commonly adopted data augmentation technique for image classification. Recent advances in mixup methods primarily focus on mixing based on saliency. However, many saliency detectors require intense computation and are especially burdensome for parameter-heavy transformer models. To this end, we propose TokenMixup, an efficient attention-guided token-level data augmentation method that aims to maximize the saliency of a mixed set of tokens. TokenMixup provides x15 faster saliency-aware data augmentation compared to gradient-based methods. Moreover, we introduce a variant of TokenMixup which mixes tokens within a single instance, thereby enabling multi-scale feature augmentation. Experiments show that our methods significantly improve the baseline models' performance on CIFAR and ImageNet-1K, while being more efficient than previous methods. We also reach state-of-the-art performance on CIFAR-100 among from-scratch transformer models. Code is available at https://github.com/mlvlab/TokenMixup.
研究动机与目标
- 解决参数量庞大的视觉变换器在混合样本(mixup)方法中基于梯度的显著性检测带来的高计算成本问题。
- 利用自注意力图作为高效、内在的显著性检测器,实现样本级数据增强。
- 通过 ScoreNet 引入一种课程学习方法,根据样本难度自适应地应用混合策略。
- 通过在单个样本内跨视觉变换器各层垂直混合令牌,实现多尺度特征学习。
- 在从零开始训练的模型中,于 CIFAR-100 上实现最先进性能,同时提升在 CIFAR-10 和 ImageNet-1K 上的泛化能力。
提出的方法
- TokenMixup 使用自注意力图作为显著性的快速、可微分代理,以识别需混合的重要令牌,替代基于梯度的显著性估计。
- 采用匈牙利匹配算法,最优地分配实例对以最大化批次级显著性,精确求解分配问题。
- 引入轻量级 ScoreNet 模块,用于估计样本难度,并指导自适应混合应用,实现课程学习策略。
- 垂直 TokenMixup(VTM)通过组合单个输入中不同层的令牌实现样本内混合,支持多尺度特征增强。
- 该方法可与其他混合技术(如输入混合和 CutMix)并行应用,进一步提升整体性能。
- 通过计算混合令牌的比例,应用基于显著性的标签重分配,生成软标签,保持语义一致性。
实验结果
研究问题
- RQ1自注意力图能否在降低计算成本的同时,有效替代基于梯度的显著性检测?
- RQ2通过 ScoreNet 实现的课程学习如何提升训练过程中样本级混合的有效性?
- RQ3在视觉变换器各层之间进行样本内混合,是否能增强多尺度特征表示并提升模型泛化能力?
- RQ4将 TokenMixup 与现有混合方法结合,对图像分类基准有何影响?
- RQ5与 Manifold Mixup 等软混合方法相比,基于注意力引导的样本级混合是否能带来更好的性能与鲁棒性?
主要发现
- 与基于梯度的方法相比,TokenMixup 在显著性检测上实现了 ×15 的加速,且在 CIFAR-100 上准确率得到提升。
- 该方法在从零开始训练的视觉变换器中,于 CIFAR-100 上达到 83.57% 的最先进 top-1 准确率。
- 将 TokenMixup 与输入混合及 CutMix 结合,可在 CIFAR-100 上实现 83.57% 的准确率,较原始 CCT 基线提升超过 6 个百分点。
- 垂直 TokenMixup 实现了有效的多尺度特征学习,在与其他混合方法结合时显著提升了性能。
- 消融实验证实,最优分配、基于显著性的标签重分配以及 ScoreNet 驱动的课程学习均对性能提升有显著贡献。
- 当应用于中间令牌时,Manifold Mixup 导致性能下降,表明对于自注意力机制而言,硬令牌替换(如 TokenMixup 所采用)更为合适。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。