[论文解读] ViT-FOD: A Vision Transformer based Fine-grained Object Discriminator
ViT-FOD 提出了一种基于视觉变换器(Vision Transformer)的细粒度视觉分类框架,通过引入三个新颖组件显著提升了性能:互补标记融合(Complementary Tokens Integration, CTI)用于多层分类标记融合,注意力图像块组合(Attention Patch Combination, APC)通过图像块互换实现减少背景的 数据增强,以及关键区域过滤器(Critical Regions Filter, CRF)用于聚焦于具有区分性的局部区域。该方法在标准细粒度视觉分类基准上实现了最先进(SOTA)的准确率,包括在 CUB-200-2011 数据集上达到 91.75% 的准确率。
Recently, several Vision Transformer (ViT) based methods have been proposed for Fine-Grained Visual Classification (FGVC).These methods significantly surpass existing CNN-based ones, demonstrating the effectiveness of ViT in FGVC tasks.However, there are some limitations when applying ViT directly to FGVC.First, ViT needs to split images into patches and calculate the attention of every pair, which may result in heavy redundant calculation and unsatisfying performance when handling fine-grained images with complex background and small objects.Second, a standard ViT only utilizes the class token in the final layer for classification, which is not enough to extract comprehensive fine-grained information. To address these issues, we propose a novel ViT based fine-grained object discriminator for FGVC tasks, ViT-FOD for short. Specifically, besides a ViT backbone, it further introduces three novel components, i.e, Attention Patch Combination (APC), Critical Regions Filter (CRF), and Complementary Tokens Integration (CTI). Thereinto, APC pieces informative patches from two images to generate a new image so that the redundant calculation can be reduced. CRF emphasizes tokens corresponding to discriminative regions to generate a new class token for subtle feature learning. To extract comprehensive information, CTI integrates complementary information captured by class tokens in different ViT layers. We conduct comprehensive experiments on widely used datasets and the results demonstrate that ViT-FOD is able to achieve state-of-the-art performance.
研究动机与目标
- 为解决标准视觉变换器在细粒度视觉分类任务中的局限性,特别是复杂背景上冗余计算以及多层分类标记表征利用不足的问题。
- 通过一种新颖的图像块组合机制,将非信息性背景图像块替换为另一张图像中的判别性图像块,以减少视觉变换器中的计算冗余。
- 通过一个可学习的过滤器强调关键判别性区域,从而改善特征学习,该过滤器优先保留显著物体部分的标记。
- 通过整合来自视觉变换器多个网络层的分类标记的互补特征,而非仅依赖最后一层,从而提升分类性能。
- 开发一种更高效且准确的细粒度物体识别框架,其性能优于现有的卷积神经网络(CNN)和基于视觉变换器的方法。
提出的方法
- 互补标记融合(Complementary Tokens Integration, CTI)将视觉变换器编码器中多个层次的分类标记进行融合,以捕捉全局与细粒度特征,从而提升表征学习能力。
- 注意力图像块组合(Attention Patch Combination, APC)通过组合两张输入图像中的信息丰富图像块来生成新的训练图像,减少背景噪声并实现有效的数据增强。
- 关键区域过滤器(Critical Regions Filter, CRF)使用一个可学习的阈值(η)来过滤掉低注意力标记,使模型聚焦于判别性物体部分,从而减少冗余计算。
- APC 模块基于图像的注意力分数在两幅图像之间进行图像块互换,用来自另一张图像的高注意力图像块替换背景图像块,从而生成更具信息量的输入。
- CRF 模块在分类标记注意力图上应用一个可学习掩码,仅保留对分类最相关的标记,其中 η 控制过滤器的稀疏性。
- 整体框架将 CTI、APC 和 CRF 集成到视觉变换器主干网络中,支持端到端训练,从而提升特征提取与分类准确率。
实验结果
研究问题
- RQ1如何改进视觉变换器,以减少在处理具有复杂背景的细粒度图像时的冗余计算?
- RQ2与仅使用最后一层相比,将视觉变换器多个层次的分类标记进行融合,是否能提升细粒度特征表征能力?
- RQ3通过图像块组合机制,将背景图像块替换为来自另一张图像的信息丰富图像块,是否能提升细粒度视觉分类任务中的泛化能力与性能?
- RQ4一个仅强调最判别性区域的可学习过滤器,是否能提升模型准确率与训练效率?
- RQ5在基于视觉变换器的细粒度分类背景下,所提出的 ViT-FOD 框架与标准数据增强方法(如 CutMix 和 MixUp)相比表现如何?
主要发现
- ViT-FOD 在 CUB-200-2011 数据集上实现了 91.75% 的最先进(SOTA)准确率,比基线 ViT-B/16 提高了 1.95 个百分点。
- 关键区域过滤器(CRF)的最佳超参数 η 为 0.2,此时性能最优,表明过滤掉低注意力标记可提升分类准确率。
- 注意力图像块组合(APC)模块在 p=4 时达到最高准确率,即图像被划分为四部分进行图像块互换,该设置在特征粒度与计算效率之间实现了良好平衡。
- 与标准数据增强方法相比,APC 在准确率上优于 Cutout(89.4%)、Mixup(90.1%)和 CutMix(90.3%),达到 91.2% 的准确率,证明其在基于视觉变换器的细粒度视觉分类任务中具有显著优势。
- 消融实验表明,CTI、APC 和 CRF 均对性能有显著贡献,完整模型在所有评估数据集上均取得最佳结果。
- CRF 掩码的可视化结果表明,该方法能有效突出物体区域,同时抑制背景图像块,证实其聚焦于判别性部分的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。