[论文解读] Fine-Grained Visual Classification with Efficient End-to-end Localization
本文提出了一种高效、端到端可训练的细粒度视觉分类(FGVC)定位模块,采用轻量级注意力网络(AttNet)和仿射变换网络(AffNet)来定位判别性图像区域。通过结合梯度反向传播与两种自监督损失函数,该方法在单次前向传播中即在CUB200-2011、Stanford Cars和FGVC-Aircraft数据集上达到最先进(SOTA)的准确率,显著优于以往方法,在准确率和训练效率方面均表现更优。
The term fine-grained visual classification (FGVC) refers to classification tasks where the classes are very similar and the classification model needs to be able to find subtle differences to make the correct prediction. State-of-the-art approaches often include a localization step designed to help a classification network by localizing the relevant parts of the input images. However, this usually requires multiple iterations or passes through a full classification network or complex training schedules. In this work we present an efficient localization module that can be fused with a classification network in an end-to-end setup. On the one hand the module is trained by the gradient flowing back from the classification network. On the other hand, two self-supervised loss functions are introduced to increase the localization accuracy. We evaluate the new model on the three benchmark datasets CUB200-2011, Stanford Cars and FGVC-Aircraft and are able to achieve competitive recognition performance.
研究动机与目标
- 解决现有细粒度视觉分类(FGVC)定位方法效率低下的问题,这些方法通常需要多次网络前向传播或复杂的训练调度。
- 开发一种轻量级、端到端可训练的定位模块,可无缝集成到分类主干网络中,且不增加推理成本。
- 通过基于特征图统计量的自监督损失函数提升定位准确率,减少对仅梯度监督的依赖。
- 仅使用图像级别标签和单次前向传播,实现在标准FGVC基准上的竞争力识别性能。
提出的方法
- 该方法提出AttNet,一种轻量级网络,从输入图像生成注意力图以突出判别性区域。
- AffNet以注意力图为输入,预测仿射变换参数,以裁剪出定位区域。
- 裁剪操作通过双线性采样实现可微,支持整个模型的端到端反向传播。
- 模型通过交叉熵损失(L_CE)、嵌入损失(L_emb)以及两种自监督损失L_att和L_aff联合训练,其中L_att和L_aff基于最后一卷积层特征图的统计量构建。
- 自监督损失提供辅助监督信号,提升定位准确率,且无需额外标注。
- 整个系统仅使用图像级别标签进行端到端训练,实现所有组件的高效统一训练。
实验结果
研究问题
- RQ1轻量级、端到端可微的定位模块是否能在不依赖多次网络前向传播或复杂训练调度的前提下,提升细粒度视觉分类的准确率?
- RQ2基于特征图统计量的自监督损失函数在与基于梯度的训练结合时,是否能有效提升定位准确率?
- RQ3将独立的注意力网络与仿射变换网络(AttNet与AffNet)结合,是否相比标准空间变换网络或迭代注意力机制带来更好的性能?
- RQ4在标准FGVC基准上,该方法在准确率和训练效率方面相较于现有最先进(SOTA)方法能实现多大程度的超越?
主要发现
- 所提出的端到端模型在CUB200-2011基准上达到88.5%的准确率,优于STN、RA-CNN和ISE等先前方法。
- 在Stanford Cars数据集上,该方法达到95.3%的准确率,与最佳性能方法API-Net相当,并在除TResNet外的所有方法中表现最优。
- 在FGVC-Aircraft数据集上,该方法取得93.9%的准确率,与SOTA方法API-Net性能相当,并优于除TBMSL-Net外的所有其他方法。
- 消融实验表明,禁用自监督损失会导致性能下降,证实其在提升定位准确率中的关键作用。
- 当同时启用梯度流与自监督监督时,模型达到最佳性能,证明了联合训练策略的有效性。
- 该方法保持了高效率,仅需通过网络一次前向传播,优于迭代或多次前向传播的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。