[论文解读] Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization
该论文提出MMAL-Net,一种用于细粒度视觉分类的多分支、多尺度注意力网络,无需边界框或部件标注即可学习具有区分性的物体和部件区域。通过使用注意力物体定位模块(AOLM)和注意力部件提议模块(APPM),该方法在多个尺度上生成物体和部件图像,并通过共享权重的多分支网络进行联合训练,实现了比以往方法更快的推理速度和最先进的准确率。
ImageNet Large Scale Visual Recognition Challenge (ILSVRC) is one of the most authoritative academic competitions in the field of Computer Vision (CV) in recent years. But applying ILSVRC's annual champion directly to fine-grained visual categorization (FGVC) tasks does not achieve good performance. To FGVC tasks, the small inter-class variations and the large intra-class variations make it a challenging problem. Our attention object location module (AOLM) can predict the position of the object and attention part proposal module (APPM) can propose informative part regions without the need of bounding-box or part annotations. The obtained object images not only contain almost the entire structure of the object, but also contains more details, part images have many different scales and more fine-grained features, and the raw images contain the complete object. The three kinds of training images are supervised by our multi-branch network. Therefore, our multi-branch and multi-scale learning network(MMAL-Net) has good classification ability and robustness for images of different scales. Our approach can be trained end-to-end, while provides short inference time. Through the comprehensive experiments demonstrate that our approach can achieves state-of-the-art results on CUB-200-2011, FGVC-Aircraft and Stanford Cars datasets. Our code will be available at https://github.com/ZF1044404254/MMAL-Net
研究动机与目标
- 为解决细粒度视觉分类(FGVC)中的挑战,即类间差异微小、类内差异大,导致分类困难。
- 消除对昂贵的边界框或部件标注的依赖,以实现对具有区分性区域的定位。
- 开发一种端到端可训练的网络,有效捕捉来自物体和部件区域的多尺度特征,以提升模型的鲁棒性和准确性。
- 在保持或提升现有弱监督方法性能的同时,降低模型复杂度并减少推理时间。
提出的方法
- 该方法采用具有共享权重的多分支网络,包含三个分支:原始图像、物体图像(由AOLM生成)和部件图像(由APPM生成)。
- 注意力物体定位模块(AOLM)仅使用类别标签和特征图预测物体边界框,无需额外训练或参数。
- 注意力部件提议模块(APPM)基于激活图识别多个具有区分性的部件区域,无需部件标注。
- 通过AOLM和APPM分别从原始图像生成物体图像和部件图像,并输入网络以实现多尺度特征学习。
- 所有分支均使用交叉熵损失,共享相同的CNN和全连接层,实现参数高效的端到端训练。
- 推理阶段仅使用物体分支,显著降低计算量和推理时间。
实验结果
研究问题
- RQ1弱监督方法是否能在无需边界框或部件标注的情况下实现细粒度视觉分类的SOTA性能?
- RQ2多尺度与多分支学习如何提升细粒度分类中的特征表示能力和鲁棒性?
- RQ3基于注意力的定位与部件提议模块是否可仅使用类别标签实现端到端训练,而无需额外监督?
- RQ4在不增加参数量的前提下,分支间参数共享是否能提升模型效率与性能?
- RQ5与现有基于多分支或提议的模型相比,该方法在推理速度与准确率方面表现如何?
主要发现
- MMAL-Net在CUB-200-2011、FGVC-Aircraft和Stanford Cars数据集上均达到SOTA性能,优于先前方法。
- 物体定位模块(AOLM)在CUB-200-2011数据集上达到85.1%的PCP(正确定位部件比例),优于SCDA(76.8%)、ACOL(46.0%)和ADL(62.3%)。
- 与ResNet-50基线相比,模型准确率提升4.1%,同时保持相同的参数量。
- 在Tesla P100上,每张图像的推理时间仅为1.80 ms,显著快于NTS-Net(5.61 ms)和RA-CNN,得益于单分支推理。
- 可视化结果表明,AOLM和APPM能准确定位最具区分性的区域(如鸟类的头部和身体),与人类感知一致。
- 消融实验显示,三个分支(原始图像、物体、部件)均对最终准确率有显著贡献,其中物体和部件分支增强了模型对尺度变化的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。