[论文解读] Cross-X Learning for Fine-Grained Visual Categorization
本文提出Cross-X学习,一种新颖的弱监督方法,用于细粒度视觉分类,通过建模跨图像语义部件相关性和跨层预测一致性来增强特征学习。通过引入跨类别跨语义正则化器(C³S)和跨层正则化器(CL),该方法在五个基准数据集上实现了最先进性能,包括在CUB-Birds上达到92.7%的准确率和在Stanford Cars上达到92.6%的准确率,且支持端到端训练和大规模数据集的可扩展性。
Recognizing objects from subcategories with very subtle differences remains a challenging task due to the large intra-class and small inter-class variation. Recent work tackles this problem in a weakly-supervised manner: object parts are first detected and the corresponding part-specific features are extracted for fine-grained classification. However, these methods typically treat the part-specific features of each image in isolation while neglecting their relationships between different images. In this paper, we propose Cross-X learning, a simple yet effective approach that exploits the relationships between different images and between different network layers for robust multi-scale feature learning. Our approach involves two novel components: (i) a cross-category cross-semantic regularizer that guides the extracted features to represent semantic parts and, (ii) a cross-layer regularizer that improves the robustness of multi-scale features by matching the prediction distribution across multiple layers. Our approach can be easily trained end-to-end and is scalable to large datasets like NABirds. We empirically analyze the contributions of different components of our approach and demonstrate its robustness, effectiveness and state-of-the-art performance on five benchmark datasets. Code is available at \url{https://github.com/cswluo/CrossX}.
研究动机与目标
- 解决在类内差异大、类间差异小且标注数据有限的条件下进行细粒度视觉分类的挑战。
- 克服现有弱监督方法将部件特定特征孤立处理的局限,忽略图像间和网络层间的关联关系。
- 开发一种简单而有效的框架,通过结构化特征正则化提升鲁棒性和性能。
- 实现可扩展的端到端训练,无需多裁剪或多阶段机制,适用于NABirds等大规模数据集。
提出的方法
- 提出一种跨类别跨语义正则化器(C³S),在不同图像中最大化相同语义部件的注意力特征相关性,同时最小化不同部件之间的相关性。
- 采用跨层正则化器(CL),利用KL散度将中级特征的预测分布与高级特征匹配,提升多尺度特征的鲁棒性。
- 改进特征金字塔网络(FPN)以生成兼具高空间分辨率和丰富语义信息的融合特征。
- 使用多通道激励模块生成注意力区域特征,随后通过C³S进行正则化,确保语义一致性。
- 将C³S与CL组件整合进单一端到端训练流程,避免复杂的采样策略或辅助损失。
- 在特征图上应用全局平均池化(GAP)和全局最大池化(GMP),生成多样化的注意力模式,提升定位能力。
实验结果
研究问题
- RQ1在弱监督设置下,建模部件特定特征之间的跨图像关系是否能提升细粒度特征学习?
- RQ2跨层预测一致性如何促进细粒度分类中鲁棒的多尺度特征表示?
- RQ3一种具有显式正则化的简单端到端框架能否超越复杂的多阶段或多裁剪方法?
- RQ4所提方法在具有不同类间结构差异水平的数据集上泛化能力如何?
- RQ5与最先进方法相比,缺乏复杂采样或辅助损失流程是否会影响性能?
主要发现
- Cross-X学习在CUB-Birds数据集上实现了最先进性能,top-1准确率达到92.7%,超越了包括MAMC-CNN和MaxEnt-CNN在内的先前方法。
- 在Stanford Cars数据集上,该方法达到92.6%的准确率,即使在与ResNet-50和SENet-50结合时也优于这些模型。
- 在FGVC-Aircraft数据集上,该方法达到88.4%的准确率,是该数据集上报告方法中的最高水平,证明了其在结构差异上的有效性。
- 消融研究证实,C³S与CL组件均显著提升性能,其中C³S更侧重于特征对齐,CL更侧重于提升鲁棒性。
- 该方法具备可扩展性和高效性,无需多裁剪推理或复杂训练流程即可实现最先进结果,而FCAN等先进基线方法则依赖此类机制。
- 可视化结果表明,不同层(L-1, L, G)的激活图逐步优化定位效果,其中GMP产生更集中的注意力,GAP则能捕捉多个判别性区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。