[论文解读] Learning Semantically Enhanced Feature for Fine-Grained Image Classification
本文提出了一种参数高效、即插即用的模块——语义增强特征(Semantically Enhanced Feature, SEF),用于细粒度图像分类。该模块通过可学习排列将CNN特征通道分组为语义部分,并利用知识蒸馏和熵正则化引导这些组在判别性物体部分上激活,从而增强特征的判别能力。该方法在Birds数据集上仅比ResNet-50多出1.7%的参数,便实现了最先进性能。
We aim to provide a computationally cheap yet effective approach for fine-grained image classification (FGIC) in this letter. Unlike previous methods that rely on complex part localization modules, our approach learns fine-grained features by enhancing the semantics of sub-features of a global feature. Specifically, we first achieve the sub-feature semantic by arranging feature channels of a CNN into different groups through channel permutation. Meanwhile, to enhance the discriminability of sub-features, the groups are guided to be activated on object parts with strong discriminability by a weighted combination regularization. Our approach is parameter parsimonious and can be easily integrated into the backbone model as a plug-and-play module for end-to-end training with only image-level supervision. Experiments verified the effectiveness of our approach and validated its comparable performance to the state-of-the-art methods. Code is available at https://github.com/cswluo/SEF
研究动机与目标
- 开发一种计算高效的细粒度图像分类方法,避免使用复杂的部件定位模块。
- 通过学习CNN特征通道的语义分组,在不引入额外参数的情况下提升特征判别能力。
- 利用轻量级正则化策略,引导子特征在高度判别性的物体部分上激活。
- 在仅使用图像级别监督的前提下实现端到端训练,使该方法可轻松集成到现有CNN主干网络中。
- 在仅进行少量架构修改和参数增加的情况下,实现具有竞争力的性能。
提出的方法
- 语义分组模块通过可学习排列矩阵将特征通道划分为语义组,隐式最大化组内相关性并最小化组间相关性。
- 该方法使用最大熵学习与知识蒸馏的加权组合,对组内子特征进行正则化,使其与全局特征预测对齐。
- 正则化策略通过匹配子特征与全局特征的预测分布,促使子特征在具有高判别性的物体部分上激活。
- 整个模块被实现为即插即用组件,可插入任意CNN主干网络中,无需修改网络结构。
- 该方法在仅使用图像级别监督的前提下进行端到端训练,避免了部件标注或引导初始化的需求。
- 组的数量是一个通过交叉验证调优的超参数,中等数量的组(例如3–7组)可获得最佳性能。
实验结果
研究问题
- RQ1是否可以在无需引导初始化或额外参数的情况下,隐式学习特征通道的分组,同时形成语义上有意义的部分?
- RQ2引导子特征在判别性物体部分上激活,是否能提升细粒度识别中的分类准确率?
- RQ3语义组的数量如何影响分组特征的判别性和语义一致性?
- RQ4轻量级、即插即用的模块能否在极低参数增加的前提下,实现与最先进方法相当的性能?
- RQ5在仅使用图像级别监督的前提下,该方法在不同主干网络架构和数据集上是否具有鲁棒性?
主要发现
- 在Birds数据集上,SEF配合ResNet-18实现了84.8%的top-1准确率,比基线模型高出2.5个百分点。
- 在Birds数据集上,SEF配合ResNet-50实现了87.3%的准确率,性能与更复杂的Cross-X模型相当,但仅多出1.7%的参数。
- 消融实验表明,将分布匹配分解为独立的正则化器(熵正则化与知识蒸馏)相比直接组合,性能显著提升1.6%。
- 可视化结果表明,不同的语义组在飞机图像中激活在不同且可识别的部位,如机翼和发动机短舱。
- 该方法在不同主干网络上泛化良好:在Aircraft数据集上,SEF配合ResNeXt-50实现了92.6%的准确率,展现出强大的可迁移性。
- 相关性矩阵与判别性曲线表明,组数过多会降低特征质量,最优性能出现在3–7组之间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。