[论文解读] Semantic Bilinear Pooling for Fine-Grained Recognition
本文提出语义双线性池化(Semantic Bilinear Pooling, SBP),一种两分支深度学习框架,通过将层次化标签结构与双线性池化相结合,实现细粒度识别。通过采用从粗到细的训练策略并结合广义交叉熵损失,SBP提升了特征判别能力,在四个基准数据集上实现了最先进(SOTA)的准确率,且推理阶段无额外开销。
Naturally, fine-grained recognition, e.g., vehicle identification or bird classification, has specific hierarchical labels, where fine categories are always harder to be classified than coarse categories. However, most of the recent deep learning based methods neglect the semantic structure of fine-grained objects and do not take advantage of the traditional fine-grained recognition techniques (e.g. coarse-to-fine classification). In this paper, we propose a novel framework with a two-branch network (coarse branch and fine branch), i.e., semantic bilinear pooling, for fine-grained recognition with a hierarchical label tree. This framework can adaptively learn the semantic information from the hierarchical levels. Specifically, we design a generalized cross-entropy loss for the training of the proposed framework to fully exploit the semantic priors via considering the relevance between adjacent levels and enlarge the distance between samples of different coarse classes. Furthermore, our method leverages only the fine branch when testing so that it adds no overhead to the testing time. Experimental results show that our proposed method achieves state-of-the-art performance on four public datasets.
研究动机与目标
- 解决细粒度识别中的挑战,即类间细微差异与类内变化导致的分类困难。
- 将层次化语义标签结构(如品牌与型号)融入深度学习模型,以提升特征学习能力。
- 设计一个两分支网络(粗分支与细分支),在训练阶段利用语义先验,推理阶段仅使用细分支以保持高效性。
- 设计一种广义交叉熵损失,以增强粗分类之间的判别性,并在训练过程中利用标签层次结构。
- 在不增加模型复杂度或推理时间的前提下,实现在多个细粒度识别基准上的最先进性能。
提出的方法
- 提出一种两分支卷积神经网络架构:粗分支用于层次化标签监督,细分支用于最终分类。
- 通过两个独立流(C-Net 与 F-Net)的特征图进行双线性池化,以捕捉高阶特征交互。
- 引入一种广义交叉熵损失,用于建模相邻层次级别之间的标签相关性,并增大类间粗分类的边界。
- 在双线性池化后应用符号平方根与 L2 归一化,以稳定训练过程并提升泛化能力。
- 推理阶段仅保留细分支,确保与标准模型相比无额外计算开销。
- 在训练过程中集成层次化标签树(如品牌 → 型号),以语义先验指导特征学习。
实验结果
研究问题
- RQ1能否在深度学习模型中有效利用层次化标签结构以提升细粒度识别性能?
- RQ2通过两分支网络实现从粗到细的监督,对特征判别性与模型准确率有何影响?
- RQ3一种建模标签层次结构的广义交叉熵损失,相较于标准交叉熵损失,能多大程度提升性能?
- RQ4能否在不增加推理时间或模型复杂度的前提下,有效结合双线性池化与语义先验?
- RQ5所提方法是否在标准细粒度识别基准上优于现有最先进方法?
主要发现
- 所提方法在 CompCars 上达到 97.8% 的准确率,在 Stanford Cars 上为 94.3%,在 CUB-200-2011 上为 88.9%,在 FG-WILDBERG 上为 91.7%,在所有这些基准上均优于先前所有方法。
- 在双线性池化中使用 iSQRT-COV 进行降维时性能最佳,CompCars 上达到 97.0% 准确率,Aircrafts 上为 91.1%。
- 广义交叉熵损失对性能提升的贡献大于两分支结构本身,尤其在减少粗分类间混淆方面效果显著。
- 模型通过仅在推理阶段使用细分支,保持了推理效率,与基线模型相比无额外计算开销。
- 尽管仅使用两层层次结构,该方法在 Stanford Cars 上仍比使用四层结构与额外卷积层的 HSE [8] 高出 0.7%。
- 可视化结果表明,注意力图比 CBP [19] 更加鲁棒且更聚焦于判别性区域,尤其在姿态与背景变化下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。