Skip to main content
QUICK REVIEW

[论文解读] Fine-grained visual recognition with salient feature detection

Hui Feng, Shanshan Wang|arXiv (Cornell University)|Aug 12, 2018
Advanced Neural Network Applications参考文献 14被引用 4
一句话总结

本文提出FP-CNN,一种细粒度视觉识别方法,通过使用部件标注检测显著物体部件,从各个部件提取判别性特征,并将其组合以提升分类性能。在CUB200-2011数据集上达到88.20%的准确率,相比最先进方法最高提升7.2个百分点。

ABSTRACT

Computer vision based fine-grained recognition has received great attention in recent years. Existing works focus on discriminative part localization and feature learning. In this paper, to improve the performance of fine-grained recognition, we try to precisely locate as many salient parts of object as possible at first. Then, we figure out the classification probability that can be obtained by using separate parts for object classification. Finally, through extracting efficient features from each part and combining them, then feeding to a classifier for recognition, an improved accuracy over state-of-art algorithms has been obtained on CUB200-2011 bird dataset.

研究动机与目标

  • 通过精确定位显著物体部件来提升细粒度视觉识别的准确率。
  • 分析各个部件(如头部、翅膀、腿部)对分类性能的贡献。
  • 开发一种结合多个部件特征以实现更优识别准确率的方法。
  • 在CUB200-2011基准上超越现有最先进方法。

提出的方法

  • 训练一个深度神经网络,利用部件标注检测并定位显著部件,生成带标签的部件图像。
  • 基于关键点标注(如喙、头顶、翅膀)使用最小矩形或方形包围框生成部件区域。
  • 使用微调后的ResNet-50模型从每个检测到的部件中提取特征。
  • 通过分类器(libSVM)逐步组合多个部件的特征,以评估性能增益。
  • 最终模型采用基于各部件独立性能选择的头部、翅膀和胸部特征,以实现最优识别效果。
  • 在输入图像调整为224×224的CUB200-2011数据集上评估该方法。

实验结果

研究问题

  • RQ1哪些物体部件对细粒度分类准确率的贡献最为显著?
  • RQ2当单独使用时,各个部件的分类性能如何比较?
  • RQ3能否通过逐步组合多个部件的特征,使整体识别准确率超越使用完整图像或单一部件的方法?
  • RQ4所提出的显著部件检测与特征组合方法是否在CUB200-2011上超越现有最先进方法?

主要发现

  • 仅使用头部区域即可达到77.02%的分类准确率,优于其他所有单独部件,接近完整图像识别的性能(78.92%)。
  • 当单独使用时,翅膀和胸部部件的准确率均约为50%,表明其提供中等但有用的判别信息。
  • 腿部和尾部部件的单独准确率最低,分别为31.72%和29.48%,表明其对分类的判别能力最弱。
  • 头部、翅膀和胸部特征的逐步组合达到最高准确率88.23%,略高于使用所有部件的组合。
  • 最终的FP-CNN模型在CUB200-2011测试集上达到88.20%的准确率,比最佳现有方法(Mask-CNN的87.30%)高出0.9个百分点。
  • 该方法在弱监督方法上提升4.1至7.2个百分点,即使在缺乏完全监督的情况下也表现出强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。