Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Complementary Parts Models for Fine-Grained Image Classification from the Bottom Up

Weifeng Ge, Xiangru Lin|arXiv (Cornell University)|Mar 7, 2019
Advanced Neural Network Applications参考文献 51被引用 12
一句话总结

该论文提出了一种弱监督互补部件模型,用于细粒度图像分类。该方法通过迭代使用Mask R-CNN和基于CRF的实例分割,挖掘多样化且非主导的物体部件,然后利用双向LSTM进行特征融合,从而提升分类准确率。该方法在斯坦福狗120、加州理工-加州大学圣迭戈分校鸟类2011-200和加州理工256数据集上分别实现了6.7%、2.8%和5.2%的性能提升,达到当前最先进水平。

ABSTRACT

Given a training dataset composed of images and corresponding category labels, deep convolutional neural networks show a strong ability in mining discriminative parts for image classification. However, deep convolutional neural networks trained with image level labels only tend to focus on the most discriminative parts while missing other object parts, which could provide complementary information. In this paper, we approach this problem from a different perspective. We build complementary parts models in a weakly supervised manner to retrieve information suppressed by dominant object parts detected by convolutional neural networks. Given image level labels only, we first extract rough object instances by performing weakly supervised object detection and instance segmentation using Mask R-CNN and CRF-based segmentation. Then we estimate and search for the best parts model for each object instance under the principle of preserving as much diversity as possible. In the last stage, we build a bi-directional long short-term memory (LSTM) network to fuze and encode the partial information of these complementary parts into a comprehensive feature for image classification. Experimental results indicate that the proposed method not only achieves significant improvement over our baseline models, but also outperforms state-of-the-art algorithms by a large margin (6.7%, 2.8%, 5.2% respectively) on Stanford Dogs 120, Caltech-UCSD Birds 2011-200 and Caltech 256.

研究动机与目标

  • 为解决深度卷积神经网络在图像分类中仅关注最具有判别性的部件而导致忽略其他部件互补信息的局限性。
  • 开发一种弱监督方法,无需边界框或部件级标注,即可检索并融合多个互补的物体部件。
  • 通过建模部分物体描述,使它们共同构成更完整的表征,从而提升细粒度图像分类性能。
  • 设计一种有效的融合机制,将多样化且互补的部件编码为统一的特征表示以用于分类。

提出的方法

  • 使用预训练分类器生成的类别激活图(CAM)作为弱监督目标检测的初始概率图。
  • 应用条件随机场(CRF)结合低层次外观特征,对像素级分割进行优化,生成初始物体实例掩码。
  • 通过在CRF生成的掩码上训练Mask R-CNN,交替迭代优化物体提议,以提升定位与分割精度。
  • 通过选择在检测到的实例周围最大化多样性与信息覆盖度的物体提议,搜索最优的互补部件集合。
  • 采用双向堆叠长短期记忆网络(LSTM),将来自多个互补部件的深层特征编码并融合为统一的表征。
  • 在LSTM训练过程中引入多种损失函数,以正则化特征学习并提升特征的判别能力。

实验结果

研究问题

  • RQ1弱监督目标检测与实例分割能否有效恢复标准CNN忽略的互补物体部件?
  • RQ2如何选择并建模互补部件,以最大化信息多样性并最小化冗余?
  • RQ3通过LSTM架构融合多个互补部件的特征,是否能显著提升分类性能,优于仅依赖主导部件的模型?
  • RQ4LSTM中部件的顺序在多大程度上影响分类性能?

主要发现

  • 在加州理工-加州大学圣迭戈分校鸟类2011-200数据集上,使用GoogleNet时,该方法达到93.5%的准确率,较基线模型提升9.4个百分点,较最先进方法提升5.2个百分点。
  • 在斯坦福狗120数据集上,该方法准确率达到93.9%,较之前最先进方法提升6.7%。
  • 在加州理工256数据集上,使用SJFT基线时,该方法准确率达到86.3%,当引入所提出的堆叠LSTM模块后,准确率提升8.0%。
  • 消融实验表明,使用随机或网格化部件初始化会使准确率分别降至85.9%和78.3%,证明了所提出的部件搜索机制的重要性。
  • 若移除堆叠LSTM并替换为特征拼接或平均操作,准确率将分别下降5.8%和8.7%,表明基于LSTM的融合机制具有显著优势。
  • 在LSTM中对部件顺序进行随机打乱后性能保持稳定,表明模型对部件序列具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。