Skip to main content
QUICK REVIEW

[论文解读] Interpretable and Accurate Fine-grained Recognition via Region Grouping

Zixuan Huang, Yin Li|arXiv (Cornell University)|May 21, 2020
Advanced Neural Network Applications参考文献 66被引用 7
一句话总结

该论文提出了一种用于可解释细粒度视觉识别的深度学习模型,通过在部件出现上施加U形先验来发现物体部件及其贡献。通过将特征分组为连贯区域并应用带正则化的注意力机制,该模型仅使用图像级别标签,就在CUB-200、CelebA和iNaturalist数据集上实现了最先进(SOTA)的准确率和优越的定位性能。

ABSTRACT

We present an interpretable deep model for fine-grained visual recognition. At the core of our method lies the integration of region-based part discovery and attribution within a deep neural network. Our model is trained using image-level object labels, and provides an interpretation of its results via the segmentation of object parts and the identification of their contributions towards classification. To facilitate the learning of object parts without direct supervision, we explore a simple prior of the occurrence of object parts. We demonstrate that this prior, when combined with our region-based part discovery and attribution, leads to an interpretable model that remains highly accurate. Our model is evaluated on major fine-grained recognition datasets, including CUB-200, CelebA and iNaturalist. Our results compare favorably to state-of-the-art methods on classification tasks, and our method outperforms previous approaches on the localization of object parts.

研究动机与目标

  • 开发一种用于细粒度视觉识别的可解释深度模型,通过部件分割和贡献归因来解释预测结果。
  • 在无部件标注的情况下,通过深度网络内的基于区域的分组机制发现有意义的物体部件。
  • 通过在图像中引入部件出现的简单U形先验,提升模型的可解释性和准确性。
  • 在标准细粒度识别基准上评估模型,重点关注分类准确率和定位保真度。
  • 证明:当与基于区域的发现和注意力机制结合时,对部件出现的弱先验可实现高性能,而无需弱监督部件标注。

提出的方法

  • 使用深度神经网络通过与学习到的部件表征词典进行比较,将像素特征分组为视觉上连贯的区域。
  • 应用注意力机制,为最终分类选择最具判别性的部件片段子集。
  • 利用地球移动距离(Earth Mover’s Distance)对部件出现施加U形先验——即部件可能在大量或少量图像中出现。
  • 仅使用图像级别标签和U形先验正则化进行端到端训练,无需任何部件标注。
  • 通过将整幅图像输入网络实现全卷积推理,以提升定位能力和泛化性能。
  • 生成可解释的输出:部件分割图、各部件的注意力权重以及最终的分类标签。

实验结果

研究问题

  • RQ1仅使用图像级别标签,深度模型能否发现有意义的物体部件并归因其对分类的贡献?
  • RQ2在细粒度识别中,部件出现的简单U形先验在引导无监督部件发现方面有多有效?
  • RQ3结合基于区域的部件发现、注意力机制和先验正则化,能否在保持高可解释性的同时实现SOTA准确率?
  • RQ4该模型的定位性能与现有显著性图和注意力基方法在细粒度数据集上的表现相比如何?
  • RQ5U形先验和注意力机制对部件定位准确率和模型鲁棒性有何影响?

主要发现

  • 在iNaturalist 2017数据集上,该模型在全卷积测试下将ResNet101的准确率提升了5.7%(从61.1%提升至66.8%)。
  • 在iNaturalist的Pointing Game基准上,该模型实现了最低的定位误差(7.6%),优于CAM/Grad-CAM(11.8%)和Guided Grad-CAM(8.2%)。
  • 在CelebA数据集上,该模型对左眼的定位误差为7.4%,右眼为7.5%,鼻子为9.1%,全模型准确率达到91.5%。
  • 消融实验表明,若移除正则化项,定位误差将从8.4%上升至12.3%,证明其在提升部件定位性能中的关键作用。
  • 无注意力机制的模型定位性能略优(误差7.6%),但失去了对特定部件重要性的归因能力,凸显了可解释性与性能之间的权衡。
  • 在iNaturalist上的失败案例归因于单一U形先验在5,000多个类别上的局限性,提示未来工作需采用更灵活的先验。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。