Skip to main content
QUICK REVIEW

[论文解读] Informative Class Activation Maps

Zhenyue Qin, Dongwoo Kim|arXiv (Cornell University)|Jun 19, 2021
Domain Adaptation and Few-Shot Learning参考文献 12被引用 4
一句话总结

本文提出了一种名为信息类激活图(infoCAM)的新方法,该方法利用信息论通过最大化真实类别与其他类别之间的点互信息(PMI)差异,识别对分类最具信息量的图像区域。与传统CAM相比,infoCAM在弱监督目标定位任务中表现更优,在Tiny-ImageNet上实现了最先进性能,并通过聚焦于最具区分性的特征而非仅最激活的区域,生成了更准确、以目标为中心的定位图。

ABSTRACT

We study how to evaluate the quantitative information content of a region within an image for a particular label. To this end, we bridge class activation maps with information theory. We develop an informative class activation map (infoCAM). Given a classification task, infoCAM depict how to accumulate information of partial regions to that of the entire image toward a label. Thus, we can utilise infoCAM to locate the most informative features for a label. When applied to an image classification task, infoCAM performs better than the traditional classification map in the weakly supervised object localisation task. We achieve state-of-the-art results on Tiny-ImageNet.

研究动机与目标

  • 通过信息论形式化类激活图,量化给定类别下图像区域的信息含量。
  • 通过识别与真实类别具有最大互信息的区域,解决传统CAM可能突出非区分性或部分特征的局限性。
  • 通过生成更精确且完整的物体边界框,提升弱监督目标定位(WSOL)性能。
  • 为卷积神经网络分类器提供理论重解释,将其视为互信息评估器,从而增强模型可解释性。

提出的方法

  • infoCAM基于真实类别与其他所有类别之间点互信息(PMI)差异,计算区域特定的强度得分。
  • infoCAM强度的核心公式为 $ M_{y}^{ ext{Diff}}(R) = \sum_{(a,b)\in R} w^{y}g(a,b) - \frac{1}{M-1}\sum_{y'\neq y} w^{y'}g(a,b) $,该公式强调那些对真实类别具有强支持而对其他类别支持较弱的区域。
  • 该方法使用卷积神经网络的最终卷积特征图,并应用阈值筛选出高信息量区域以生成边界框。
  • infoCAM+通过仅关注真实类别和最不可能的类别来简化计算,在保持性能的同时降低复杂度。
  • 边界框通过在infoCAM图中寻找超过阈值的最大连通区域,然后将其上采样至原始图像分辨率生成。
  • 该方法在CUB-200-2011和Tiny-ImageNet等标准WSOL基准上进行评估,并在双位数MNIST数据集上进行了多标签定位的消融研究。

实验结果

研究问题

  • RQ1信息论原则是否能提升弱监督目标定位中类激活图的可解释性和准确性?
  • RQ2真实类别与其他类别之间的PMI差异如何帮助识别比标准CAM更具区分性的图像区域?
  • RQ3infoCAM是否能实现更完整且精确的目标定位,尤其是相较于常遗漏目标部分的CAM?
  • RQ4infoCAM能否在不同数据集和网络架构上泛化,包括Tiny-ImageNet这类小尺寸图像?
  • RQ5在存在多个物体的图像中,infoCAM在多标签定位任务中的表现如何?

主要发现

  • 在Tiny-ImageNet数据集上,infoCAM在弱监督目标定位任务中实现了最先进性能,优于传统CAM。
  • 在CUB-200-2011数据集上,infoCAM在多种主干网络上均提升了定位准确率,表现出一致的性能增益。
  • 在多标签双位数MNIST实验中,infoCAM将定位准确率从CAM的91%提升至98%,显示出在复杂定位场景下的优越性能。
  • 可视化结果表明,infoCAM突出显示了完整物体(如鸟类身体),而CAM通常仅聚焦于部分或不具区分性的区域(如鸟类头部)。
  • infoCAM+在计算成本更低的情况下实现了与infoCAM相当的性能,使其成为实际部署中的实用替代方案。
  • ADL(对抗蒸馏损失)在CUB-200-2011上提升了性能,但在Tiny-ImageNet上导致性能下降,表明其对图像尺寸和结构具有敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。