Skip to main content
QUICK REVIEW

[论文解读] Zoom-CAM: Generating Fine-grained Pixel Annotations from Image Labels

Xiangwei Shi, Seyran Khademi|arXiv (Cornell University)|Oct 16, 2020
Advanced Neural Network Applications参考文献 37被引用 4
一句话总结

Zoom-CAM 通过整合所有中间卷积层(而不仅仅是最后一层)的类别激活图,提升了弱监督目标定位与分割性能,生成更高分辨率、细粒度的像素级伪标签。该方法减少了定位噪声,并捕获了基线方法遗漏的小尺度物体,在 ImageNet 上实现 2.8% 的 top-1 错误率降低,在弱监督语义分割任务中实现 1.1% 的 mIoU 提升。

ABSTRACT

Current weakly supervised object localization and segmentation rely on class-discriminative visualization techniques to generate pseudo-labels for pixel-level training. Such visualization methods, including class activation mapping (CAM) and Grad-CAM, use only the deepest, lowest resolution convolutional layer, missing all information in intermediate layers. We propose Zoom-CAM: going beyond the last lowest resolution layer by integrating the importance maps over all activations in intermediate layers. Zoom-CAM captures fine-grained small-scale objects for various discriminative class instances, which are commonly missed by the baseline visualization methods. We focus on generating pixel-level pseudo-labels from class labels. The quality of our pseudo-labels evaluated on the ImageNet localization task exhibits more than 2.8% improvement on top-1 error. For weakly supervised semantic segmentation our generated pseudo-labels improve a state of the art model by 1.1%.

研究动机与目标

  • 解决现有弱监督方法仅依赖最后一层低分辨率卷积层生成伪标签的局限性。
  • 提升 Grad-CAM 和 CAM 常常遗漏的小尺度与细粒度目标实例的定位准确率。
  • 开发一种利用所有中间层特征图生成高分辨率、精确视觉解释的方法,仅依赖图像级标签。
  • 证明整合多层特征可降低噪声,提升弱监督语义分割中的定位保真度。

提出的方法

  • Zoom-CAM 通过反向传播所有中间卷积层的类别得分梯度,计算基于梯度的重要图,而非仅最后一层。
  • 它对所有中间层的激活图应用可学习的权重掩码,线性组合以优化类别特定显著性。
  • 该方法将融合后的激活图上采样至输入图像分辨率,以生成高分辨率的视觉解释用于伪标签化。
  • 采用阈值化与连通域分析策略,从融合图中提取显著区域,作为伪分割标签使用。
  • 该方法与标准 CNN 兼容,除标准反向传播外仅增加极少计算开销。
  • 通过从图像级监督生成更准确的伪标签,替代弱监督流程中的 CAM 或 Grad-CAM。

实验结果

研究问题

  • RQ1整合所有中间卷积层的特征图是否能提升弱监督定位中伪标签的精确度?
  • RQ2与仅依赖最后一层相比,使用多层是否能减少定位噪声,并更好地捕获小尺度或细粒度目标实例?
  • RQ3在定位与分割准确率方面,Zoom-CAM 与 SOTA 可视化方法(如 Grad-CAM 和 Score-CAM)相比表现如何?
  • RQ4Zoom-CAM 生成的伪标签能否提升 SOTA 弱监督语义分割模型的性能?

主要发现

  • 与 Grad-CAM 相比,Zoom-CAM 在 ImageNet 定位基准上将 top-1 错误率降低 2.8%,top-5 错误率降低 3.7%。
  • 在 PASCAL VOC 2012 数据集上,Zoom-CAM 生成的伪标签 mIoU 高于 CAM、Grad-CAM、Score-CAM 和 Grad-CAM++。
  • 当用于微调 SOTA 的 IRNet 模型进行弱监督语义分割时,Zoom-CAM 将 mIoU 提升 1.1%。
  • 视觉检查确认,Zoom-CAM 成功定位了同一类别下的多个实例以及 Grad-CAM 所遗漏的小尺度物体。
  • 该方法保持与 Grad-CAM 相当的计算效率,因主要开销仍为反向传播。
  • 中间层特征图的融合降低了背景过激活,提升了空间定位保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。