Skip to main content
QUICK REVIEW

[论文解读] Constrained Sampling for Class-Agnostic Weakly Supervised Object Localization

Shakeeb Murtaza, Soufiane Belharbi|arXiv (Cornell University)|Sep 9, 2022
Advanced Neural Network Applications被引用 5
一句话总结

本文提出了一种无需类别感知的、受限采样方法,利用自监督视觉Transformer生成高分辨率、无阈值的伪标签,用于弱监督目标定位。通过利用[cls]标记的注意力图,并对多个对象提议应用Otsu阈值分割,该方法生成精确的前景和背景掩码,从而实现端到端的交叉熵损失训练,在CUB-200-2011数据集上达到SOTA性能,平均MaxBoxAccV2得分为90.9%。

ABSTRACT

Self-supervised vision transformers can generate accurate localization maps of the objects in an image. However, since they decompose the scene into multiple maps containing various objects, and they do not rely on any explicit supervisory signal, they cannot distinguish between the object of interest from other objects, as required in weakly-supervised object localization (WSOL). To address this issue, we propose leveraging the multiple maps generated by the different transformer heads to acquire pseudo-labels for training a WSOL model. In particular, a new discriminative proposals sampling method is introduced that relies on a pretrained CNN classifier to identify discriminative regions. Then, foreground and background pixels are sampled from these regions in order to train a WSOL model for generating activation maps that can accurately localize objects belonging to a specific class. Empirical results on the challenging CUB benchmark dataset indicate that our proposed approach can outperform state-of-art methods over a wide range of threshold values. Our method provides class activation maps with a better coverage of foreground object regions w.r.t. the background.

研究动机与目标

  • 解决传统CAM方法在弱监督目标定位中定位粗糙和对阈值敏感的问题。
  • 通过生成无需逐图像调参的精确高分辨率伪标签,提升定位精度。
  • 仅通过图像级别标签和基于注意力的像素采样,实现无类别感知的定位。
  • 通过条件随机场和辅助损失提升鲁棒性和边界对齐能力。
  • 通过新颖的伪标签生成流程,在CUB-200-2011基准上实现SOTA性能。

提出的方法

  • 利用自监督视觉Transformer,从最后一层Transformer的[cls]标记生成注意力图。
  • 选取前四个注意力图及其平均值,形成五个候选图用于对象提议生成。
  • 对五个图中的每一个应用Otsu阈值分割,生成二值掩码,并从每张图像中提取最多n个边界框。
  • 对图像裁剪区域应用高斯模糊,以抑制每个边界框外的背景区域,用于分类器推理。
  • 根据分类器置信度和对应注意力图,选择最佳提议,通过激活像素的顶部n%和底部n%定义前景和背景区域。
  • 使用标准交叉熵损失在生成的伪标签上训练定位头,可选地结合CRF和条件损失以优化边界。

实验结果

研究问题

  • RQ1自监督视觉Transformer生成的注意力图能否用于生成可靠、无类别感知的伪标签,以实现弱监督目标定位?
  • RQ2从多个注意力图中进行受限采样,能否降低基于CAM的定位方法对逐图像阈值选择的依赖?
  • RQ3与现有SOTA的CAM方法相比,该方法在标准基准上是否能提升定位精度?
  • RQ4CRF和条件损失等辅助损失能否增强伪标签的边界对齐能力和鲁棒性?
  • RQ5该方法在多大程度上消除了对人工阈值调参的需求,同时保持或提升定位性能?

主要发现

  • 所提方法在CUB-200-2011数据集上实现了90.9%的平均MaxBoxAccV2得分,优于所有先前的SOTA方法。
  • 在VGG上达到97.0%的MaxBoxAcc,显著超过F-CAM的先前SOTA得分91.5%。
  • 激活分数分布显示前景与背景区域之间有明显分离,无需逐图像阈值化处理。
  • 使用多个注意力图可实现单张图像中多个对象的检测,增强了对部分或多重对象场景的鲁棒性。
  • 引入CRF和条件随机场损失后,即使在伪标签存在噪声的情况下,仍能提升边界对齐能力和特征图鲁棒性。
  • 该方法为无类别感知,仅使用两通道伪标签(前景/背景),简化了训练与推理过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。