[论文解读] Class Re-Activation Maps for Weakly-Supervised Semantic Segmentation
本文提出 ReCAM,一种简单而有效的方法,通过使用软最大交叉熵(SCE)损失而非二元交叉熵(BCE)损失来重新激活类激活图(CAMs),从而提升弱监督语义分割的性能。通过在收敛的BCE训练模型上,使用SCE损失对CAM提取的特征进行微调,ReCAM有效减少了误报和漏检,以极低的计算开销实现了最先进性能,并可即插即用地适配各类CAM变体。
Extracting class activation maps (CAM) is arguably the most standard step of generating pseudo masks for weakly-supervised semantic segmentation (WSSS). Yet, we find that the crux of the unsatisfactory pseudo masks is the binary cross-entropy loss (BCE) widely used in CAM. Specifically, due to the sum-over-class pooling nature of BCE, each pixel in CAM may be responsive to multiple classes co-occurring in the same receptive field. As a result, given a class, its hot CAM pixels may wrongly invade the area belonging to other classes, or the non-hot ones may be actually a part of the class. To this end, we introduce an embarrassingly simple yet surprisingly effective method: Reactivating the converged CAM with BCE by using softmax cross-entropy loss (SCE), dubbed extbf{ReCAM}. Given an image, we use CAM to extract the feature pixels of each single class, and use them with the class label to learn another fully-connected layer (after the backbone) with SCE. Once converged, we extract ReCAM in the same way as in CAM. Thanks to the contrastive nature of SCE, the pixel response is disentangled into different classes and hence less mask ambiguity is expected. The evaluation on both PASCAL VOC and MS~COCO shows that ReCAM not only generates high-quality masks, but also supports plug-and-play in any CAM variant with little overhead.
研究动机与目标
- 为解决传统CAM在弱监督语义分割(WSSS)中因二元交叉熵(BCE)损失的局限性而生成的伪掩码质量差的问题。
- 探究在CAM生成过程中,将BCE替换为软最大交叉熵(SCE)损失是否能减少类别混淆并提升掩码精度。
- 开发一种即插即用的方法,以极低计算成本增强任意现有CAM-based WSSS流水线。
- 通过实证验证,SCE-based重新激活能够解耦类别响应,并在标准基准上提升mIoU。
提出的方法
- 在使用BCE损失训练多标签分类器后,ReCAM从最后一层卷积层提取类特定特征图(CAMs)。
- 对于每张图像及其标注类别,ReCAM提取对应类别的CAM像素,并将其作为支持特征。
- 在这些支持特征上使用SCE损失与对应类别标签训练一个新的全连接层,从而对该类别实现有效重新激活。
- 由此重新训练层生成的激活图称为ReCAM,其受益于SCE的类别独占学习与对比正则化。
- ReCAM以即插即用方式应用于任意CAM变体,推理开销极低。
- 该方法在有无额外精炼模块(如IRN、AdvCAM)的情况下均进行了评估,验证了其通用性与高效性。
实验结果
研究问题
- RQ1在弱监督语义分割中,将CAM生成过程中的BCE替换为SCE损失,是否能减少误报和漏检像素?
- RQ2仅通过在BCE训练的CAM特征上使用SCE进行简单重新激活,是否能在不改变网络结构的前提下显著提升伪掩码质量?
- RQ3ReCAM对超参数(如损失平衡权重λ)的敏感度如何?
- RQ4ReCAM在不同主干网络架构和分割模型上是否能保持性能增益?
- RQ5ReCAM能否与现有精炼方法(如IRN或AdvCAM)有效结合,并进一步提升其性能?
主要发现
- 在PASCAL VOC 2012验证集上,ReCAM相比原始CAM实现6%的mIoU提升,其中UperNet-Swin上提升6.1%,DeepLabV2上提升4.7%。
- 在MS COCO数据集上,ReCAM相比基线CAM实现5.5%的mIoU提升,表明其在不同数据集上均具有一致性增益。
- ReCAM对超参数λ具有鲁棒性,最优性能出现在λ=1,其他取值下性能下降极小,表明其对超参数不敏感。
- 与IRN结合时,ReCAM在VOC上达到70.9%的mIoU,较AdvCAM高出1%,且比AdvCAM快160倍,比IRN单独使用快8.2倍。
- ReCAM在单类别与多类别图像上均保持优异性能,分别有效减少误报与漏检。
- ReCAM支持与基于显著性方法的即插即用集成,在VOC上分别实现71.6% mIoU(EPS*)与72.2% mIoU(EDAM*),优于所有基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。