[论文解读] Self-supervised Image-specific Prototype Exploration for Weakly Supervised Semantic Segmentation
该论文提出了一种自监督图像特定原型探索(Self-supervised Image-specific Prototype Exploration, SIPE)框架,仅使用图像级别标签即可实现弱监督语义分割。SIPE通过结构感知种子定位和背景感知原型建模,引入图像特定原型探索(Image-specific Prototype Exploration, IPE),生成图像特定激活图(IS-CAM)。同时,通过通用-特定一致性(General-Specific Consistency, GSC)损失,将通用CAM与IS-CAM对齐,实现特征学习的自监督。该方法在PASCAL VOC 2012和MS COCO 2014数据集上均达到最先进性能,mIoU分别达到58.6%和53.2%。
Weakly Supervised Semantic Segmentation (WSSS) based on image-level labels has attracted much attention due to low annotation costs. Existing methods often rely on Class Activation Mapping (CAM) that measures the correlation between image pixels and classifier weight. However, the classifier focuses only on the discriminative regions while ignoring other useful information in each image, resulting in incomplete localization maps. To address this issue, we propose a Self-supervised Image-specific Prototype Exploration (SIPE) that consists of an Image-specific Prototype Exploration (IPE) and a General-Specific Consistency (GSC) loss. Specifically, IPE tailors prototypes for every image to capture complete regions, formed our Image-Specific CAM (IS-CAM), which is realized by two sequential steps. In addition, GSC is proposed to construct the consistency of general CAM and our specific IS-CAM, which further optimizes the feature representation and empowers a self-correction ability of prototype exploration. Extensive experiments are conducted on PASCAL VOC 2012 and MS COCO 2014 segmentation benchmark and results show our SIPE achieves new state-of-the-art performance using only image-level labels. The code is available at https://github.com/chenqi1126/SIPE.
研究动机与目标
- 为解决弱监督语义分割中类激活映射(CAM)的局限性,即仅关注判别性区域而忽略更完整的物体结构。
- 通过学习图像特定原型,捕获每个物体更具代表性与完整性的区域,提升定位的完整性。
- 通过通用CAM与图像特定IS-CAM之间的自监督一致性损失,增强特征表示能力。
- 开发一种仅使用图像级别标注即可实现最先进性能的框架,减少对昂贵像素级标注的依赖。
提出的方法
- 图像特定原型探索(IPE)分两步执行:首先,通过像素间语义关系实现结构感知种子定位,识别出稳健且空间一致的区域;其次,基于这些种子形成图像特定原型,计算其与特征的原型相关性。
- 引入背景感知原型建模,以捕捉非判别性但具有信息量的背景线索,提升定位的鲁棒性。
- 通用-特定一致性(GSC)损失通过强制对齐通用CAM(由分类器权重生成)与图像特定IS-CAM,提供自监督信号以优化特征表示。
- 框架利用层次化特征更好地建模前景与背景,其中背景原型建模提升了伪标签的质量。
- 伪标签通过阈值化或估计的背景图生成,当结合层次化特征与BPM时,基于估计的伪标签优于阈值化方法。
- 模型通过自监督一致性目标端到端训练,实现无需像素级监督的定位图迭代优化。
实验结果
研究问题
- RQ1与基于类别中心的CAM相比,图像特定原型是否能提升弱监督语义分割中的定位完整性?
- RQ2结构感知种子定位在识别代表性物体区域方面,为何优于固定阈值或argmax-based种子选择方法?
- RQ3背景感知原型建模在多大程度上增强了特征表示并减少了定位中的误报?
- RQ4通用CAM与IS-CAM之间的自监督一致性损失是否能提升特征质量与分割精度?
- RQ5结合层次化特征与背景原型建模,是否能生成比仅使用低层特征更优的伪标签?
主要发现
- SIPE在仅使用图像级别标签的前提下,在PASCAL VOC 2012基准上实现了新的最先进mIoU(58.6%)。
- 通过图像特定原型生成的IS-CAM相比标准CAM在mIoU上提升了2.1%,证明了其在定位完整性方面的优势。
- 与仅使用IS-CAM相比,通用-特定一致性(GSC)损失使mIoU提升了5.4%,表明其在自监督特征优化中的有效性。
- 消融实验表明,结合层次化特征与背景原型建模(BPM)可获得最高性能,且基于估计的伪标签优于基于阈值的伪标签。
- 结构感知种子定位在所有设置中均优于固定阈值与argmax方法,最佳结果达到53.3% mIoU,而本文方法达到58.6%。
- 可视化结果表明,IS-CAM能激活更完整的物体区域,并产生比CAM更清晰的背景激活,尤其在结合GSC训练时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。