Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Scale Equivariant Network for Weakly Supervised Semantic Segmentation

Yude Wang, Jie Zhang|arXiv (Cornell University)|Sep 9, 2019
Advanced Neural Network Applications参考文献 28被引用 22
一句话总结

该论文提出了一种自监督尺度等变网络(SSENet),通过一种新颖的正则化损失函数在类激活图(CAMs)中强制实现尺度等变性,从而提升仅使用图像级别标签的弱监督语义分割性能。通过确保不同图像尺度下CAM的一致性,SSENet减少了过度激活和激活不足的问题,在仅使用图像级别标签的情况下,于PASCAL VOC 2012数据集上取得了最先进性能。

ABSTRACT

Weakly supervised semantic segmentation has attracted much research interest in recent years considering its advantage of low labeling cost. Most of the advanced algorithms follow the design principle that expands and constrains the seed regions from class activation maps (CAM). As well-known, conventional CAM tends to be incomplete or over-activated due to weak supervision. Fortunately, we find that semantic segmentation has a characteristic of spatial transformation equivariance, which can form a few self-supervisions to help weakly supervised learning. This work mainly explores the advantages of scale equivariant constrains for CAM generation, formulated as a self-supervised scale equivariant network (SSENet). Specifically, a novel scale equivariant regularization is elaborately designed to ensure consistency of CAMs from the same input image with different resolutions. This novel scale equivariant regularization can guide the whole network to learn more accurate class activation. This regularized CAM can be embedded in most recent advanced weakly supervised semantic segmentation framework. Extensive experiments on PASCAL VOC 2012 datasets demonstrate that our method achieves the state-of-the-art performance both quantitatively and qualitatively for weakly supervised semantic segmentation. Code has been made available.

研究动机与目标

  • 解决不同图像尺度下类激活图(CAMs)不一致的问题,该问题会降低弱监督语义分割的性能。
  • 探索自监督学习作为提升CAM质量的手段,而无需额外标注。
  • 开发一种正则化方法,强制CAM在尺度变换下保持等变性,确保在尺度增强输入下激活模式的一致性。
  • 将所提方法集成到现有弱监督分割框架中以提升性能。
  • 在仅使用图像级别监督的情况下,于PASCAL VOC 2012数据集上实现最先进结果。

提出的方法

  • 提出一种双分支网络架构,通过在多个尺度处理同一张图像,以实现尺度等变性。
  • 引入尺度等变正则化(SER)损失,通过空间变换后最小化同一图像在不同分辨率下的CAM差异。
  • 对输入图像应用空间变换(如缩放),并使用逆向插值对齐CAM以提供监督信号。
  • 将正则化后的CAM作为伪分割标签,集成到标准弱监督语义分割流程中。
  • 将方法嵌入到如AffinityNet和ResNet-38主干网络的DeepLab等最先进框架中。
  • 通过利用尺度一致性作为监督信号,采用自监督学习范式,避免依赖额外标注。

实验结果

研究问题

  • RQ1在类激活图中强制实现尺度等变性是否能提升弱监督语义分割中伪分割标签的质量?
  • RQ2尺度等变正则化如何减少不同图像尺度下CAM的过度激活与激活不足?
  • RQ3自监督的尺度一致性能否作为图像级别弱监督学习的有效归纳偏置?
  • RQ4与使用更强监督信号的方法相比,该方法在分割性能上的提升程度如何?
  • RQ5该方法在不同主干网络架构和分割框架上是否具备良好的泛化能力?

主要发现

  • SSENet在PASCAL VOC 2012测试集上实现了64.9%的平均交并比(mIoU),优于基线方法AffinityNet及其他最先进方法。
  • 由于CAM的一致性增强,该方法在各尺度下显著减少了误报区域(m_FP),并提升了真正例覆盖度(m_FN),尤其在大物体上表现更优。
  • 定量分析显示,尺度等变正则化显著降低了小物体的过度激活与大物体的激活不足,体现在m_FP与m_FN曲线的改善上。
  • 尽管仅使用图像级别标签,SSENet在性能上仍可与使用更强监督信号(如边界框、草图或点)的方法相媲美。
  • 消融研究证实,SER损失是性能提升的主要驱动力,更优的CAM带来了更高质量的伪标签用于分割训练。
  • 该方法可即插即用,无需修改网络架构即可增强现有弱监督框架的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。