Skip to main content
QUICK REVIEW

[论文解读] Background-Aware Pooling and Noise-Aware Loss for Weakly-Supervised Semantic Segmentation

Youngmin Oh, Beom‐Jun Kim|arXiv (Cornell University)|Apr 2, 2021
Advanced Neural Network Applications参考文献 15被引用 5
一句话总结

该论文提出了一种背景感知池化(BAP)和噪声感知损失(NAL)方法,用于仅使用目标边界框标注的弱监督语义分割。BAP通过利用感知上一致的背景区域来区分前景与背景,增强边界框内的特征聚合,从而生成高质量的伪分割标签;NAL通过基于特征距离置信度自适应加权交叉熵损失,降低模型对噪声标签的敏感性。该方法在PASCAL VOC 2012数据集上实现了最先进性能,仅使用边界框标注即达到69.4%的mIoU(测试集)。

ABSTRACT

We address the problem of weakly-supervised semantic segmentation (WSSS) using bounding box annotations. Although object bounding boxes are good indicators to segment corresponding objects, they do not specify object boundaries, making it hard to train convolutional neural networks (CNNs) for semantic segmentation. We find that background regions are perceptually consistent in part within an image, and this can be leveraged to discriminate foreground and background regions inside object bounding boxes. To implement this idea, we propose a novel pooling method, dubbed background-aware pooling (BAP), that focuses more on aggregating foreground features inside the bounding boxes using attention maps. This allows to extract high-quality pseudo segmentation labels to train CNNs for semantic segmentation, but the labels still contain noise especially at object boundaries. To address this problem, we also introduce a noise-aware loss (NAL) that makes the networks less susceptible to incorrect labels. Experimental results demonstrate that learning with our pseudo labels already outperforms state-of-the-art weakly- and semi-supervised methods on the PASCAL VOC 2012 dataset, and the NAL further boosts the performance.

研究动机与目标

  • 解决仅使用缺乏边界信息的物体边界框进行弱监督时,生成准确像素级伪标签的挑战。
  • 通过利用边界框内背景区域的感知一致性,提升伪分割标签的质量,以更好地区分前景与背景。
  • 减少训练过程中噪声伪标签对深度学习模型在语义分割任务中的负面影响。
  • 仅使用边界框标注,在弱监督与半监督语义分割基准上实现最先进性能。

提出的方法

  • 提出背景感知池化(BAP),通过学习的注意力图基于感知一致性识别物体边界框内的背景区域,从而实现更优的前景特征聚合。
  • 利用BAP生成的注意力图来优化类激活图(CAM),生成比标准全局平均池化(GAP)更精确的伪真实分割标签。
  • 提出一种噪声感知损失(NAL),通过基于特征嵌入与分类器权重之间L2距离的置信图,自适应地计算交叉熵损失。
  • 将置信图应用于降低不确定或噪声预测的损失贡献,使网络对错误伪标签更具鲁棒性。
  • 采用两阶段训练流程:首先使用BAP训练分类器以生成伪标签;其次使用NAL和这些伪标签训练分割网络。
  • 采用标准分割架构(如DeepLab、UPerNet),通过生成的伪标签与NAL进行微调,以提升性能。
(a) Input image.
(a) Input image.

实验结果

研究问题

  • RQ1能否利用物体边界框内背景区域的感知一致性,改善弱监督语义分割中的前景特征定位?
  • RQ2像BAP这样的新型池化机制能否在边界框监督下生成更高质量的伪分割标签,优于标准全局平均池化(GAP)?
  • RQ3能否通过考虑预测不确定性的自适应损失函数,减轻噪声伪标签在训练过程中的负面影响?
  • RQ4结合BAP与NAL是否能在弱监督语义分割基准上实现最先进性能?

主要发现

  • 所提出的BAP方法仅使用边界框标注,即在PASCAL VOC 2012测试集上达到68.1%的mIoU,优于先前最先进方法。
  • 当与噪声感知损失(NAL)结合使用时,该方法在PASCAL VOC 2012测试集上达到69.4%的mIoU,创下弱监督语义分割的新SOTA纪录。
  • 在同一基准上,当使用9K个边界框与1K个掩码标注进行训练时,该方法达到71.5%的mIoU,超越了该设置下先前的SOTA方法。
  • 该方法在实例分割任务上也表现出良好泛化能力:使用生成伪标签进行训练的Mask R-CNN在MS-COCO数据集上达到22.2%的AP,优于先前的弱监督方法。
  • 消融实验证实,BAP与NAL均对性能提升有显著贡献,其中NAL展现出强噪声鲁棒性。
  • 该方法表现出优越的泛化能力:在VOC到COCO数据上训练的模型性能优于在COCO到COCO数据上训练的模型,凸显了伪标签的高质量。
(b) Ground truth.
(b) Ground truth.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。