Skip to main content
QUICK REVIEW

[论文解读] Non-Salient Region Object Mining for Weakly Supervised Semantic Segmentation

Yazhou Yao, Tao Chen|arXiv (Cornell University)|Mar 26, 2021
Visual Attention and Saliency Detection参考文献 60被引用 17
一句话总结

本文提出了一种基于图像级标签的弱监督语义分割方法,用于挖掘非显著区域中的目标。该方法引入了一种基于图的全局推理单元,以捕捉长距离依赖关系并增强非显著区域的激活,同时结合潜在目标挖掘模块以减少假阴性伪标签,并设计了非显著区域掩码模块以处理复杂图像,最终在PASCAL VOC 2012数据集上实现了最先进性能。

ABSTRACT

Semantic segmentation aims to classify every pixel of an input image. Considering the difficulty of acquiring dense labels, researchers have recently been resorting to weak labels to alleviate the annotation burden of segmentation. However, existing works mainly concentrate on expanding the seed of pseudo labels within the image's salient region. In this work, we propose a non-salient region object mining approach for weakly supervised semantic segmentation. We introduce a graph-based global reasoning unit to strengthen the classification network's ability to capture global relations among disjoint and distant regions. This helps the network activate the object features outside the salient area. To further mine the non-salient region objects, we propose to exert the segmentation network's self-correction ability. Specifically, a potential object mining module is proposed to reduce the false-negative rate in pseudo labels. Moreover, we propose a non-salient region masking module for complex images to generate masked pseudo labels. Our non-salient region masking module helps further discover the objects in the non-salient region. Extensive experiments on the PASCAL VOC dataset demonstrate state-of-the-art results compared to current methods.

研究动机与目标

  • 解决现有弱监督语义分割方法主要关注显著区域而忽略非显著区域中目标的局限性。
  • 通过减少显著区域以外区域的假阴性伪标签率,提升伪标签质量。
  • 通过全局上下文建模增强分割网络在分散或边缘定位区域中发现和定位目标的能力。
  • 通过生成掩码伪标签以增强复杂图像中分割网络的自校正能力。
  • 仅使用图像级标注在PASCAL VOC 2012基准上实现最先进性能。

提出的方法

  • 引入基于图的全局推理单元,建模分离且遥远区域之间的长距离依赖关系,提升非显著区域的激活。
  • 提出潜在目标挖掘模块,利用朴素类激活图(CAMs)恢复被显著图遗漏的目标区域,减少假阴性伪标签。
  • 设计非显著区域掩码模块,对复杂图像的伪标签中非显著区域进行选择性掩码,保留目标边界并增强自校正能力。
  • 根据类别数量将训练图像划分为简单和复杂两类,对不同图像集应用不同的伪标签生成策略以优化性能。
  • 在掩码模块中使用空洞卷积操作,以保留目标周围的背景上下文,辅助边界学习。
  • 采用ResNet作为主干网络,并联合训练分类与分割网络,使用优化后的伪标签。

实验结果

研究问题

  • RQ1全局推理机制是否能提升在显著图失效的非显著、分散区域中的目标特征激活?
  • RQ2如何在不完全依赖显著图的前提下减少非显著区域中的假阴性伪标签?
  • RQ3在复杂图像中对非显著区域进行掩码处理是否能增强分割网络的自校正能力与目标发现能力?
  • RQ4在所提模块中,空洞卷积核大小与特征节点数量的最佳配置为何,才能实现鲁棒性能?
  • RQ5结合全局推理、伪标签优化与掩码机制的统一框架是否能在弱监督设置下实现最先进性能?

主要发现

  • 所提方法在PASCAL VOC 2012验证集上达到70.4%的平均交并比(mIoU),优于现有最先进方法。
  • 消融实验表明,在复杂图像中对非显著区域进行掩码处理可使性能提升0.4%,凸显所提掩码策略的有效性。
  • 非显著区域掩码模块(NSRM)在空洞卷积核大小r = 30时达到最优性能,兼顾背景保留与边界清晰度。
  • 在基于图的全局推理单元中使用64个特征节点时性能最佳,超过该值后收益递减。
  • 移除目标扩展操作导致性能下降0.2%,表明其在优化显著区域预测中的有效性。
  • 该方法成功识别并分割了传统方法失效的非显著区域中的目标(如角落中的盆栽植物),如定性对比所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。