[论文解读] Discriminative Region Suppression for Weakly-Supervised Semantic Segmentation
本文提出了一种名为判别区域抑制(Discriminative Region Suppression, DRS)的简单而有效的模块,通过抑制分类网络中稀疏判别区域的注意力,促使激活传播至相邻的非判别区域,从而生成密集的定位图,实现弱监督语义分割。DRS仅引入极少的额外参数,并结合一种称为定位图精炼学习的自增强策略,在仅使用图像级别标签的情况下,于PASCAL VOC 2012数据集上实现了71.4%的mIoU。
Weakly-supervised semantic segmentation (WSSS) using image-level labels has recently attracted much attention for reducing annotation costs. Existing WSSS methods utilize localization maps from the classification network to generate pseudo segmentation labels. However, since localization maps obtained from the classifier focus only on sparse discriminative object regions, it is difficult to generate high-quality segmentation labels. To address this issue, we introduce discriminative region suppression (DRS) module that is a simple yet effective method to expand object activation regions. DRS suppresses the attention on discriminative regions and spreads it to adjacent non-discriminative regions, generating dense localization maps. DRS requires few or no additional parameters and can be plugged into any network. Furthermore, we introduce an additional learning strategy to give a self-enhancement of localization maps, named localization map refinement learning. Benefiting from this refinement learning, localization maps are refined and enhanced by recovering some missing parts or removing noise itself. Due to its simplicity and effectiveness, our approach achieves mIoU 71.4% on the PASCAL VOC 2012 segmentation benchmark using only image-level labels. Extensive experiments demonstrate the effectiveness of our approach. The code is available at https://github.com/qjadud1994/DRS.
研究动机与目标
- 为解决类激活图(CAMs)中稀疏激活的局限性,该局限性限制了弱监督语义分割中高质量伪分割标签的生成。
- 开发一种方法,在不擦除判别部分的前提下扩展物体激活区域,避免基于擦除方法中常见的噪声和假阴性问题。
- 引入一种即插即用的模块,仅需极少或无需额外参数,可集成于任意网络架构中。
- 通过自监督精炼实现定位图的增强,恢复缺失或弱激活区域。
提出的方法
- DRS由三个组件构成:用于在特征图中识别K个主导激活点的最大值提取器、用于为每个点预测抑制权重的抑制控制器,以及根据控制器输出对判别区域减少注意力的抑制器。
- 抑制控制器使用可学习或不可学习机制,控制对每个判别区域的抑制程度,从而促使注意力扩散至邻近的非判别区域。
- 抑制器基于控制器输出实施空间自适应抑制,将激活扩散至整个特征图,生成密集的定位图。
- 引入定位图精炼学习作为自增强策略,使模型能够迭代恢复定位图中缺失或弱激活的区域。
- 该方法兼容任意分类主干网络,无需CRF或多分支网络,支持快速且稳定的训练。
- 从密集定位图生成伪分割标签,并用于训练语义分割网络。
实验结果
研究问题
- RQ1在弱监督语义分割中,通过抑制判别区域而非擦除它们,是否能更有效地、更少引入噪声地扩展物体激活区域?
- RQ2如何设计一种轻量化模块,在不增加显著参数量或架构复杂度的前提下生成密集定位图?
- RQ3定位图的自增强机制是否能通过恢复缺失或弱激活区域来提升分割性能?
- RQ4与最先进方法相比,该方法在mIoU、训练效率和鲁棒性方面表现如何?
主要发现
- DRS在仅使用图像级监督的情况下,于PASCAL VOC 2012测试集上实现了71.4%的mIoU,优于许多现有方法。
- 该方法在性能上与最先进方法(如ICD和OAA)相当,且无需CRF,训练速度更快。
- 定位图精炼学习在不同主干设置下分别将mIoU提升0.6%和0.8%,证明了定位图自增强的有效性。
- 可学习与不可学习版本的控制器性能几乎相同,表明其在实现上具有鲁棒性与灵活性。
- DRS优于基于擦除的方法(如AE-PSL和GAIN),表明抑制策略比完全移除判别部分更有效。
- 该方法与多种分割网络高度兼容,在不同主干网络(包括VGG-16、ResNet-101和DeepLab-ASPP)上均保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。