[论文解读] Reliability Does Matter: An End-to-End Weakly Supervised Semantic Segmentation Approach
本文提出了一种名为可靠区域挖掘(RRM)的简单而有效的单阶段端到端弱监督语义分割方法,利用图像级别标签从类激活图(CAMs)中挖掘出可靠且高置信度的像素区域。通过使用一种新型的密集能量损失,直接在这些经过修剪的可靠区域上训练分割分支,RRM在Pascal VOC上实现了最先进性能(验证集62.6 mIoU,测试集62.9 mIoU),优于复杂的两阶段方法,并在扩展至两阶段训练时创下新的SOTA纪录(验证集66.3 mIoU,测试集66.5 mIoU)。
Weakly supervised semantic segmentation is a challenging task as it only takes image-level information as supervision for training but produces pixel-level predictions for testing. To address such a challenging task, most recent state-of-the-art approaches propose to adopt two-step solutions, \emph{i.e. } 1) learn to generate pseudo pixel-level masks, and 2) engage FCNs to train the semantic segmentation networks with the pseudo masks. However, the two-step solutions usually employ many bells and whistles in producing high-quality pseudo masks, making this kind of methods complicated and inelegant. In this work, we harness the image-level labels to produce reliable pixel-level annotations and design a fully end-to-end network to learn to predict segmentation maps. Concretely, we firstly leverage an image classification branch to generate class activation maps for the annotated categories, which are further pruned into confident yet tiny object/background regions. Such reliable regions are then directly served as ground-truth labels for the parallel segmentation branch, where a newly designed dense energy loss function is adopted for optimization. Despite its apparent simplicity, our one-step solution achieves competitive mIoU scores (\emph{val}: 62.6, \emph{test}: 62.9) on Pascal VOC compared with those two-step state-of-the-arts. By extending our one-step method to two-step, we get a new state-of-the-art performance on the Pascal VOC (\emph{val}: 66.3, \emph{test}: 66.5).
研究动机与目标
- 解决现有两阶段弱监督语义分割方法中存在的复杂性与不优雅性,这些方法依赖大量辅助组件来生成伪掩码。
- 通过引入一种可靠且最小化的监督策略,改进单阶段方法,避免先前端到端方法中存在的性能差距。
- 证明仅使用图像级别标签即可通过更简单、更直接的训练流程实现高质量的分割。
- 表明从类激活图中挖掘出的微小、高响应区域,相比完整物体或密集伪掩码生成,能提供更优的监督信号。
- 在不使用额外数据或复杂附加功能的前提下,建立图像级别弱监督语义分割的新SOTA性能。
提出的方法
- 该方法采用双分支网络结构:一个分支用于图像分类以生成类激活图(CAMs),另一个并行分支用于像素级预测。
- 从CAMs中,方法识别出高响应、紧凑的区域(通常为微小区域),这些区域对应于物体或背景,因其高激活分数而被视为可靠。
- 利用条件随机场(CRF)对这些可靠区域进行进一步优化,以去除噪声并提高定位精度。
- 将经过修剪的可靠区域直接用作分割分支的监督信号,从而替代完整的伪掩码。
- 提出一种新型的密集能量损失,结合像素级交叉熵与正则化项,利用低层次特征(RGB和空间上下文)以提升特征学习能力。
- 通过联合损失函数(结合交叉熵与密集能量损失)对整个网络进行端到端训练,实现仅从图像级别标签直接优化分割性能。
实验结果
研究问题
- RQ1是否能够设计一种单阶段、端到端的弱监督语义分割方法,在不依赖复杂两阶段伪掩码生成流程的前提下,实现具有竞争力的性能?
- RQ2仅从类激活图中挖掘最可靠、高激活响应的区域,是否能比完整物体或密集伪掩码生成带来更好的分割性能?
- RQ3是否一种简单、最小化的监督策略——仅使用少数高置信度像素——能够超越使用大量辅助信号和复杂组件的更复杂方法?
- RQ4所提出的密集能量损失通过引入低层次特征,在弱监督设置下相比标准交叉熵损失,如何提升分割质量?
- RQ5所提出的单阶段方法是否可扩展为两阶段框架以进一步提升性能?其是否实现了新的SOTA结果?
主要发现
- 单阶段RRM方法在Pascal VOC验证集上达到62.6 mIoU,测试集上达到62.9 mIoU,优于现有端到端方法(如EM-Adapt),并为单阶段方法设立了新的SOTA纪录。
- 当扩展为使用相同RRM网络生成伪掩码的两阶段框架时,方法在验证集上达到66.3 mIoU,测试集上达到66.5 mIoU,超越了此前的SOTA方法(FickleNet为64.9/65.3)和AffinityNet,且未使用额外数据或辅助信号。
- 该方法优于AffinityNet(后者使用三个独立的DNN和ResNet-38,其主干网络强于ResNet-101),证明了RRM设计在单一端到端网络中的有效性。
- 定性结果表明,RRM生成的分割结果比EM-Adapt更精确且边界感知更强,尤其在小尺寸和复杂物体上表现更优。
- 消融实验验证了密集能量损失通过利用低层次特征显著提升了性能,且CRF优化进一步增强了挖掘区域的可靠性。
- 与当前两阶段SOTA方法相比,该方法更为简洁优雅,后者依赖于目标提议、显著性图或多个网络,而本方法以更少的组件实现了更优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。