[论文解读] Towards Single Stage Weakly Supervised Semantic Segmentation
该论文提出了一种单阶段弱监督语义分割方法,仅使用点标注即可生成可靠的伪掩码,无需预训练主干网络或多阶段优化。通过迭代散射和随机游走引入点斑块,并利用扩展距离场进行空间精确的特征优化,该方法在基准数据集(Pascal VOC 2012)和真实世界数据集(CRAID、CityPersons、IAD)上均取得了最先进性能,显著优于先前的SOTA方法。
The costly process of obtaining semantic segmentation labels has driven research towards weakly supervised semantic segmentation (WSSS) methods, using only image-level, point, or box labels. The lack of dense scene representation requires methods to increase complexity to obtain additional semantic information about the scene, often done through multiple stages of training and refinement. Current state-of-the-art (SOTA) models leverage image-level labels to produce class activation maps (CAMs) which go through multiple stages of refinement before they are thresholded to make pseudo-masks for supervision. The multi-stage approach is computationally expensive, and dependency on image-level labels for CAMs generation lacks generalizability to more complex scenes. In contrary, our method offers a single-stage approach generalizable to arbitrary dataset, that is trainable from scratch, without any dependency on pre-trained backbones, classification, or separate refinement tasks. We utilize point annotations to generate reliable, on-the-fly pseudo-masks through refined and filtered features. While our method requires point annotations that are only slightly more expensive than image-level annotations, we are to demonstrate SOTA performance on benchmark datasets (PascalVOC 2012), as well as significantly outperform other SOTA WSSS methods on recent real-world datasets (CRAID, CityPersons, IAD).
研究动机与目标
- 解决依赖昂贵训练流程和预训练主干网络的多阶段弱监督语义分割方法的局限性。
- 降低对图像级标签的依赖,因为图像级标签会产生噪声较大的类激活图,并在小物体或大量物体的复杂场景中失效。
- 实现在非基准、真实世界数据集上的有效语义分割,这些数据集通常缺乏或无法使用预训练模型。
- 开发一种可泛化的、可从零开始训练的方法,仅需比图像级标签略贵的点标注。
提出的方法
- 一个点生成器组件通过迭代仿射扰动和随机游走,将稀疏的用户定义点转化为密集可靠的伪掩码。
- 点斑块被用作空间监督信号以指导特征学习,从而替代图像级标签或预训练分类器的需求。
- 引入扩展距离场以通过图像中传播特征置信度来增强空间定位能力,从而提升伪掩码质量。
- 该方法采用PAC Refiner模块,根据点斑块的接近程度对特征进行优化,提升分割精度。
- 所有组件均在一个阶段内端到端训练,无需单独的预训练或优化阶段,支持从零开始训练。
- 该方法通过依赖基于点的空间引导,避免对预训练主干网络的依赖,使其适用于任意数据集。
实验结果
研究问题
- RQ1是否可以设计一种单阶段弱监督语义分割方法,在不依赖预训练主干网络或多阶段优化的情况下实现SOTA性能?
- RQ2在复杂真实场景中,点标注与图像级标注相比,在实现准确伪掩码生成方面表现如何?
- RQ3与标准CAM方法相比,扩展距离场和点斑块在提升定位和分割性能方面有多大改善?
- RQ4一种仅使用点标注从零开始训练的方法,能否在预训练模型失效或不可用的数据集上实现有效泛化?
- RQ5在物体数量多且尺寸小的数据集中,该方法在图像级标签方法表现困难的情况下,性能如何?
主要发现
- 在Pascal VOC 2012数据集上,所提方法在测试集上达到72.1%的mIoU,优于SOTA单阶段方法[7]的0.3%,且未使用预训练主干网络。
- 在CRAID数据集上,该方法达到72.1%的mIoU,显著优于SOTA基线方法[7]在相同评估协议下仅54.9%的得分。
- 在CityPersons数据集上,该方法达到62.8%的mIoU,较SOTA基线[7]高出14.6个百分点,证明其在小物体密集场景中的强大泛化能力。
- 在IAD数据集上,该方法达到72.4%的mIoU,再次超越[7]14.8个百分点,证实其在真实世界复杂场景中的有效性。
- 消融实验表明,结合扩展距离场、点斑块和PAC Refiner可达到60.7%的mIoU,证实所有组件对最优性能均不可或缺。
- 该方法在所有基准和真实世界数据集上均取得SOTA结果,且支持从零开始训练,完全消除了对预训练模型的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。