[论文解读] Uncertainty Estimation via Response Scaling for Pseudo-mask Noise Mitigation in Weakly-supervised Semantic Segmentation
该论文提出URM(基于响应缩放的不确定性估计以抑制噪声),一种新颖方法,通过多尺度响应图缩放估计不确定性,以减少弱监督语义分割中伪掩码的噪声。通过利用不确定性重新加权分割损失,URN在PASCAL VOC 2012上达到71.2%的mIoU,在MS COCO 2014上达到41.5%的mIoU,且无需额外模型或标注,性能达到当前最先进水平。
Weakly-Supervised Semantic Segmentation (WSSS) segments objects without a heavy burden of dense annotation. While as a price, generated pseudo-masks exist obvious noisy pixels, which result in sub-optimal segmentation models trained over these pseudo-masks. But rare studies notice or work on this problem, even these noisy pixels are inevitable after their improvements on pseudo-mask. So we try to improve WSSS in the aspect of noise mitigation. And we observe that many noisy pixels are of high confidence, especially when the response range is too wide or narrow, presenting an uncertain status. Thus, in this paper, we simulate noisy variations of response by scaling the prediction map multiple times for uncertainty estimation. The uncertainty is then used to weight the segmentation loss to mitigate noisy supervision signals. We call this method URN, abbreviated from Uncertainty estimation via Response scaling for Noise mitigation. Experiments validate the benefits of URN, and our method achieves state-of-the-art results at 71.2% and 41.5% on PASCAL VOC 2012 and MS COCO 2014 respectively, without extra models like saliency detection. Code is available at https://github.com/XMed-Lab/URN.
研究动机与目标
- 为解决弱监督语义分割(WSSS)中伪掩码内噪声像素的持续性问题,特别是因响应尺度不当时产生的高置信度噪声。
- 识别出假阳性和漏检阳性分别与响应范围过宽或过窄系统相关,这些现象反映了不确定性。
- 提出一种基于响应缩放的新型不确定性估计机制,通过模拟激活尺度的变化来检测噪声像素。
- 通过使用估计的不确定性重新加权分割损失,减轻噪声影响,提升模型鲁棒性。
- 在不依赖显著性检测器等辅助模型的前提下,实现在标准基准上的最先进性能。
提出的方法
- 通过生成分割响应图的多个缩放版本,模拟激活范围的变化,以逼近不同的响应尺度。
- 对每张图像,通过多种因子(如乘法缩放)对响应图进行缩放,生成多样的激活模式。
- 在缩放后的响应图上应用密集CRF,以优化伪掩码输出,再进行不确定性估计。
- 不确定性通过多个缩放响应图之间的方差计算得出,捕捉像素级别的不稳定性,反映噪声。
- 对不确定性图进行归一化后,作为可学习的损失权重,降低高不确定性(噪声)像素在优化过程中的贡献。
- 通过将不确定性加权损失与原始损失相乘,应用重加权策略,最小化噪声监督的影响。
实验结果
研究问题
- RQ1在弱监督语义分割中,如何有效估计伪掩码的不确定性,尤其是在高置信度预测中出现噪声时?
- RQ2响应尺度变化在多大程度上与伪掩码中的假阳性及漏检阳性相关?
- RQ3通过响应缩放估计的不确定性是否能通过训练过程中的损失重加权提升分割性能?
- RQ4与现有噪声抑制策略相比,所提出的URN方法在不同骨干网络和数据集上的性能与泛化能力如何?
- RQ5在伪掩码噪声场景下,基于不确定性的损失加权是否优于基于概率的加权策略?
主要发现
- URN在PASCAL VOC 2012验证集上实现了71.2%的mIoU新SOTA结果,相比此前SOTA的70.0%提升了1.2个百分点。
- 在MS COCO 2014上,URN达到41.5%的mIoU,未使用如显著性检测器等额外模型,创下新SOTA记录。
- 该方法在所有测试骨干网络上均提升性能,ResNet-101提升1.4%,ScaleNet-101提升2.9%。
- 消融实验表明,不确定性重加权函数中的阈值t=0.05时性能最优,表明不确定像素仍包含有用信息。
- 使用概率作为损失权重仅在Res2Net-101上达到70.5%的mIoU,而URN达到71.2%,证明不确定性估计在噪声抑制方面优于概率。
- 伪掩码蒸馏在较弱骨干网络上进一步提升1.2–1.8%的性能,证明其在模型部署中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。