Skip to main content
QUICK REVIEW

[论文解读] Dynamic Feature Regularized Loss for Weakly Supervised Semantic Segmentation

Bingfeng Zhang, Jimin Xiao|arXiv (Cornell University)|Aug 3, 2021
Advanced Neural Network Applications参考文献 40被引用 12
一句话总结

本文提出了一种用于使用涂抹标注进行弱监督语义分割的动态特征正则化(DFR)损失,结合了静态浅层特征(RGB、空间位置)与来自视觉变换器主干网络和特征一致性头的动态更新深层特征。该方法在端到端训练中实现了最先进性能,mIoU相比之前的方法提升了6.1%,且无需后处理或额外数据集。

ABSTRACT

We focus on tackling weakly supervised semantic segmentation with scribble-level annotation. The regularized loss has been proven to be an effective solution for this task. However, most existing regularized losses only leverage static shallow features (color, spatial information) to compute the regularized kernel, which limits its final performance since such static shallow features fail to describe pair-wise pixel relationship in complicated cases. In this paper, we propose a new regularized loss which utilizes both shallow and deep features that are dynamically updated in order to aggregate sufficient information to represent the relationship of different pixels. Moreover, in order to provide accurate deep features, we adopt vision transformer as the backbone and design a feature consistency head to train the pair-wise feature relationship. Unlike most approaches that adopt multi-stage training strategy with many bells and whistles, our approach can be directly trained in an end-to-end manner, in which the feature consistency head and our regularized loss can benefit from each other. Extensive experiments show that our approach achieves new state-of-the-art performances, outperforming other approaches by a significant margin with more than 6\% mIoU increase.

研究动机与目标

  • 解决现有正则化损失仅依赖静态浅层特征(如颜色和空间位置)的局限性,这些特征在复杂场景中无法准确捕捉像素间的语义关系。
  • 通过整合在训练过程中动态演化的深层特征,克服浅层特征在相似颜色、相邻物体等模糊情况下的泛化能力差的问题。
  • 通过联合优化语义分割头和特征一致性头,实现无需多阶段流程或外部数据集的端到端训练。
  • 通过利用置信度预测作为监督信号,强制同一类别像素的特征一致性,同时拉大不同类别之间的距离,从而提升特征可分性。
  • 在PASCAL VOC 2012上实现最先进性能,使用涂抹标注监督,超越先前方法,且无需后处理。

提出的方法

  • 提出一种新的正则化损失函数——DFR损失,其核函数同时基于静态浅层特征(RGB和空间位置)与来自特征一致性头的动态深层特征。
  • 引入一个特征一致性头,通过使用分割头输出的置信度预测作为监督信号,最小化同一语义类别像素之间的L2距离,同时最大化不同类别像素之间的距离。
  • 使用视觉变换器主干网络提取全局、高层级表示,以支持可区分深层特征的学习。
  • 实现语义分割头与特征一致性头之间的相互增强:准确的分割提升特征质量,而更优的特征通过DFR损失进一步提升分割性能。
  • 将DFR损失的计算限制在局部感受野内,以保持计算效率,同时通过视觉变换器保留全局上下文信息。
  • 在无需多阶段训练、后处理(如密集CRF)或外部数据集的情况下,实现整个模型的端到端训练。

实验结果

研究问题

  • RQ1与仅使用静态浅层特征相比,动态深层特征是否能提升正则化损失在弱监督语义分割中的准确性?
  • RQ2分割头与特征一致性头之间的联合训练策略是否能带来更优的特征表示和分割性能?
  • RQ3分割头输出的置信度预测能否作为有效监督信号,用于学习无像素级真实标签的可区分深层特征?
  • RQ4将视觉变换器主干网络不同阶段的深层特征进行融合,如何影响最终的分割性能?
  • RQ5所提方法是否能在单阶段、端到端训练流程中实现最先进性能,且不依赖外部数据集或后处理?

主要发现

  • 所提出的DFR损失结合浅层特征与动态深层特征,在PASCAL VOC 2012验证集上达到81.5%的mIoU,相比之前最先进方法提升6.1%。
  • 仅使用深层特征(不使用特征一致性头)即可将性能从80.8%提升至81.0%,表明深层特征即使无显式一致性监督,也能产生积极影响。
  • 特征一致性头显著提升性能:仅使用真实涂抹标注作为监督时,mIoU为80.6%;而使用分割头输出的置信度预测(M)作为监督时,mIoU提升至81.5%。
  • 融合视觉变换器主干网络多个块(Block-1至Block-4)的特征可获得最佳性能(81.5%),表明多尺度表示对准确建模像素间关系至关重要。
  • 同时使用真实标签与置信度预测(M)会损害性能(mIoU为81.1%),表明M中噪声预测可能引入错误的负样本对,从而降低训练质量。
  • 消融实验确认RGB特征至关重要——若移除RGB特征,mIoU从81.5%降至72.8%,凸显颜色信息在正则化核中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。