Skip to main content
QUICK REVIEW

[论文解读] A Simple Baseline for Semi-supervised Semantic Segmentation with Strong Data Augmentation

Jianlong Yuan, Yifan Liu|arXiv (Cornell University)|Apr 15, 2021
Advanced Neural Network Applications参考文献 42被引用 7
一句话总结

本文提出了一种简单但高效的半监督语义分割框架,通过利用强数据增强和一种新型的特定分布批量归一化(DSBN),在由增强引起的分布偏移下稳定训练过程。此外,还引入了一种自校正损失(SCL)以减轻教师模型生成的噪声伪标签的影响,仅使用少量标注数据即在Cityscapes和Pascal VOC数据集上取得了最先进性能。

ABSTRACT

Recently, significant progress has been made on semantic segmentation. However, the success of supervised semantic segmentation typically relies on a large amount of labelled data, which is time-consuming and costly to obtain. Inspired by the success of semi-supervised learning methods in image classification, here we propose a simple yet effective semi-supervised learning framework for semantic segmentation. We demonstrate that the devil is in the details: a set of simple design and training techniques can collectively improve the performance of semi-supervised semantic segmentation significantly. Previous works [3, 27] fail to employ strong augmentation in pseudo label learning efficiently, as the large distribution change caused by strong augmentation harms the batch normalisation statistics. We design a new batch normalisation, namely distribution-specific batch normalisation (DSBN) to address this problem and demonstrate the importance of strong augmentation for semantic segmentation. Moreover, we design a self correction loss which is effective in noise resistance. We conduct a series of ablation studies to show the effectiveness of each component. Our method achieves state-of-the-art results in the semi-supervised settings on the Cityscapes and Pascal VOC datasets.

研究动机与目标

  • 通过半监督学习利用未标注数据,以应对语义分割中像素级标注的高昂成本。
  • 解决强数据增强在训练过程中导致批量归一化统计量不稳定的挑战。
  • 减轻自训练中教师模型生成的噪声伪标签对性能的负面影响。
  • 在无需复杂架构或子网络的情况下,实现半监督语义分割的最先进性能。

提出的方法

  • 提出特定分布批量归一化(DSBN),在训练过程中为弱增强和强增强输入分别维护独立的批量统计量。
  • 对未标注数据应用强数据增强(如CutMix、MixUp)以提升泛化能力,同时利用DSBN稳定批量归一化统计量。
  • 引入一种自校正损失(SCL),通过动态调整每个像素的损失权重和学习目标,以抑制噪声预测。
  • 采用标准的学生-教师自训练流程,其中教师模型在增强的未标注数据上生成伪标签,学生模型则从标注数据和伪标签数据中进行学习。
  • 采用迭代训练策略,通过模型更新逐步优化预测,多轮迭代后性能持续提升。
  • 推理阶段使用弱增强数据计算的批量统计量,以保持与训练分布的一致性。

实验结果

研究问题

  • RQ1当强数据增强被合理整合到训练流程中时,是否能显著提升半监督语义分割的性能?
  • RQ2当强增强在小批量中引起显著分布偏移时,如何稳定批量归一化统计量?
  • RQ3自校正损失在多大程度上能减轻自训练中噪声伪标签的负面影响?
  • RQ4仅使用强增强和DSBN的简单框架是否能超越更复杂的架构在半监督语义分割中的表现?

主要发现

  • 在Cityscapes数据集上使用1/8标注数据时,该方法使用DeepLabV2达到70.1% mIoU,使用DeepLabV3Plus达到78.7% mIoU,优于先前最先进方法。
  • 在Pascal VOC数据集上使用1/8标注数据时,该方法使用ResNet-101达到75.0% mIoU,使用Xception-65达到79.3% mIoU,与Xception-65在全监督训练下的性能相当。
  • 消融实验证实DSBN和自校正损失是关键组件,仅使用DSBN即可使mIoU相比基线提升2.9%。
  • 迭代训练进一步提升了性能,但多次迭代后增益逐渐减小,表明模型已趋于收敛。
  • 该方法在不修改网络架构(如不使用多个子网络)的情况下实现了最先进结果,证明了简单而合理的设计选择的有效性。
  • 该框架对标签噪声具有鲁棒性,并在不同数据集间展现出良好的泛化能力,验证了DSBN和SCL在真实半监督场景中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。