[论文解读] A Simple Baseline for Semi-supervised Semantic Segmentation with Strong Data Augmentation
本文提出了一种简单但高效的半监督语义分割框架,通过利用强数据增强和一种新型的特定分布批量归一化(DSBN),在由增强引起的分布偏移下稳定训练过程。此外,还引入了一种自校正损失(SCL)以减轻教师模型生成的噪声伪标签的影响,仅使用少量标注数据即在Cityscapes和Pascal VOC数据集上取得了最先进性能。
Recently, significant progress has been made on semantic segmentation. However, the success of supervised semantic segmentation typically relies on a large amount of labelled data, which is time-consuming and costly to obtain. Inspired by the success of semi-supervised learning methods in image classification, here we propose a simple yet effective semi-supervised learning framework for semantic segmentation. We demonstrate that the devil is in the details: a set of simple design and training techniques can collectively improve the performance of semi-supervised semantic segmentation significantly. Previous works [3, 27] fail to employ strong augmentation in pseudo label learning efficiently, as the large distribution change caused by strong augmentation harms the batch normalisation statistics. We design a new batch normalisation, namely distribution-specific batch normalisation (DSBN) to address this problem and demonstrate the importance of strong augmentation for semantic segmentation. Moreover, we design a self correction loss which is effective in noise resistance. We conduct a series of ablation studies to show the effectiveness of each component. Our method achieves state-of-the-art results in the semi-supervised settings on the Cityscapes and Pascal VOC datasets.
研究动机与目标
- 通过半监督学习利用未标注数据,以应对语义分割中像素级标注的高昂成本。
- 解决强数据增强在训练过程中导致批量归一化统计量不稳定的挑战。
- 减轻自训练中教师模型生成的噪声伪标签对性能的负面影响。
- 在无需复杂架构或子网络的情况下,实现半监督语义分割的最先进性能。
提出的方法
- 提出特定分布批量归一化(DSBN),在训练过程中为弱增强和强增强输入分别维护独立的批量统计量。
- 对未标注数据应用强数据增强(如CutMix、MixUp)以提升泛化能力,同时利用DSBN稳定批量归一化统计量。
- 引入一种自校正损失(SCL),通过动态调整每个像素的损失权重和学习目标,以抑制噪声预测。
- 采用标准的学生-教师自训练流程,其中教师模型在增强的未标注数据上生成伪标签,学生模型则从标注数据和伪标签数据中进行学习。
- 采用迭代训练策略,通过模型更新逐步优化预测,多轮迭代后性能持续提升。
- 推理阶段使用弱增强数据计算的批量统计量,以保持与训练分布的一致性。
实验结果
研究问题
- RQ1当强数据增强被合理整合到训练流程中时,是否能显著提升半监督语义分割的性能?
- RQ2当强增强在小批量中引起显著分布偏移时,如何稳定批量归一化统计量?
- RQ3自校正损失在多大程度上能减轻自训练中噪声伪标签的负面影响?
- RQ4仅使用强增强和DSBN的简单框架是否能超越更复杂的架构在半监督语义分割中的表现?
主要发现
- 在Cityscapes数据集上使用1/8标注数据时,该方法使用DeepLabV2达到70.1% mIoU,使用DeepLabV3Plus达到78.7% mIoU,优于先前最先进方法。
- 在Pascal VOC数据集上使用1/8标注数据时,该方法使用ResNet-101达到75.0% mIoU,使用Xception-65达到79.3% mIoU,与Xception-65在全监督训练下的性能相当。
- 消融实验证实DSBN和自校正损失是关键组件,仅使用DSBN即可使mIoU相比基线提升2.9%。
- 迭代训练进一步提升了性能,但多次迭代后增益逐渐减小,表明模型已趋于收敛。
- 该方法在不修改网络架构(如不使用多个子网络)的情况下实现了最先进结果,证明了简单而合理的设计选择的有效性。
- 该框架对标签噪声具有鲁棒性,并在不同数据集间展现出良好的泛化能力,验证了DSBN和SCL在真实半监督场景中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。