[论文解读] Semi-Supervised Semantic Segmentation with High- and Low-level Consistency
该论文提出了一种双分支半监督语义分割框架,通过基于生成对抗网络(GAN)的生成器实现边界精细化,同时引入半监督多标签分类分支以实现全局类别一致性,联合优化低层次与高层次的一致性。该方法在仅使用2%标注数据的情况下,在PASCAL VOC 2012数据集上实现了最先进性能,较之前方法提升11%。
The ability to understand visual information from limited labeled data is an important aspect of machine learning. While image-level classification has been extensively studied in a semi-supervised setting, dense pixel-level classification with limited data has only drawn attention recently. In this work, we propose an approach for semi-supervised semantic segmentation that learns from limited pixel-wise annotated samples while exploiting additional annotation-free images. It uses two network branches that link semi-supervised classification with semi-supervised segmentation including self-training. The dual-branch approach reduces both the low-level and the high-level artifacts typical when training with few labels. The approach attains significant improvement over existing methods, especially when trained with very few labeled samples. On several standard benchmarks - PASCAL VOC 2012, PASCAL-Context, and Cityscapes - the approach achieves new state-of-the-art in semi-supervised learning.
研究动机与目标
- 通过利用大量未标注数据,解决像素级标注受限的语义分割挑战。
- 减少分割预测中不准确边界和不连贯表面等低层次伪影。
- 通过多标签一致性缓解错误的全局类别分配等高层次错误。
- 通过自训练和基于GAN的精细化方法,提升在低数据场景下的泛化能力与鲁棒性。
- 在多个基准数据集(包括PASCAL VOC 2012、PASCAL-Context和Cityscapes)上验证方法的有效性。
提出的方法
- 基于GAN的分支(s4GAN)使用语义分割网络作为生成器,判别器通过特征匹配损失而非标准GAN损失来优化低层次细节。
- 利用判别器的置信度分数进行自训练,从未标注图像中选择高质量伪标签。
- 独立的半监督多标签分类分支(MLMT)通过基于集成的自监督学习方法预测图像级类别存在性,强化预测的全局一致性。
- 两个分支联合训练,MLMT分支可减少误报并提升类别层面的一致性。
- 采用特征匹配损失以稳定训练过程,防止判别器过拟合。
- 当存在弱图像级标注时,框架支持其集成,从而在无需CRF后处理的情况下提升性能。
实验结果
研究问题
- RQ1双分支架构能否有效减少半监督语义分割中的低层次与高层次错误?
- RQ2基于判别器分数的自训练在低数据场景下如何提升伪标签质量?
- RQ3半监督学习下的多标签分类在多大程度上增强了分割输出的全局一致性?
- RQ4当仅使用2%–5%的训练数据进行全标注时,该方法与最先进方法相比表现如何?
- RQ5该方法在PASCAL VOC、PASCAL-Context和Cityscapes等多样化数据集上是否具备良好的泛化能力,且仅依赖最小监督?
主要发现
- 该方法在PASCAL VOC 2012上达到新的最先进性能,在仅使用2%标注数据时,较之前最先进方法提升11%。
- 在PASCAL VOC 2012上使用5%标注样本时,模型mIoU达到72.9,较之前SOTA方法提升5.2%,且在引入额外图像级标注后表现更优。
- 仅MLMT分支即可使性能相比s4GAN单分支基线提升2%,证明全局类别一致性的重要价值。
- 如图11所示的训练动态表明,自训练可提升判别器输出的稳定性,避免过拟合。
- 如图12所示的ROC曲线表明,MLMT分类器的误报率低于标准CNN分类器,尤其在从零开始训练时表现更优。
- 该方法无需CRF后处理即可实现优异性能,且在Cityscapes和PASCAL-Context等多个数据集上均表现出良好泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。