[论文解读] Semi-Supervised Semantic Segmentation via Marginal Contextual Information
本文提出S4MC,一种半监督语义分割方法,通过在邻近像素上计算事件并集概率,利用空间上下文信息来优化伪标签置信度。通过将邻近像素分组并基于集体标签置信度应用更宽松的过滤标准,S4MC增加了训练过程中可用的可靠未标注样本数量,在计算开销极低的情况下实现了最先进性能——在仅使用366张标注图像的PASCAL VOC 12上,mIoU提升了1.29。
We present a novel confidence refinement scheme that enhances pseudo labels in semi-supervised semantic segmentation. Unlike existing methods, which filter pixels with low-confidence predictions in isolation, our approach leverages the spatial correlation of labels in segmentation maps by grouping neighboring pixels and considering their pseudo labels collectively. With this contextual information, our method, named S4MC, increases the amount of unlabeled data used during training while maintaining the quality of the pseudo labels, all with negligible computational overhead. Through extensive experiments on standard benchmarks, we demonstrate that S4MC outperforms existing state-of-the-art semi-supervised learning approaches, offering a promising solution for reducing the cost of acquiring dense annotations. For example, S4MC achieves a 1.39 mIoU improvement over the prior art on PASCAL VOC 12 with 366 annotated images. The code to reproduce our experiments is available at https://s4mcontext.github.io/
研究动机与目标
- 通过改进半监督学习中伪标签的质量与利用效率,应对语义分割中高昂的标注成本挑战。
- 通过引入空间上下文信息,减轻伪标签中的确认偏见,降低对孤立高置信度预测的依赖。
- 在不降低标签质量的前提下,增加训练过程中可用的未标注样本数量。
- 开发一种轻量化、高效的算法,在计算开销极低的情况下保持高性能。
- 在PASCAL VOC 12和Cityscapes等标准基准上,在低样本设置下展示最先进结果。
提出的方法
- S4MC提出一种置信度优化机制,将邻近像素分组,计算事件并集概率——即局部邻域中至少一个像素属于某类的概率。
- 当某类的事件并集概率显著高于其他所有类时,为像素分配伪标签,相比单一像素置信度阈值,实现更宽松的过滤标准。
- 采用基于初始分位数(α₀)的动态阈值,40%被确定为最优值,可在标签传播与错误抑制之间取得最佳平衡。
- 邻域通过固定大小的卷积核(如3×3)定义,邻域选择通过选取组内预测类别概率最高的像素来优化。
- 该方法可无缝集成到FixMatch和CutMix-Seg等现有半监督学习框架中,无需修改主干网络或训练流程,即可提升伪标签质量。
- 该方法计算开销可忽略不计,适用于实际部署。
实验结果
研究问题
- RQ1能否利用分割图中的空间上下文信息,提升半监督学习中伪标签的可靠性?
- RQ2与孤立像素过滤相比,通过邻近像素的集体置信度评估是否能更有效地减少确认偏见?
- RQ3基于事件并集概率的宽松过滤标准是否能在不降低模型性能的前提下,增加可用未标注样本的数量?
- RQ4邻域大小和邻近像素选择策略的选择如何影响最终的分割精度?
- RQ5上下文置信度优化在低样本半监督分割基准上的性能提升程度如何?
主要发现
- 在仅使用366张标注图像的PASCAL VOC 12上,S4MC相比之前最先进方法实现了1.29的mIoU提升,证明其在低数据场景下的强大性能。
- 在Cityscapes数据集上,S4MC仅用186张标注图像即实现+1.01的mIoU增益,证实其在多样化数据集上的有效性。
- 消融实验表明,最优邻域大小为3×3,且通过最大类别概率选择一个邻近像素时性能最高。
- 初始置信度阈值α₀ = 40%在标签覆盖与错误抑制之间提供了最佳平衡,优于更低或更高的值。
- 仅使用伪标签优化(PLR)模块可使mIoU提升1.09%;而仅使用动态分区调整(DPA)模块则导致性能下降,表明空间一致性是性能提升的关键驱动因素。
- 在推理阶段应用S4MC仅带来可忽略的性能增益(mIoU从85.7提升至85.71),证实其主要优势来自训练阶段的标签优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。