[论文解读] Revisiting Weak-to-Strong Consistency in Semi-Supervised Semantic Segmentation
本文提出UniMatch,一种统一的双流扰动框架,通过引入辅助的特征级扰动和由共享弱视图引导的双强视图,提升了弱监督到强监督的一致性,从而在半监督语义分割任务中实现了最先进性能。该方法在Pascal、Cityscapes、COCO、遥感以及医学影像等多个基准上表现优异,仅通过极少的网络结构改动即显著超越了先前方法。
In this work, we revisit the weak-to-strong consistency framework, popularized by FixMatch from semi-supervised classification, where the prediction of a weakly perturbed image serves as supervision for its strongly perturbed version. Intriguingly, we observe that such a simple pipeline already achieves competitive results against recent advanced works, when transferred to our segmentation scenario. Its success heavily relies on the manual design of strong data augmentations, however, which may be limited and inadequate to explore a broader perturbation space. Motivated by this, we propose an auxiliary feature perturbation stream as a supplement, leading to an expanded perturbation space. On the other, to sufficiently probe original image-level augmentations, we present a dual-stream perturbation technique, enabling two strong views to be simultaneously guided by a common weak view. Consequently, our overall Unified Dual-Stream Perturbations approach (UniMatch) surpasses all existing methods significantly across all evaluation protocols on the Pascal, Cityscapes, and COCO benchmarks. Its superiority is also demonstrated in remote sensing interpretation and medical image analysis. We hope our reproduced FixMatch and our results can inspire more future works. Code and logs are available at https://github.com/LiheYoung/UniMatch.
研究动机与目标
- 通过将扰动空间扩展至图像级增强之外,提升半监督语义分割中的弱监督到强监督一致性。
- 解决FixMatch中单个强视图利用不足的问题,该问题导致手动设计的强增强未被充分使用。
- 探究特征级扰动是否能有效替代或补充图像级强增强。
- 证明双流扰动在提升模型泛化能力与一致性方面的有效性。
- 基于FixMatch设计改进的增强策略,提供一个强大且可复现的基线,以激发未来研究。
提出的方法
- 提出统一的双流扰动框架,独立地对图像级强增强(如CutMix、颜色抖动)和特征级通道丢弃进行应用,以生成互补的扰动流。
- 使用共享的弱视图来监督两个独立增强的强视图,实现双流一致性训练,提升模型鲁棒性。
- 采用通道丢弃作为简单且通用的特征级扰动方法,将扰动空间扩展至图像级变换之外。
- 使用置信度阈值过滤低质量伪标签,减少自训练过程中的错误累积。
- 设计一种双流特征级扰动变体,对特征图应用两个独立的通道丢弃,增强对比学习类似的行为。
- 通过消融实验验证强视图数量与扰动流数量的影响,结果表明在两到三个视图时性能最优。
实验结果
研究问题
- RQ1仅使用特征级扰动是否能与图像级强增强在弱监督到强监督一致性任务中达到相当的性能?
- RQ2与单个强视图训练相比,双流强视图监督如何提升模型泛化能力?
- RQ3在不降低性能的前提下,探测图像级扰动空间的最优强视图数量是多少?
- RQ4辅助的特征级扰动能否有效扩展扰动空间并提升一致性?
- RQ5在低样本标注条件下,该方法在包括遥感与医学影像在内的多样化基准上表现如何?
主要发现
- UniMatch在Pascal、Cityscapes和COCO基准上均达到最先进性能,超越所有先前方法,且在所有评估协议下表现优异。
- 在Pascal数据集上,仅使用92张标注图像时,UniMatch达到79.2%的mIoU,显著优于基线FixMatch(74.6%)和仅使用CutMix的方法(78.3%)。
- 仅使用特征级通道丢弃即可达到与图像级强增强相近的性能,仅略有精度下降,验证了其作为通用扰动方法的有效性。
- 双流强视图监督相比单视图训练显著提升性能,证明多个强视图能增强一致性与泛化能力。
- 该方法在自然图像之外也表现出良好泛化能力,在遥感与医学图像分割任务中表现强劲,表明其具有广泛适用性。
- 消融实验表明,两到三个强视图为最优配置;超过此数量后,性能略有下降,归因于训练难度增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。