[论文解读] Perturbed and Strict Mean Teachers for Semi-supervised Semantic Segmentation
本文提出了一种新型的半监督语义分割方法——扰动严格均值教师模型(Perturbed and Strict Mean Teachers, PS-MT),通过引入辅助教师模型和置信度加权交叉熵(Conf-CE)损失,提升了未标注图像上的预测精度,从而改善了一致性学习。通过生成更可靠的伪标签,PS-MT能够有效利用具有挑战性的网络、输入和对抗性特征扰动——特别是T-VAT——在Pascal VOC 2012和Cityscapes基准上实现了最先进性能。
Consistency learning using input image, feature, or network perturbations has shown remarkable results in semi-supervised semantic segmentation, but this approach can be seriously affected by inaccurate predictions of unlabelled training images. There are two consequences of these inaccurate predictions: 1) the training based on the "strict" cross-entropy (CE) loss can easily overfit prediction mistakes, leading to confirmation bias; and 2) the perturbations applied to these inaccurate predictions will use potentially erroneous predictions as training signals, degrading consistency learning. In this paper, we address the prediction accuracy problem of consistency learning methods with novel extensions of the mean-teacher (MT) model, which include a new auxiliary teacher, and the replacement of MT's mean square error (MSE) by a stricter confidence-weighted cross-entropy (Conf-CE) loss. The accurate prediction by this model allows us to use a challenging combination of network, input data and feature perturbations to improve the consistency learning generalisation, where the feature perturbations consist of a new adversarial perturbation. Results on public benchmarks show that our approach achieves remarkable improvements over the previous SOTA methods in the field. Our code is available at https://github.com/yyliu01/PS-MT.
研究动机与目标
- 为解决半监督语义分割中一致性学习存在的预测不准确问题,该问题会导致确认偏误并降低泛化能力。
- 通过引入新型辅助教师模型和更严格的损失函数,提升教师模型在未标注图像上的预测准确性,从而提高伪标签的可靠性。
- 通过在预测置信度较高的前提下结合多种扰动(网络、输入图像和特征),实现更有效的的一致性正则化。
- 提出一种新型对抗性特征扰动方法(T-VAT),利用多教师知识生成鲁棒且具有挑战性的噪声,用于学生模型训练。
提出的方法
- 提出双教师均值教师架构,引入辅助教师模型,以提升未标注图像上的预测置信度。
- 用更严格的置信度加权交叉熵(Conf-CE)损失替代原始均值教师模型中的均方误差(MSE)损失,以提升训练收敛性并减少对预测错误的过拟合。
- 采用一种新型特征扰动方法——T-VAT(基于教师的虚拟对抗训练),从教师模型的预测中生成对抗性噪声,用于扰动学生模型的特征。
- 应用多模态扰动策略,结合网络、输入图像和特征层级的扰动,以增强一致性正则化效果。
- 使用基于类激活图(CAM)的伪标签损失(公式9),以处理教师模型的低置信度预测,从而提升训练信号质量。
- 通过结合Conf-CE损失、伪标签损失和一致性目标,联合训练学生模型,以优化泛化性能。
实验结果
研究问题
- RQ1提升均值教师模型中教师预测的准确性,是否能带来半监督语义分割中更优的一致性学习效果?
- RQ2将MSE损失替换为置信度加权交叉熵(Conf-CE)损失,是否能提升训练收敛性并减少对错误伪标签的过拟合?
- RQ3当预测置信度较高时,结合网络、输入和对抗性特征扰动是否能显著提升模型泛化能力?
- RQ4T-VAT(一种从多教师学习得到的对抗性扰动)与标准特征空间噪声注入相比,在一致性训练中表现如何?
- RQ5将基于CAM的伪标签损失与Conf-CE损失结合,对标准基准性能的提升程度如何?
主要发现
- PS-MT在使用DeeplabV3+主干网络和ResNet101架构时,在Pascal VOC 2012上实现了81.19%的新最先进mIoU,优于以往最先进方法。
- 在DeeplabV3+ ResNet101架构上,将CAM损失与Conf-CE损失结合后,mIoU相比基线模型提升了1.18%。
- Conf-CE损失产生的梯度幅值显著大于MSE损失,表明其具有更强的优化动力学和更优的收敛性。
- 在模型预测后应用CutMix可使mIoU提升约3%,表明预测质量在数据增强策略中至关重要。
- 所提出的T-VAT对抗性特征扰动方法,通过生成比标准特征扰动更有效的噪声,显著增强了模型的鲁棒性和泛化能力。
- 定性结果表明,PS-MT生成的分割图比监督基线模型和仅学生模型更准确,验证了教师-学生优化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。