[论文解读] CLUDA : Contrastive Learning in Unsupervised Domain Adaptation for Semantic Segmentation
CLUDA 提出了一种基于对比学习的无监督域自适应方法,用于语义分割,通过在学生-教师框架生成的多层级融合特征上应用对比损失,增强了源域(合成数据)与目标域(真实世界数据)之间特征的紧凑性与可分性。该方法在仅进行少量架构修改和低内存开销的前提下,实现了最先进性能,在 GTA→Cityscapes 上达到 74.4 mIoU(+0.6),在 Synthia→Cityscapes 上达到 66.8 mIoU(+1.0)。
In this work, we propose CLUDA, a simple, yet novel method for performing unsupervised domain adaptation (UDA) for semantic segmentation by incorporating contrastive losses into a student-teacher learning paradigm, that makes use of pseudo-labels generated from the target domain by the teacher network. More specifically, we extract a multi-level fused-feature map from the encoder, and apply contrastive loss across different classes and different domains, via source-target mixing of images. We consistently improve performance on various feature encoder architectures and for different domain adaptation datasets in semantic segmentation. Furthermore, we introduce a learned-weighted contrastive loss to improve upon on a state-of-the-art multi-resolution training approach in UDA. We produce state-of-the-art results on GTA $ ightarrow$ Cityscapes (74.4 mIOU, +0.6) and Synthia $ ightarrow$ Cityscapes (67.2 mIOU, +1.4) datasets. CLUDA effectively demonstrates contrastive learning in UDA as a generic method, which can be easily integrated into any existing UDA for semantic segmentation tasks. Please refer to the supplementary material for the details on implementation.
研究动机与目标
- 解决从合成数据到真实世界数据迁移时语义分割中的域偏移问题。
- 在无监督设置下,通过对比学习提升跨域特征的紧凑性与可分性。
- 开发一种通用、可插拔的方法,兼容现有无监督域自适应框架(如 DAFormer 和 HRDA)。
- 通过分别对 'stuff' 类和 'thing' 类应用对比损失,缓解视觉Transformer模型中的形状偏差。
- 通过学习不同特征尺度的对比损失权重,优化多分辨率训练。
提出的方法
- 引入学生-教师训练范式,其中教师模型为目标域图像生成伪标签。
- 在编码器生成的多层级融合特征上应用对比损失,利用源域-目标域混合图像,实现跨域特征对齐。
- 分别对 'stuff' 类和 'thing' 类计算对比损失,以减少基于Transformer模型中的形状偏差。
- 采用置信度加权的对比损失,其中损失贡献按教师模型预测置信度进行缩放,以稳定训练初期。
- 通过学习的加权策略组合来自低分辨率和高分辨率特征图的对比损失,提升多分辨率适应性能。
- 将对比损失与交叉熵损失联合集成到统一训练目标中,以提升特征学习效果。
实验结果
研究问题
- RQ1对比学习是否能在不依赖目标域标注的情况下,提升无监督语义分割的域泛化能力?
- RQ2对 'stuff' 和 'thing' 类分别进行对比学习,对视觉Transformer主干网络的性能有何影响?
- RQ3对不同特征分辨率的对比损失采用学习加权策略,是否能提升多分辨率域自适应性能?
- RQ4对比学习能否有效集成到现有最先进无监督域自适应框架(如 DAFormer 和 HRDA)中?
- RQ5基于置信度的对比损失加权是否能稳定训练过程并提升早期训练阶段的最终 mIoU?
主要发现
- 在 GTA→Cityscapes 上,CLUDA 达到 74.4 mIoU,相比之前最先进方法提升 0.6,标准差为 0.32。
- 在 Synthia→Cityscapes 上,CLUDA 达到 66.8 mIoU,相比先前最先进方法提升 1.0,标准差为 0.44。
- 该方法在多种主干网络架构(包括 Swin-L)上均表现出一致的性能提升,尤其在 DAFormer 和 HRDA 框架中效果显著。
- 对 'stuff' 和 'thing' 类分别进行对比学习,可有效减少两类之间的误分类,尤其在标志、信号等模糊类别上改善明显。
- 通过学习加权策略组合低分辨率与高分辨率对比损失,性能优于固定权重或简单平均策略。
- 置信度加权的对比损失显著提升了训练稳定性与最终性能,若省略该机制,mIoU 明显下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。