[论文解读] MLAN: Multi-Level Adversarial Network for Domain Adaptive Semantic Segmentation
该论文提出MLAN,一种用于域自适应语义分割的多层级对抗网络,通过在全局图像和局部区域两个层次上联合对齐特征。通过引入区域级对抗学习(RL-AL)和协同正则化对抗学习(CR-AL),MLAN在多个基准上实现了稳定、鲁棒的域自适应,分割精度显著提升,大幅超越当前最先进方法。
Recent progresses in domain adaptive semantic segmentation demonstrate the effectiveness of adversarial learning (AL) in unsupervised domain adaptation. However, most adversarial learning based methods align source and target distributions at a global image level but neglect the inconsistency around local image regions. This paper presents a novel multi-level adversarial network (MLAN) that aims to address inter-domain inconsistency at both global image level and local region level optimally. MLAN has two novel designs, namely, region-level adversarial learning (RL-AL) and co-regularized adversarial learning (CR-AL). Specifically, RL-AL models prototypical regional context-relations explicitly in the feature space of a labelled source domain and transfers them to an unlabelled target domain via adversarial learning. CR-AL fuses region-level AL and image-level AL optimally via mutual regularization. In addition, we design a multi-level consistency map that can guide domain adaptation in both input space ($i.e.$, image-to-image translation) and output space ($i.e.$, self-training) effectively. Extensive experiments show that MLAN outperforms the state-of-the-art with a large margin consistently across multiple datasets.
研究动机与目标
- 为解决由合成(源)图像与真实(目标)图像之间分布差异引起的语义分割中的域偏移问题。
- 克服仅依赖全局图像级对抗学习的局限性,后者无法捕捉局部区域级上下文关系。
- 通过联合优化图像级与区域级域对齐,提升训练稳定性和模型性能。
- 设计一个多层级一致性图(MLCM),在输入空间和输出空间中引导域适应。
- 在多种超参数设置下,实现对超参数选择具有鲁棒性的优越域自适应性能。
提出的方法
- 提出区域级对抗学习(RL-AL),在特征空间中显式建模并迁移源域到目标域的典型区域上下文关系。
- 引入协同正则化对抗学习(CR-AL),通过全局与局部一致性约束,相互正则化图像级与区域级对抗学习。
- 设计一个多层级一致性图(MLCM),用于识别输入空间中域差距较大的区域(用于图像到图像翻译)和输出空间中域差距较大的区域(用于自训练)。
- 采用相互正则化机制:全局一致性增强局部不一致区域的RL-AL损失,局部一致性增强全局域差距较大的图像的IL-AL损失。
- 采用双分支网络结构,共享编码器,并为图像级与区域级对齐分别设置独立的域判别器。
- 结合MLCM进行自训练,优先对域差距较大的难样本进行伪标签化,从而减少对简单样本的过拟合。
实验结果
研究问题
- RQ1联合优化全局图像级与局部区域级域对齐是否能提升无监督域自适应中的语义分割性能?
- RQ2图像级与区域级对抗学习之间的协同正则化如何增强训练稳定性和模型鲁棒性?
- RQ3多层级一致性图在输入空间和输出空间中的域适应中能提升多少性能?
- RQ4所提出方法是否在多种域偏移场景下均优于现有最先进方法?
- RQ5模型对超参数设置的敏感性如何?正则化是否能提升训练稳定性?
主要发现
- MLAN在GTA5到Cityscapes以及Cityscapes到Cityscapes基准上均达到最先进性能,大幅超越先前最先进方法。
- 所提出的正则化RL-AL与IL-AL表现出显著增强的鲁棒性,不同权重因子下分割精度波动小于1.2%。
- 在GTA5到Cityscapes基准上,MLAN使用ResNet-101模型实现46.1%的平均交并比(mIoU),较之前最先进方法提升超过2.5个百分点。
- 消融实验表明,CR-AL与MLCM对性能提升均有显著贡献,尤其在纠正局部上下文关系错误方面(如将树干误分类为电线杆)。
- 超参数研究显示,原始对抗损失存在不稳定性,而所提正则化方法有效稳定了训练过程,并降低了对超参数的敏感性。
- 通过MLCM引导自训练,模型能有效避免对简单样本的过拟合,将注意力集中于域差距较大的区域,从而提升泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。