Skip to main content
QUICK REVIEW

[论文解读] Context-Aware Mixup for Domain Adaptive Semantic Segmentation

Qianyu Zhou, Zhengyang Feng|arXiv (Cornell University)|Aug 8, 2021
Domain Adaptation and Few-Shot Learning参考文献 68被引用 13
一句话总结

本文提出了一种名为上下文感知混合(Context-Aware Mixup, CAMix)的新颖域自适应框架,用于语义分割任务。该方法通过学习得到的上下文掩码,显式利用跨域之间的上下文依赖关系,并结合显著性重加权的一致性损失,实现更优的泛化性能并缓解负迁移问题。通过在输入、输出和显著性掩码三个层面引导混合操作,CAMix在GTA5→Cityscapes和SYNTHIA→Cityscapes基准上实现了最先进性能,mIoU分别提升了最高达3.1%和2.8%。

ABSTRACT

Unsupervised domain adaptation (UDA) aims to adapt a model of the labeled source domain to an unlabeled target domain. Existing UDA-based semantic segmentation approaches always reduce the domain shifts in pixel level, feature level, and output level. However, almost all of them largely neglect the contextual dependency, which is generally shared across different domains, leading to less-desired performance. In this paper, we propose a novel Context-Aware Mixup (CAMix) framework for domain adaptive semantic segmentation, which exploits this important clue of context-dependency as explicit prior knowledge in a fully end-to-end trainable manner for enhancing the adaptability toward the target domain. Firstly, we present a contextual mask generation strategy by leveraging the accumulated spatial distributions and prior contextual relationships. The generated contextual mask is critical in this work and will guide the context-aware domain mixup on three different levels. Besides, provided the context knowledge, we introduce a significance-reweighted consistency loss to penalize the inconsistency between the mixed student prediction and the mixed teacher prediction, which alleviates the negative transfer of the adaptation, e.g., early performance degradation. Extensive experiments and analysis demonstrate the effectiveness of our method against the state-of-the-art approaches on widely-used UDA benchmarks.

研究动机与目标

  • 为解决现有无监督域自适应(UDA)方法在语义分割任务中普遍忽视域间共享上下文依赖关系的局限性。
  • 通过在自适应过程中显式建模并迁移跨域上下文作为先验知识,以减小域间分布差异。
  • 缓解域自适应中的负迁移与训练不稳定性问题,尤其是在训练初期阶段。
  • 开发一个完全端到端可训练的框架,以提升目标域中长尾类别与稀有类别上的性能表现。
  • 为域自适应语义分割提供一种简单但高效的方法,替代复杂的对抗性或自训练流水线。

提出的方法

  • 提出一种上下文掩码生成(Contextual Mask Generation, CMG)策略,利用空间分布与先验上下文关系,生成用于指导域间混合的掩码。
  • 在三个层级上应用混合操作:输入层级(图像混合)、输出层级(伪标签混合)以及显著性掩码层级(基于置信度感知的混合),并结合生成的上下文掩码。
  • 引入显著性重加权一致性损失(Significance-rewighted Consistency Loss, SRC),通过基于预测置信度的权重,惩罚学生模型与教师模型在混合样本上的预测不一致性。
  • 采用由超参数β和γ控制的动态阈值机制,自适应调整训练过程中的一致性损失。
  • 采用教师-学生框架结合一致性正则化,其中教师模型为学生模型提供伪标签,且混合操作同时应用于输入与输出。
  • 整个框架完全端到端可训练,支持上下文建模、混合操作与一致性正则化的联合优化。

实验结果

研究问题

  • RQ1显式建模跨域上下文依赖关系是否能提升语义分割任务中的域自适应性能?
  • RQ2如何有效编码并利用上下文关系于域混合过程中,以避免产生违背上下文的增强数据?
  • RQ3引入上下文感知的一致性正则化是否能降低训练不稳定性并缓解UDA中的早期性能下降?
  • RQ4所提方法在目标域中稀有或长尾类别上的性能提升程度如何?
  • RQ5一种简单且端到端可训练的框架是否能在域自适应语义分割任务中超越复杂、多阶段的对抗性或自训练方法?

主要发现

  • CAMix在GTA5→Cityscapes与SYNTHIA→Cityscapes基准上达到最先进性能,mIoU相较SOTA基线方法iDACS分别提升最高达3.1%与2.8%。
  • 该方法显著提升了稀有类别(如“交通标志”与“骑手”)的每类IoU,得益于更强的泛化能力与更少的过拟合现象。
  • 显著性重加权一致性损失(SRC)有效缓解了训练不稳定性,并防止了早期性能下降,性能曲线验证了该效果。
  • 超参数分析表明,在β=0.75与γ=-5时达到最优性能,且在不同数据集与设置下均表现出良好鲁棒性。
  • 定性结果表明,CAMix生成的预测更加自信且准确,尤其在复杂与大尺度类别(如“道路”、“人行道”与“卡车”)上表现突出。
  • 上下文掩码生成策略成功保留了物体级上下文信息,避免了如“行人出现在车上”或“天空穿过建筑物”等不合理的混合现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。