Skip to main content
QUICK REVIEW

[论文解读] MIC: Masked Image Consistency for Context-Enhanced Domain Adaptation

Lukas Hoyer, Dengxin Dai|arXiv (Cornell University)|Dec 2, 2022
Domain Adaptation and Few-Shot Learning被引用 9
一句话总结

该论文提出了一种即插即用的模块——掩码图像一致性(Masked Image Consistency, MIC),用于无监督域自适应(UDA),通过强制要求对掩码目标图像的预测与未掩码图像的伪标签之间保持一致性,从而提升模型的鲁棒性。通过利用上下文信息来推断被掩码区域的语义,MIC在各类任务中均实现了最先进性能,包括在GTA→Cityscapes数据集上达到75.9 mIoU,以及在VisDA-2017数据集上达到92.8%的准确率,且在分类、分割和检测任务中均表现出一致的性能提升。

ABSTRACT

In unsupervised domain adaptation (UDA), a model trained on source data (e.g. synthetic) is adapted to target data (e.g. real-world) without access to target annotation. Most previous UDA methods struggle with classes that have a similar visual appearance on the target domain as no ground truth is available to learn the slight appearance differences. To address this problem, we propose a Masked Image Consistency (MIC) module to enhance UDA by learning spatial context relations of the target domain as additional clues for robust visual recognition. MIC enforces the consistency between predictions of masked target images, where random patches are withheld, and pseudo-labels that are generated based on the complete image by an exponential moving average teacher. To minimize the consistency loss, the network has to learn to infer the predictions of the masked regions from their context. Due to its simple and universal concept, MIC can be integrated into various UDA methods across different visual recognition tasks such as image classification, semantic segmentation, and object detection. MIC significantly improves the state-of-the-art performance across the different recognition tasks for synthetic-to-real, day-to-nighttime, and clear-to-adverse-weather UDA. For instance, MIC achieves an unprecedented UDA performance of 75.9 mIoU and 92.8% on GTA-to-Cityscapes and VisDA-2017, respectively, which corresponds to an improvement of +2.1 and +3.0 percent points over the previous state of the art. The implementation is available at https://github.com/lhoyer/MIC.

研究动机与目标

  • 解决无监督域自适应(UDA)中因目标域缺乏真实标签而导致的类别混淆问题,特别是当视觉上相似的类别(如道路/人行道)被错误分类时。
  • 通过显式学习目标域中的空间上下文关系来提升视觉识别的鲁棒性,而这是先前UDA方法未能有效利用的。
  • 开发一种简单且通用的模块,可无缝集成到多种识别任务(分类、分割、检测)的各类UDA框架中。
  • 在多种域差距设置下实现一致的性能增益,包括合成到真实、清晰天气到恶劣天气,以及白天到夜晚的域自适应。
  • 通过利用路缘、周围物体等上下文线索,使模型即使在局部外观模糊时也能更全面地推理图像语义。

提出的方法

  • 提出一种掩码图像一致性(MIC)模块,在训练过程中对目标图像随机掩码部分区域,迫使学生网络利用上下文信息推断被掩码区域的语义。
  • 使用指数移动平均(EMA)教师模型为完整未掩码的目标图像生成伪标签,提供鲁棒且具备上下文感知能力的监督信号。
  • 最小化学生网络在掩码图像上的预测与未掩码图像伪标签之间的一致性损失,以鼓励学生学习上下文依赖关系。
  • 将MIC作为即插即用模块集成到多种现有UDA方法中,涵盖基于对抗训练、熵最小化和自训练的方法,并适用于CNN和Transformer等多种网络架构。
  • 通过在训练过程中随机掩码不同区域,使学生网络能够泛化到各种目标域条件,从而提升对不同上下文配置的鲁棒性。
  • 使用EMA教师模型稳定伪标签生成过程,提升自训练阶段监督信号的可靠性。

实验结果

研究问题

  • RQ1强制要求掩码目标图像的预测与未掩码图像的伪标签之间保持一致性,是否能提升域自适应性能?
  • RQ2在缺乏目标域真实标注的情况下,学习空间上下文关系在多大程度上能减少视觉上相似类别(如道路与人行道)的误分类?
  • RQ3MIC作为即插即用模块,在不同UDA框架、识别任务和域差距设置下效果如何?
  • RQ4MIC是否能提升在恶劣天气或低光照等挑战性目标域条件下的泛化能力?
  • RQ5MIC的失败模式是什么?其与上下文依赖性假设及分布外物体排列的关系如何?

主要发现

  • 在GTA→Cityscapes语义分割基准上,MIC实现了75.9 mIoU的新SOTA性能,相比之前SOTA提升了+2.1个百分点。
  • 在VisDA-2017图像分类基准上,MIC达到92.8%的top-1准确率,相比之前SOTA提升了+3.0个百分点。
  • 在CS→DarkZurich基准上,MIC性能提升了+4.3个百分点,表明其在恶劣天气域自适应中具有强大泛化能力。
  • 在Foggy Cityscapes的目标检测任务中,MIC(SADA)成功检测到此前被遗漏的公交车、卡车、骑手和摩托车实例,显示出在低能见度条件下的更强鲁棒性。
  • 定性分析表明,当存在路缘、自行车等上下文线索时,MIC能比先前方法更完整、更一致地分割模糊区域(如人行道、围栏、部分遮挡的车辆)。
  • 尽管性能有所提升,MIC在罕见物体出现、道路与人行道区域合并以及运动模糊等极端或分布外场景下仍存在局限,表明其在处理极端或非上下文相关情况时仍具挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。