Skip to main content
QUICK REVIEW

[论文解读] Style-Hallucinated Dual Consistency Learning for Domain Generalized Semantic Segmentation

Yuyang Zhao, Zhun Zhong|arXiv (Cornell University)|Apr 6, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

该论文提出SHADE,一种用于语义分割中从合成数据到真实数据的领域泛化任务的风格幻觉双致性学习框架。通过引入一种新颖的风格幻觉模块(SHM),结合风格一致性(SC)与回溯一致性(RC),SHADE能够生成多样且逼真的风格增强型合成样本,并在这些样本之间以及与真实世界知识之间强制保持一致性,从而在单源和多源设置下,分别在三个真实世界数据集上平均实现5.05%和8.35%的mIoU性能提升,达到当前最优水平。

ABSTRACT

In this paper, we study the task of synthetic-to-real domain generalized semantic segmentation, which aims to learn a model that is robust to unseen real-world scenes using only synthetic data. The large domain shift between synthetic and real-world data, including the limited source environmental variations and the large distribution gap between synthetic and real-world data, significantly hinders the model performance on unseen real-world scenes. In this work, we propose the Style-HAllucinated Dual consistEncy learning (SHADE) framework to handle such domain shift. Specifically, SHADE is constructed based on two consistency constraints, Style Consistency (SC) and Retrospection Consistency (RC). SC enriches the source situations and encourages the model to learn consistent representation across style-diversified samples. RC leverages real-world knowledge to prevent the model from overfitting to synthetic data and thus largely keeps the representation consistent between the synthetic and real-world models. Furthermore, we present a novel style hallucination module (SHM) to generate style-diversified samples that are essential to consistency learning. SHM selects basis styles from the source distribution, enabling the model to dynamically generate diverse and realistic samples during training. Experiments show that our SHADE yields significant improvement and outperforms state-of-the-art methods by 5.05% and 8.35% on the average mIoU of three real-world datasets on single- and multi-source settings, respectively.

研究动机与目标

  • 为解决语义分割任务中合成数据与真实世界数据之间存在的显著领域偏移问题,尤其是在训练阶段无法获取真实世界数据的情况下。
  • 通过学习领域不变表征,提升模型对未见真实世界场景的泛化能力,且不依赖额外的真实世界数据。
  • 克服现有方法的局限性,即要么对合成数据过拟合,要么依赖真实世界数据进行风格迁移。
  • 开发一种方法,显式学习在多样化风格之间的一致表征,并通过回溯性引导与真实世界知识对齐。
  • 实现在单源和多源领域泛化设置下的鲁棒性能,以支持真实世界部署。

提出的方法

  • 该框架采用两种一致性约束:风格一致性(SC),用于强制在风格增强的合成样本之间保持预测一致;回溯一致性(RC),用于将模型的特征与预训练ImageNet模型的特征对齐,以反映真实世界知识。
  • 提出一种新颖的风格幻觉模块(SHM),通过操纵特征图的通道维度均值与标准差,生成多样且逼真的风格增强样本,同时保持空间对齐。
  • SHM使用最远点采样(FPS)从源分布中选取基础风格,确保覆盖稀有且多样的风格,包括接近真实世界分布的风格。
  • SHM被插入网络浅层(如ResNet的第0层之后),以最大化风格表征能力,同时避免深层网络带来的语义干扰。
  • 该方法每k=3个周期动态重新选择基础风格,以适应训练过程中风格分布的演变。
  • 双致性学习通过端到端方式优化,SC促进对风格变化的不变性,RC则防止模型对合成数据过拟合。

实验结果

研究问题

  • RQ1风格增强的合成数据能否提升在未见真实世界场景下的领域泛化性能?
  • RQ2模型在训练阶段无法访问真实世界目标数据的情况下,如何学习领域不变表征?
  • RQ3不同的风格生成策略对模型泛化能力和鲁棒性有何影响?
  • RQ4来自预训练ImageNet模型的回溯知识如何提升模型对真实世界分布的泛化能力?
  • RQ5一种能够选择多样化基础风格的风格幻觉模块,是否能显著增强一致性学习与模型性能?

主要发现

  • 在单源领域泛化设置下,SHADE在三个真实世界数据集上平均mIoU相比SOTA方法提升5.05%。
  • 在多源设置下,SHADE相比SOTA方法mIoU提升8.35%,展现出在多样化源领域间的强大泛化能力。
  • 消融实验证实,SHM中基于FPS的基风格选择优于随机和K-means方法,能更有效地覆盖稀有和多样的风格。
  • 在ResNet第一阶段(L0)之后插入SHM可获得最佳性能,因为浅层能保留更纯净的风格信息。
  • 每3个周期(k=3)重新选择基风格可维持最优风格多样性与性能,而仅初始一次选择会导致mIoU下降至41%以下。
  • 在CityScapes上进行训练并泛化至真实(BDD100K、Mapillary)和合成(GTAV、SYNTHIA)领域时,SHADE在所有基准测试中均优于ISW与IBN-Net。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。