[论文解读] Semantically Adaptive Image-to-image Translation for Domain Adaptation of Semantic Segmentation
该论文提出了一种语义自适应的图像到图像翻译框架,用于语义分割中的域适应,其中生成器基于预测的语义图进行条件控制,以提升跨域一致性。通过整合对称交叉熵损失和SPADE归一化,该方法在DeepLabV2和FCN8s上分别实现了GTA5→Cityscapes的+3.7%和SYNTHIA→Cityscapes的+2.5% mIoU性能提升,达到当前最优水平。
Domain shift is a very challenging problem for semantic segmentation. Any model can be easily trained on synthetic data, where images and labels are artificially generated, but it will perform poorly when deployed on real environments. In this paper, we address the problem of domain adaptation for semantic segmentation of street scenes. Many state-of-the-art approaches focus on translating the source image while imposing that the result should be semantically consistent with the input. However, we advocate that the image semantics can also be exploited to guide the translation algorithm. To this end, we rethink the generative model to enforce this assumption and strengthen the connection between pixel-level and feature-level domain alignment. We conduct extensive experiments by training common semantic segmentation models with our method and show that the results we obtain on the synthetic-to-real benchmarks surpass the state-of-the-art.
研究动机与目标
- 通过将合成数据上训练的模型适应到真实世界场景,缓解语义分割中的域偏移问题。
- 克服标准图像到图像翻译方法在语义分割任务中忽略语义信息的局限性。
- 通过联合优化图像翻译与分割预测,增强源域与目标域之间的对齐。
- 利用GTA5和SYNTHIA的合成数据,提升在Cityscapes等真实世界基准上的泛化能力与性能。
- 构建一个统一框架,使分割网络与翻译网络相互条件化,以增强特征级与像素级的域对齐。
提出的方法
- 使用分割网络 $M$ 从源图像 $X_S$ 生成语义图,以指导图像翻译生成器 $F_{S\rightarrow T}$ 的生成过程。
- 通过SPADE(空间自适应批归一化)层对生成器进行条件控制,基于语义图实现基于实例的归一化。
- 通过在原始源图像和翻译图像上的预测之间施加对称交叉熵损失 $\mathcal{L}_{SCE}$,强制实现跨域语义一致性。
- 端到端训练分割网络,与翻译模型共享源图像和翻译图像的分割头权重。
- 引入对抗训练,使用分割判别器 $D_{\text{seg}}$ 提升翻译图像的真实感与语义保真度。
- 通过对抗损失实现特征级对齐,通过 $\mathcal{L}_{SCE}$ 实现像素级一致性,确保类分布在域之间保持稳定。
实验结果
研究问题
- RQ1语义引导能否提升无监督域适应中语义分割的图像到图像翻译质量与域对齐效果?
- RQ2将翻译生成器基于预测语义图进行条件控制,对下游分割模型性能有何影响?
- RQ3在源图像与翻译图像之间施加对称交叉熵损失,能在多大程度上提升域泛化能力?
- RQ4将SPADE归一化与任务感知的一致性损失结合,是否能在合成到真实数据的基准上实现优于现有SOTA方法的mIoU表现?
- RQ5初始视觉域差距(如GTA5与Cityscapes之间 vs. SYNTHIA与Cityscapes之间)对翻译质量与分割性能有何影响?
主要发现
- 在GTA5→Cityscapes基准上,该方法使用DeepLabV2实现了50.4的mIoU,较之前SOTA提升+3.7%。
- 在SYNTHIA→Cityscapes基准上,该方法使用FCN8s将mIoU提升了+2.5%,优于先前最优方法。
- 消融实验表明,若移除SPADE或 $\mathcal{L}_{SCE}$,mIoU均出现下降,证实两者对最优性能均不可或缺。
- 翻译后的GTA5图像的Fréchet Inception Distance (FID)为27.9,显著低于SYNTHIA的100.8,表明其与Cityscapes的视觉对齐更优。
- 尽管Inception Score (IS ≈ 4.9–5.0) 较低,但FID结果证实语义引导有效提升了视觉真实感与域迁移质量。
- 在GTA5→Cityscapes任务上,该方法将与上界(使用真实标签微调的模型)的差距缩小了14.7%,展现出强大的域适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。