[论文解读] ProCST: Boosting Semantic Segmentation Using Progressive Cyclic Style-Transfer
本文提出 ProCST,一种两阶段框架,通过渐进式循环风格迁移生成高保真、内容保持的合成到真实图像翻译(源域-目标域,简称 SiT),以减少语义分割中的域差距。通过使用新型循环标签损失训练多尺度网络,ProCST 改进了 HRDA、DAFormer 和 ProDA 等下游无监督域自适应(UDA)方法,在 GTA5→Cityscapes 和 Synthia→Cityscapes 基准上实现了最先进(SOTA)的 mIoU 提升。
Using synthetic data for training neural networks that achieve good performance on real-world data is an important task as it can reduce the need for costly data annotation. Yet, synthetic and real world data have a domain gap. Reducing this gap, also known as domain adaptation, has been widely studied in recent years. Closing the domain gap between the source (synthetic) and target (real) data by directly performing the adaptation between the two is challenging. In this work, we propose a novel two-stage framework for improving domain adaptation techniques on image data. In the first stage, we progressively train a multi-scale neural network to perform image translation from the source domain to the target domain. We denote the new transformed data as "Source in Target" (SiT). Then, we insert the generated SiT data as the input to any standard UDA approach. This new data has a reduced domain gap from the desired target domain, which facilitates the applied UDA approach to close the gap further. We emphasize the effectiveness of our method via a comparison to other leading UDA and image-to-image translation techniques when used as SiT generators. Moreover, we demonstrate the improvement of our framework with three state-of-the-art UDA methods for semantic segmentation, HRDA, DAFormer and ProDA, on two UDA tasks, GTA5 to Cityscapes and Synthia to Cityscapes.
研究动机与目标
- 解决仅使用合成数据(源域)训练时,合成图像与真实世界图像(目标域)之间的域差距问题,该问题会显著影响语义分割性能。
- 克服直接域自适应及现有图像到图像翻译方法在风格迁移过程中产生内容失真或幻觉的局限性。
- 开发一种方法,生成高质量、内容保持的图像翻译(SiT),在保持源域标注的同时模仿目标域外观。
- 通过使用生成的 SiT 数据作为输入而非原始源数据,提升现有无监督域自适应(UDA)方法的性能。
提出的方法
- 提出两阶段框架:首先,训练一个渐进式循环风格迁移网络(ProCST),将源图像翻译至目标域(生成 SiT 数据);其次,将 SiT 数据作为任何标准 UDA 方法的输入。
- 设计一个多尺度、双向图像金字塔架构,实现源域到目标域(S→T)和目标域到源域(T→S)的双向翻译,以实现循环一致性。
- 引入一种新型循环标签损失,通过比较源图像与其翻译后的 SiT 对应物的分割图,强制实现语义一致性。
- 将对抗损失、循环一致性损失和感知损失与循环标签损失结合,以保持内容并提升视觉真实感。
- 在不同尺度上渐进式训练网络,从粗到细,以稳定训练过程并改善特征学习。
- 将生成的 SiT 数据作为预处理输入,应用于最先进 UDA 模型(如 HRDA、DAFormer、ProDA),从而实现对真实目标域的更好适应。
实验结果
研究问题
- RQ1渐进式多尺度风格迁移网络是否能比现有图像到图像翻译方法更有效地减少合成图像与真实图像之间的域差距?
- RQ2与标准 GAN 方法相比,引入循环标签损失是否能显著提升风格迁移过程中的内容保持能力?
- RQ3使用 ProCST 生成的 SiT 数据在多大程度上提升了下游 UDA 方法在语义分割中的性能?
- RQ4关键组件(如标签损失、多尺度结构)的消融实验如何影响翻译图像的质量和最终分割精度?
主要发现
- ProCST 显著减少了合成图像与真实图像之间的域差距,生成的 SiT 图像在保持源域内容的同时,成功模仿了目标域的外观。
- 完整版 ProCST 模型在视觉质量、纹理准确性和语义一致性方面均优于所有消融变体(无标签损失、单尺度),尤其在道路等复杂纹理区域表现更优。
- 与领先的 UDA 方法(HRDA、DAFormer、ProDA)相比,集成 ProCST 生成的 SiT 数据在 GTA5→Cityscapes 和 Synthia→Cityscapes 基准上均实现了稳定的 mIoU 提升。
- 现有图像到图像翻译方法(如 CycleGAN、CUT、FDA)无法保持内容,常导致物体失真或幻觉,从而使源域标注失效。
- 循环标签损失至关重要:缺少该损失的模型虽生成视觉上合理的图像,但语义不一致,导致下游分割性能下降。
- 多尺度架构增强了特征学习与纹理迁移能力,尤其在道路和天空等挑战性区域表现更优,而单尺度模型难以维持真实感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。