[论文解读] Discover, Hallucinate, and Adapt: Open Compound Domain Adaptation for Semantic Segmentation
本文提出了一种用于语义分割中开放复合域自适应(OCDA)的新框架,引入了三个核心原则:发现(通过风格聚类识别目标数据中的潜在域)、幻觉生成(通过图像转换生成类似目标的合成源域)和适应(应用域内对抗对齐)。该方法在GTA5到C-driving的基准上实现了最先进性能,有效解决了偏差对齐问题,并能泛化到未见的目标域。
Unsupervised domain adaptation (UDA) for semantic segmentation has been attracting attention recently, as it could be beneficial for various label-scarce real-world scenarios (e.g., robot control, autonomous driving, medical imaging, etc.). Despite the significant progress in this field, current works mainly focus on a single-source single-target setting, which cannot handle more practical settings of multiple targets or even unseen targets. In this paper, we investigate open compound domain adaptation (OCDA), which deals with mixed and novel situations at the same time, for semantic segmentation. We present a novel framework based on three main design principles: discover, hallucinate, and adapt. The scheme first clusters compound target data based on style, discovering multiple latent domains (discover). Then, it hallucinates multiple latent target domains in source by using image-translation (hallucinate). This step ensures the latent domains in the source and the target to be paired. Finally, target-to-source alignment is learned separately between domains (adapt). In high-level, our solution replaces a hard OCDA problem with much easier multiple UDA problems. We evaluate our solution on standard benchmark GTA to C-driving, and achieved new state-of-the-art results.
研究动机与目标
- 为解决现有无监督域自适应(UDA)方法在假设单源单目标设置下所面临的局限性,此类方法在包含混合与新型目标域的实际场景中表现不佳。
- 研究开放复合域自适应(OCDA),其中目标域由多个未区分的域组成,并在测试时包含未见的分布。
- 开发一种框架,通过利用域发现、合成域幻觉和域内适应,将复杂的OCDA问题分解为更简单、可管理的UDA问题。
- 通过确保在接近源域和遥远、未见目标域上均具备鲁棒性能,提升模型泛化能力,避免偏差对齐。
提出的方法
- 该框架首先使用基于风格的聚类在复合目标数据中发现K个潜在域,将视觉风格视为特定域的表征。
- 然后利用示例引导的图像转换网络,生成K个类似目标的源域,创建配对的源与目标潜在域,以减少域间差异。
- 针对每对域,应用独立的域判别器,通过对抗训练强制实现域不变特征学习。
- 分割模型通过多域对抗损失进行端到端训练,实现域内对齐并提升泛化能力。
- 该方法将单一、困难的OCDA问题替换为多个更简单的UDA问题,更有效地利用现有UDA技术。
- 框架使用AdaptSeg和Advent作为基线进行评估,消融研究证实了三个设计原则的互补性。
实验结果
研究问题
- RQ1在语义分割中,如何有效处理开放复合域自适应(OCDA)问题,其中目标域由多个混合且可能未见的分布组成?
- RQ2当直接将现有UDA方法应用于复合目标域时存在哪些局限性?偏差对齐如何影响模型在遥远或新型目标域上的性能?
- RQ3我们能否通过域发现与合成域生成,将复杂的OCDA问题分解为更简单、更易处理的UDA问题?
- RQ4在源域中幻觉生成类似目标的域,在多大程度上能提升适应性能并增强对未见目标域的泛化能力?
- RQ5所提出的三个组件——发现、幻觉生成与适应——如何相互作用并共同提升模型的鲁棒性与准确性?
主要发现
- 所提出的DHA框架在语义分割的GTA5到C-driving基准上实现了开放复合域自适应的新SOTA性能。
- 该方法有效解决了偏差对齐问题:与仅偏向接近源域的目标域的标准UDA方法不同,DHA能同样有效地适应接近和遥远的目标域(例如“黎明”和“夜晚”)。
- t-SNE可视化结果表明,DHA学习到的特征更具泛化性,其在已见与未见域之间的分布难以区分,而传统UDA基线则不具备此特性。
- 消融研究显示,三个组件——发现、幻觉生成与适应——具有互补性且对最优性能至关重要。
- 该框架通过设计具备对未见目标域的优越泛化能力,因为域不变特征是在多个潜在域上学习得到的。
- 定量分析表明,遥远目标域的性能在训练迭代过程中不会下降,而标准UDA方法中此类域则会出现性能衰减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。