Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptive Semantic Segmentation with Self-Supervised Depth Estimation

Qin Wang, Dengxin Dai|arXiv (Cornell University)|Apr 28, 2021
Domain Adaptation and Few-Shot Learning参考文献 58被引用 6
一句话总结

本文提出相关性感知域自适应(CorDA),一种用于语义分割的新型无监督域自适应框架,通过在源域和目标域上利用自监督深度估计来弥合域间差异。通过显式建模语义与深度特征之间的任务特征相关性,并利用深度预测差异来优化目标伪标签,CorDA 在 SYNTHIA-to-Cityscapes 上实现 55.0% mIoU 的最先进性能,在 GTA-to-Cityscapes 上实现 56.6% mIoU。

ABSTRACT

Domain adaptation for semantic segmentation aims to improve the model performance in the presence of a distribution shift between source and target domain. Leveraging the supervision from auxiliary tasks~(such as depth estimation) has the potential to heal this shift because many visual tasks are closely related to each other. However, such a supervision is not always available. In this work, we leverage the guidance from self-supervised depth estimation, which is available on both domains, to bridge the domain gap. On the one hand, we propose to explicitly learn the task feature correlation to strengthen the target semantic predictions with the help of target depth estimation. On the other hand, we use the depth prediction discrepancy from source and target depth decoders to approximate the pixel-wise adaptation difficulty. The adaptation difficulty, inferred from depth, is then used to refine the target semantic segmentation pseudo-labels. The proposed method can be easily implemented into existing segmentation frameworks. We demonstrate the effectiveness of our approach on the benchmark tasks SYNTHIA-to-Cityscapes and GTA-to-Cityscapes, on which we achieve the new state-of-the-art performance of $55.0\%$ and $56.6\%$, respectively. Our code is available at \url{https://qin.ee/corda}.

研究动机与目标

  • 解决语义分割中的域偏移问题,其中源域与目标域在外观、光照和视角上存在差异。
  • 克服现有方法仅依赖源域真实深度的局限性,通过在两个域中均可用的自监督深度估计来提升性能。
  • 通过利用跨域中语义与深度特征之间的不变相关性,提升目标域的分割性能。
  • 通过估计来自域特定深度解码器之间深度预测差异的适应难度,来优化目标伪标签的置信度。
  • 开发一种即插即用的框架,可与现有无监督域自适应(UDA)分割架构兼容,便于实际部署。

提出的方法

  • 在源域和目标域的立体图像对或视频序列上训练自监督深度估计器,以生成伪深度监督信号。
  • 引入域共享的多模态蒸馏模块,显式学习并迁移语义与深度特征之间的任务特征相关性。
  • 使用域特定的深度解码器对同一张目标图像进行深度预测,并计算其预测差异作为适应难度的近似。
  • 利用估计的适应难度,在自训练过程中重新加权或优化目标语义分割伪标签的置信度。
  • 将相关性学习与伪标签优化模块整合进标准的自训练 UDA 流程中,无需对抗性训练组件。
  • 通过使用轻量级、可微的模块,确保与现有分割框架的兼容性,使其可轻松嵌入编码器-解码器架构中。

实验结果

研究问题

  • RQ1仅通过立体或视频序列的自监督深度估计,是否能有效减少语义分割中的域偏移,而无需真实深度监督?
  • RQ2如何显式建模并迁移语义与深度特征之间的相关性,以提升分割泛化能力?
  • RQ3来自两个域特定解码器的深度预测差异,能否作为目标域适应难度的可靠代理?
  • RQ4利用基于深度的适应难度优化目标伪标签,是否能相比标准自训练基线提升分割精度?
  • RQ5所提方法是否能在如 SYNTHIA-to-Cityscapes 和 GTA-to-Cityscapes 等多样化域自适应基准上实现最先进性能?

主要发现

  • CorDA 在 SYNTHIA-to-Cityscapes 基准上实现了 55.0% mIoU 的新最先进性能,相比之前最先进方法 DACS 提升了 6.7 个百分点。
  • 在 GTA-to-Cityscapes 基准上,CorDA 达到 56.6% mIoU,相比 DACS 提升 4.5 个百分点,且显著优于其他引入深度信息的方法。
  • 即使仅使用 ImageNet 预训练权重,该方法仍保持有效性,在 SYNTHIA-to-Cityscapes 上达到 54.6% mIoU,在 GTA-to-Cityscapes 上达到 56.4% mIoU,表明对预训练选择具有鲁棒性。
  • 定性结果表明,对如人行道和道路等模糊类别有显著改进,说明其在难以区分的语义区域中具有更好的泛化能力。
  • 消融实验验证了显式相关性学习与基于深度的伪标签优化两个组件对性能提升均有显著贡献。
  • 该方法在单目与立体深度估计两种模态下均表现一致,无论深度估计方式如何,均能实现稳定的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。