Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation for Video Semantic Segmentation

Inkyu Shin, Kwanyong Park|arXiv (Cornell University)|Jul 23, 2021
Domain Adaptation and Few-Shot Learning参考文献 32被引用 4
一句话总结

本文提出了一种新颖的两阶段无监督域自适应框架,用于视频语义分割,结合了视频对抗训练(VAT)与时间特征对齐,以及视频自训练(VST)与光流引导的伪标签优化。该方法在 VIPER 到 Cityscapes-VPS 基准上实现了最先进性能,通过利用时空上下文,在 mIoU 和 VPQ 指标上均显著优于所有先前的基于图像的 UDA 方法。

ABSTRACT

Unsupervised Domain Adaptation for semantic segmentation has gained immense popularity since it can transfer knowledge from simulation to real (Sim2Real) by largely cutting out the laborious per pixel labeling efforts at real. In this work, we present a new video extension of this task, namely Unsupervised Domain Adaptation for Video Semantic Segmentation. As it became easy to obtain large-scale video labels through simulation, we believe attempting to maximize Sim2Real knowledge transferability is one of the promising directions for resolving the fundamental data-hungry issue in the video. To tackle this new problem, we present a novel two-phase adaptation scheme. In the first step, we exhaustively distill source domain knowledge using supervised loss functions. Simultaneously, video adversarial training (VAT) is employed to align the features from source to target utilizing video context. In the second step, we apply video self-training (VST), focusing only on the target data. To construct robust pseudo labels, we exploit the temporal information in the video, which has been rarely explored in the previous image-based self-training approaches. We set strong baseline scores on 'VIPER to CityscapeVPS' adaptation scenario. We show that our proposals significantly outperform previous image-based UDA methods both on image-level (mIoU) and video-level (VPQ) evaluation metrics.

研究动机与目标

  • 解决无监督语义分割中缺乏视频专用域自适应技术的问题。
  • 通过利用大规模合成视频数据并辅以最少的真实世界标注,提升模拟到真实(Sim2Real)的迁移能力。
  • 开发一种能有效利用视频帧间时间上下文以实现鲁棒域自适应的方法。
  • 为复杂城市场景中的无监督视频域自适应建立新基准。
  • 证明视频专用自适应在视频分割任务中显著优于基于图像的自适应。

提出的方法

  • 提出两阶段框架:先进行视频对抗训练(VAT),再进行视频自训练(VST)。
  • 在 VAT 中,序列判别器利用时空特征对齐源域与目标域的分布。
  • 引入一种管状匹配损失,显式建模物体边界与形状在时间上的变化。
  • 在 VST 中,通过邻近帧的光流变形生成伪标签,以提升一致性。
  • 采用基于裁剪(cut-out)的优化策略,剔除不一致的伪标签,而非填补缺失区域。
  • 使用基于光流的变形函数 $ W_{t- au \Rightarrow t} $ 将标签从参考帧传播至目标帧,结合非遮挡掩码 $ \mathbb{I}_{t-\tau \Rightarrow t} $。

实验结果

研究问题

  • RQ1与基于图像的 UDA 方法相比,两阶段视频域自适应框架是否能显著提升真实世界视频数据上的语义分割性能?
  • RQ2显式建模时间上下文如何增强视频语义分割中的域自适应能力?
  • RQ3伪标签优化策略——填充(fill-in)与裁剪(cut-out)——对最终分割精度的影响是什么?
  • RQ4在缺乏真实标签的情况下,基于光流的标签传播在多大程度上提升了伪标签质量?
  • RQ5所提方法在复杂城市驾驶场景下的域偏移(如从仿真到真实世界 Cityscapes-VPS)中是否具备鲁棒性?

主要发现

  • 所提方法在 VIPER 到 Cityscapes-VPS 基准上实现了 51.91 mIoU 和 36.43 VPQ$^s$,显著优于所有先前的基于图像的 UDA 方法。
  • 基于裁剪的伪标签优化策略优于填充基线,有效减少了由噪声伪标签引起的误差累积。
  • 通过时间聚合,伪标签质量得到显著提升,表现为在 30% 标注比例下 P-mIoU 达到 68.8,超过类别平衡与实例自适应基线。
  • 定性结果表明,方法在视频帧之间表现出一致且清晰的预测,证实了其鲁棒性与时间一致性。
  • 该方法在复杂城市场景中展现出优越的泛化能力,对各类物体类别与运动模式均保持一致的性能表现。
  • 局限性包括对 FlowNet 的依赖,其在运动估计误差较大的类别(如 'sidewalk')上可能导致性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。