Skip to main content
QUICK REVIEW

[论文解读] Visualizing the Invisible: Occluded Vehicle Segmentation and Recovery

Xiaosheng Yan, Yuanlong Yu|arXiv (Cornell University)|Jul 22, 2019
Generative Adversarial Networks and Image Synthesis参考文献 56被引用 6
一句话总结

该论文提出了一种用于被遮挡车辆的非可见部分分割与外观恢复的迭代多任务框架,采用耦合判别器与3D模型库以实现逼真的分割补全,并通过共享双路径网络实现高保真度的外观生成。该方法在新构建的被遮挡车辆数据集上达到了最先进性能,并显著提升了真实视频中被遮挡车辆的跟踪效果。

ABSTRACT

In this paper, we propose a novel iterative multi-task framework to complete the segmentation mask of an occluded vehicle and recover the appearance of its invisible parts. In particular, to improve the quality of the segmentation completion, we present two coupled discriminators and introduce an auxiliary 3D model pool for sampling authentic silhouettes as adversarial samples. In addition, we propose a two-path structure with a shared network to enhance the appearance recovery capability. By iteratively performing the segmentation completion and the appearance recovery, the results will be progressively refined. To evaluate our method, we present a dataset, the Occluded Vehicle dataset, containing synthetic and real-world occluded vehicle images. We conduct comparison experiments on this dataset and demonstrate that our model outperforms the state-of-the-art in tasks of recovering segmentation mask and appearance for occluded vehicles. Moreover, we also demonstrate that our appearance recovery approach can benefit the occluded vehicle tracking in real-world videos.

研究动机与目标

  • 为解决在真实世界图像中准确分割并恢复被部分遮挡车辆外观的挑战。
  • 弥合深度学习模型与人类视觉感知在推理不可见物体部分方面的差距。
  • 提升在遮挡频繁发生的拥挤或杂乱场景中车辆跟踪系统的鲁棒性。
  • 开发一个统一框架,通过迭代优化同时改进分割与外观恢复,以提升视觉保真度。
  • 构建一个用于评估被遮挡车辆背景下非可见部分分割与外观恢复的新基准数据集。

提出的方法

  • 采用带有两个耦合判别器的分割补全网络:实例判别器用于匹配真实实例掩码,对象判别器用于确保生成的掩码与真实车辆轮廓相似。
  • 引入辅助3D车辆模型库,用于生成具有真实轮廓的对抗样本,从而提升分割补全的逼真度与质量。
  • 设计一个共享权重的双路径外观恢复网络:一条路径用于恢复不可见部分的颜色,另一条路径执行完整的前景修复以增强特征学习。
  • 通过将恢复结果反馈至网络进行多轮迭代优化,逐步提升分割与外观质量。
  • 采用端到端训练,结合对抗损失、L1/L2损失与感知相似性(SSIM),以平衡保真度与真实感。
  • 推理阶段仅使用第一条路径以实现高效的外观生成,而第二条路径通过知识蒸馏提升训练效果。

实验结果

研究问题

  • RQ1多任务、迭代框架是否能够超越当前最先进方法,在被遮挡车辆的非可见部分分割与外观恢复方面实现联合性能提升?
  • RQ2利用3D模型库生成逼真对抗轮廓在提升分割补全质量方面效果如何?
  • RQ3与单路径生成相比,采用共享权重的双路径架构是否能显著提升外观恢复质量?
  • RQ4外观恢复在多大程度上改善了真实世界视频序列中被遮挡车辆的跟踪性能?
  • RQ5与现有方法相比,所提方法在用户感知与视觉合理性方面表现如何?

主要发现

  • 在人类评估中,该方法获得最高用户偏好,84.8%的参与者选择其结果为最佳,优于Deepfill、pix2pix、SeGAN及自身方法。
  • 在合成数据上,经过两轮迭代后,该方法的L1损失为0.0158,SSIM为0.9447,优于pix2pix(L1: 0.0174,SSIM: 0.9410)与SeGAN(L1: 0.0181,SSIM: 0.9371)。
  • 在真实世界图像中,该方法将Vid-1的平均像素误差(APE)从34.60降至8.32,Vid-3从87.71降至21.51;同时将平均重叠(AO)分别从0.6489提升至0.8072,从0.3584提升至0.6755。
  • 外观恢复模块显著提升了跟踪性能,KCF跟踪器在四组真实视频序列中平均APE降低75%。
  • 共享权重的双路径网络显著提升了外观恢复质量,表现为更高的SSIM与更低的L1/L2损失,优于单路径基线方法。
  • 使用基于3D模型的对抗样本可生成更具真实感与结构准确性的分割掩码,尤其在复杂遮挡场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。