Skip to main content
QUICK REVIEW

[论文解读] ViP-DeepLab: Learning Visual Perception with Depth-aware Video Panoptic Segmentation

Siyuan Qiao, Yukun Zhu|arXiv (Cornell University)|Dec 9, 2020
Advanced Vision and Imaging参考文献 95被引用 7
一句话总结

ViP-DeepLab 提出了一种用于深度感知视频全景分割(DVPS)的统一模型,通过联合执行单目深度估计与视频全景分割来解决视觉中的逆投影问题。该方法在 KITTI 深度估计和 KITTI MOTS 上均取得 SOTA 结果,排名首位,并在 Cityscapes-VPS 上以 5.1% 的更高 VPQ 超越先前方法。

ABSTRACT

In this paper, we present ViP-DeepLab, a unified model attempting to tackle the long-standing and challenging inverse projection problem in vision, which we model as restoring the point clouds from perspective image sequences while providing each point with instance-level semantic interpretations. Solving this problem requires the vision models to predict the spatial location, semantic class, and temporally consistent instance label for each 3D point. ViP-DeepLab approaches it by jointly performing monocular depth estimation and video panoptic segmentation. We name this joint task as Depth-aware Video Panoptic Segmentation, and propose a new evaluation metric along with two derived datasets for it, which will be made available to the public. On the individual sub-tasks, ViP-DeepLab also achieves state-of-the-art results, outperforming previous methods by 5.1% VPQ on Cityscapes-VPS, ranking 1st on the KITTI monocular depth estimation benchmark, and 1st on KITTI MOTS pedestrian. The datasets and the evaluation codes are made publicly available.

研究动机与目标

  • 通过从 2D 图像序列恢复具有语义与实例级一致性的 3D 点云,来解决视觉中的逆投影问题。
  • 将单目深度估计与视频全景分割统一为单一任务,称为深度感知视频全景分割(DVPS)。
  • 开发一种新的评估度量——深度感知视频全景质量(DVPQ),联合衡量深度与分割性能。
  • 通过在现有数据中增加深度与 3D 标注,构建两个公开数据集:Cityscapes-DVPS 与 SemKITTI-DVPS。
  • 建立 DVPS 的新 SOTA 基线,在单目深度估计与多目标跟踪等子任务上均表现优异。

提出的方法

  • 扩展 Panoptic-DeepLab 以在连续视频帧之间执行中心回归,通过偏移预测实现时序一致的实例跟踪。
  • 采用双流架构,共享主干网络,深度估计与全景分割分别使用独立分支头,实现端到端训练。
  • 应用测试时增强(多尺度推理与水平翻转)与数据增强(AutoAugment)以提升鲁棒性。
  • 引入递归特征金字塔(RFP)与密集上下文模块,以增强特征表示与时序一致性。
  • 通过在未标注视频序列上进行伪标签自监督学习,提升时序一致性,而无需额外标注。
  • 在 KITTI MOTS 上使用卡尔曼滤波后处理,以优化遮挡或漏检目标的定位性能。

实验结果

研究问题

  • RQ1统一的深度学习模型能否有效联合执行单目深度估计与视频全景分割?
  • RQ2在不依赖复杂跟踪头的情况下,如何实现跨视频帧的实例级预测时序一致性?
  • RQ3在未标注视频序列上进行自监督预训练对 DVPS 性能的提升有何影响?
  • RQ4单一模型能否在多个子任务(深度估计、视频全景分割、多目标跟踪)上均实现 SOTA 性能?
  • RQ5所提出的 DVPQ 度量与现有度量相比,在联合评估视频中深度与分割性能方面表现如何?

主要发现

  • 在 Cityscapes-VPS 基准上,ViP-DeepLab 的 VPQ 比先前 SOTA 方法 VPSNet 高出 5.1%。
  • 在 KITTI 单目深度估计基准上,ViP-DeepLab 的 SILog 损失比 DORN 低 0.97,且优于使用行星尺度深度数据的 MPSD。
  • 在 KITTI MOTS 基准上,ViP-DeepLab 在行人上的 sMOTSA 达 67.7%,在车辆上的 sMOTSA 达 80.6%,排名第一,分别优于 PointTrack 7.2% 和 2.5%。
  • 引入卡尔曼滤波后处理后,行人 sMOTSA 提升 1.0%,车辆 sMOTSA 提升 0.4%,表明其在处理遮挡方面具有显著效果。
  • 在未标注的 Cityscapes 视频上使用伪标签进行自监督预训练,使 VPQ4 提升 0.6%,表明在长期时序一致性方面有显著增益。
  • 该模型在未使用任何额外深度训练数据(除 ImageNet 与 Cityscapes 外)的情况下仍实现 SOTA 性能,凸显其强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。