Skip to main content
QUICK REVIEW

[论文解读] Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge

Jiyang Qi, Yan Gao|arXiv (Cornell University)|Nov 15, 2021
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出了 OVIS,一个大规模视频实例分割数据集,包含 296k 个高质量掩码,覆盖 901 个存在遮挡的视频场景,专为评估和推进视频理解中的遮挡推理而设计。尽管采用了最先进方法,性能仍急剧下降——在高度遮挡物体上的 AP 降至 5.6,凸显了当前模型存在的关键差距。作者通过发起 ICCV 2021 挑战赛,推动了新方法的出现,其最高 AP 达到 21.6。

ABSTRACT

Although deep learning methods have achieved advanced video object recognition performance in recent years, perceiving heavily occluded objects in a video is still a very challenging task. To promote the development of occlusion understanding, we collect a large-scale dataset called OVIS for video instance segmentation in the occluded scenario. OVIS consists of 296k high-quality instance masks and 901 occluded scenes. While our human vision systems can perceive those occluded objects by contextual reasoning and association, our experiments suggest that current video understanding systems cannot. On the OVIS dataset, all baseline methods encounter a significant performance degradation of about 80% in the heavily occluded object group, which demonstrates that there is still a long way to go in understanding obscured objects and videos in a complex real-world scenario. To facilitate the research on new paradigms for video understanding systems, we launched a challenge based on the OVIS dataset. The submitted top-performing algorithms have achieved much higher performance than our baselines. In this paper, we will introduce the OVIS dataset and further dissect it by analyzing the results of baselines and submitted methods. The OVIS dataset and challenge information can be found at http://songbai.site/ovis .

研究动机与目标

  • 为解决视频中严重遮挡物体的感知问题,当前视频理解系统在性能上与人类视觉存在显著差距。
  • 构建一个大规模、高质量的遮挡视频实例分割数据集,以更好地反映现实世界的复杂性与多样性。
  • 通过全面的基线分析,评估现有最先进视频实例分割模型在高遮挡场景下的局限性。
  • 通过发起 ICCV 2021 遮挡视频实例分割挑战赛,激发新型遮挡推理范式的研究。

提出的方法

  • 通过收集 901 个复杂视频场景构建 OVIS 数据集,涵盖多种遮挡类型,包括长序列和高物体密度,以最大化遮挡暴露程度。
  • 每个帧中的每个实例均标注了精确的实例掩码和遮挡程度评分,支持按遮挡程度进行细粒度评估。
  • 在 OVIS 上评估了九种最先进视频实例分割模型,以建立基线性能,包括 MaskTrack R-CNN、STEm-Seg 和 QueryInst。
  • ICCV 2021 挑战赛邀请提交采用新型架构和训练策略的模型,表现最佳的方法利用了时间建模技术,并从 COCO 和 Pascal VOC 等图像级数据集进行数据增强。
  • 通过消融实验分析了数据增强(如从 COCO 合成图像对)对模型遮挡鲁棒性的影响。
  • 使用标准指标(包括 AP)进行性能评估,其中特别区分了严重遮挡物体的 AP(AP_HO)。

实验结果

研究问题

  • RQ1当前最先进视频实例分割模型在严重遮挡物体上的表现与人类视觉相比如何?
  • RQ2在真实世界复杂场景中,遮挡在多大程度上降低了现有视频实例分割方法的性能?
  • RQ3哪些架构或训练创新能够提升遮挡视频实例分割的性能?
  • RQ4使用图像级实例分割数据集(如 COCO 和 Pascal VOC)进行数据增强,能否提升视频模型对遮挡的鲁棒性?
  • RQ5当前模型在遮挡场景下的主要失败模式是什么?与人类在上下文关联方面的推理相比有何差异?

主要发现

  • 所有基线方法在严重遮挡物体上均出现性能急剧下降,该组别最高 AP 仅为 5.6,表明遮挡推理方面存在重大差距。
  • 挑战赛中表现最佳的方法在测试集上的 AP 达到 21.6,显著优于最佳基线方法(16.3 AP),表明在遮挡鲁棒性方面取得进展。
  • 使用从 COCO 和 Pascal VOC 合成的图像对,使 STEm-Seg 的 AP 提升了 2.4 分(从 13.8 提升至 16.2),表明数据增强在提升遮挡泛化能力方面具有显著效果。
  • 基于 3D 卷积和自底向上架构(如 STEm-Seg)的方法在遮挡场景中表现更强,可能得益于更优的时间建模能力以及避免了检测瓶颈。
  • 失败案例揭示了持续存在的问题,如 ID 互换、完全遮挡后无法重新识别对象,以及在密集重叠场景中产生混淆。
  • 挑战赛结果表明,即使顶尖方法在严重遮挡场景下仍表现吃力,尤其当物体较小、相互重叠或完全隐藏时,凸显了改进上下文推理能力的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。