Skip to main content
QUICK REVIEW

[论文解读] Occluded Video Instance Segmentation: A Benchmark

Jiyang Qi, Yan Gao|arXiv (Cornell University)|Feb 2, 2021
Multimodal Machine Learning Applications被引用 8
一句话总结

本文提出了 OVIS,一个大规模遮挡视频实例分割基准,包含 25 个类别中的 296k 个实例掩码,具有严重的遮挡情况。该工作提出了一种即插即用的时序特征校准模块,通过利用相邻帧来增强特征表示,在 MaskTrack R-CNN 上实现 4.6 AP 提升,在 SipMask 上实现 4.1 AP 提升,凸显了在视频理解系统中改进遮挡推理能力的迫切需求。

ABSTRACT

Can our video understanding systems perceive objects when a heavy occlusion exists in a scene? To answer this question, we collect a large-scale dataset called OVIS for occluded video instance segmentation, that is, to simultaneously detect, segment, and track instances in occluded scenes. OVIS consists of 296k high-quality instance masks from 25 semantic categories, where object occlusions usually occur. While our human vision systems can understand those occluded instances by contextual reasoning and association, our experiments suggest that current video understanding systems cannot. On the OVIS dataset, the highest AP achieved by state-of-the-art algorithms is only 16.3, which reveals that we are still at a nascent stage for understanding objects, instances, and videos in a real-world scenario. We also present a simple plug-and-play module that performs temporal feature calibration to complement missing object cues caused by occlusion. Built upon MaskTrack R-CNN and SipMask, we obtain a remarkable AP improvement on the OVIS dataset. The OVIS dataset and project code are available at http://songbai.site/ovis .

研究动机与目标

  • 为解决现实世界视频理解中常见但研究不足的严重物体遮挡场景下的视频实例分割挑战。
  • 构建一个大规模、高质量的基准数据集,专门用于评估模型在遮挡视频实例分割任务上的性能。
  • 探究当前视频理解模型在感知遮挡物体方面与人类视觉感知相比的局限性。
  • 提出并验证一种即插即用模块,通过利用时序上下文来补偿因遮挡导致的视觉线索缺失,从而提升性能。
  • 为未来在遮挡感知建模、数据增强以及视频实例分割的自监督预训练方面的研究提供基础。

提出的方法

  • OVIS 数据集包含 25 个语义类别,5,223 个严重遮挡的实例,以及 296k 个高质量实例掩码,遮挡程度明确标注为未遮挡(绿色)、轻微遮挡(黄色)和严重遮挡(红色)。
  • 引入一种基于 AP 的新度量标准,用于在不同遮挡水平下评估性能,实现对模型鲁棒性的细粒度分析。
  • 提出一种即插即用的时序特征校准(TFC)模块,利用可变形卷积从参考帧学习校准偏移量,以优化特征嵌入。
  • 对于查询帧,TFC 模块在 ε_test 范围内选择参考帧,利用查询帧的特征计算校准偏移量,并将其应用于参考帧的特征,以提升其表示能力。
  • 经过优化的参考帧特征随后用于辅助查询帧的对象识别与分割,有效恢复因遮挡而缺失的线索。
  • TFC 模块被应用于两种强基线模型——MaskTrack R-CNN 和 SipMask——在所有遮挡水平下均表现出一致的 AP 提升。

实验结果

研究问题

  • RQ1当前最先进视频实例分割模型在严重遮挡场景下的表现与人类视觉感知相比如何?
  • RQ2相邻帧的时序上下文在多大程度上能提升视频实例分割中对遮挡物体的识别能力?
  • RQ3一种利用时序信息进行特征校准的即插即用模块,能否显著提升遮挡视频实例分割的性能?
  • RQ4在遮挡场景下,时序特征校准的最优参考帧范围(ε_test)是多少?
  • RQ5时序特征校准带来的性能增益在不同遮挡水平(未遮挡、轻微遮挡、严重遮挡)下如何变化?

主要发现

  • 任何最先进算法在 OVIS 基准上的最高平均精度(AP)仅为 16.3,表明其与非遮挡数据集上的模型相比存在显著性能差距。
  • 在最具挑战性的类别——严重遮挡物体中,最高 AP 仅为 6.3,表明当前模型在严重遮挡情况下表现显著不足。
  • 所提出的时序特征校准(TFC)模块在 MaskTrack R-CNN 上实现 4.6 点的 AP 提升,在 SipMask 上实现 4.1 点的 AP 提升,表明其在不同架构间具有强大的泛化能力。
  • 最优参考帧范围 ε_test 被确定为 5,在该值下性能达到峰值,且即使 ε_test = 1 也优于 ε_test = 0,证明相邻帧提供了宝贵的上下文信息。
  • 严重遮挡物体的 AP 相对增益最高(AP_HO),表明时序特征校准在最需要的地方效果最显著。
  • 轻微遮挡物体的增益(AP_MO)适中,而未遮挡物体的增益(AP_SO)最小,证实该模块专门针对遮挡补偿而设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。