[论文解读] Learning a Spatio-Temporal Embedding for Video Instance Segmentation
本文提出了一种用于视频实例分割的实时、因果时空嵌入网络,通过联合利用外观、运动和单目深度信息,在时间维度上对同一物体的像素进行聚类。通过采用3D因果卷积网络和自监督深度估计,该方法在KITTI MOTS数据集上实现了最先进性能,能够在不进行后处理的情况下实现对遮挡和漏检情况的鲁棒跟踪。
We present a novel embedding approach for video instance segmentation. Our method learns a spatio-temporal embedding integrating cues from appearance, motion, and geometry; a 3D causal convolutional network models motion, and a monocular self-supervised depth loss models geometry. In this embedding space, video-pixels of the same instance are clustered together while being separated from other instances, to naturally track instances over time without any complex post-processing. Our network runs in real-time as our architecture is entirely causal - we do not incorporate information from future frames, contrary to previous methods. We show that our model can accurately track and segment instances, even with occlusions and missed detections, advancing the state-of-the-art on the KITTI Multi-Object and Tracking Dataset.
研究动机与目标
- 开发一种实时视频实例分割方法,通过不依赖未来帧信息来保持时间一致性。
- 通过利用时空嵌入提升实例跟踪在遮挡和漏检情况下的鲁棒性。
- 将单目深度估计作为自监督监督信号,以增强嵌入的可区分性。
- 通过端到端训练直接学习聚类友好的嵌入空间,从而消除复杂的后处理步骤。
- 通过完全因果的架构,在KITTI多目标跟踪数据集(MOTS)上推动最先进技术水平。
提出的方法
- 使用3D因果卷积神经网络处理历史帧,将时空运动线索编码到嵌入空间中。
- 采用自监督单目深度损失,从连续帧中预测深度,以提升嵌入中的几何一致性。
- 时空嵌入损失促使同一实例的像素紧密聚类,同时与其它实例保持分离。
- 通过在累积的历史嵌入上进行均值漂移聚类,利用吸引半径和排斥半径实现跨时间的实例匹配。
- 模型通过联合损失函数进行端到端训练,该损失函数结合了实例级别的嵌入一致性与深度预测。
- 所有组件均设计为因果结构,确保仅使用过去和当前帧实现实时推理。
实验结果
研究问题
- RQ1因果3D卷积网络能否有效建模运动和时间上下文以实现视频实例分割?
- RQ2将自监督单目深度信息引入是否能提升时空嵌入的质量与鲁棒性?
- RQ3所提出的嵌入损失是否能在无需后处理的情况下实现遮挡和漏检情况下的稳定实例跟踪?
- RQ4序列长度如何影响所学习的时空嵌入的稳定性和性能?
- RQ5几何信息的整合在多大程度上能增强外观相似或重叠物体之间的可区分性?
主要发现
- 该模型在KITTI MOTS数据集上实现了0.714的MOTSA得分和0.644的sMOTSA得分,达到最先进水平。
- 引入真实聚类和背景分割后,sMOTSA从0.461提升至0.644,证明了准确聚类的显著优势。
- 训练的最优序列长度为五帧,因为更长的序列会因长期嵌入约束冲突而降低性能。
- 当序列长度超过10帧时,性能显著下降(sMOTSA: 0.273),表明模型在建模长期动态方面存在局限。
- 深度信息的引入改善了嵌入结构,并在定性结果中展示了其在完全和部分遮挡情况下的正确跟踪能力。
- 由于嵌入空间中保留了时间上下文,该模型成功实现了对完整遮挡实例的跟踪,例如图3(c)中的绿车。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。