[论文解读] Segmenting Moving Objects via an Object-Centric Layered Representation
该论文提出了一种基于对象中心的分层表示(OCLR)模型,仅使用光流作为输入,即可在视频中分割并追踪多个运动物体。该基于Transformer的架构能够预测非可视掩码(amodal masks)和按深度排序的图层,从而在遮挡情况下表现出鲁棒性能;模型仅在合成数据上进行训练,却在DAVIS、MoCA、SegTrack和FBMS-59数据集上取得了最先进(SOTA)的结果,且通过使用自监督特征进行推理时适应(test-time adaptation)进一步提升了性能。
The objective of this paper is a model that is able to discover, track and segment multiple moving objects in a video. We make four contributions: First, we introduce an object-centric segmentation model with a depth-ordered layer representation. This is implemented using a variant of the transformer architecture that ingests optical flow, where each query vector specifies an object and its layer for the entire video. The model can effectively discover multiple moving objects and handle mutual occlusions; Second, we introduce a scalable pipeline for generating multi-object synthetic training data via layer compositions, that is used to train the proposed model, significantly reducing the requirements for labour-intensive annotations, and supporting Sim2Real generalisation; Third, we conduct thorough ablation studies, showing that the model is able to learn object permanence and temporal shape consistency, and is able to predict amodal segmentation masks; Fourth, we evaluate our model, trained only on synthetic data, on standard video segmentation benchmarks, DAVIS, MoCA, SegTrack, FBMS-59, and achieve state-of-the-art performance among existing methods that do not rely on any manual annotations. With test-time adaptation, we observe further performance boosts.
研究动机与目标
- 开发一种能够发现、追踪并分割视频中多个运动物体的模型,即使在相互遮挡条件下也能有效工作。
- 在不依赖外观线索或人工标注的情况下,实现物体恒常性(object permanence)和时间上形状的一致性。
- 通过仅在可扩展的合成数据集上进行训练,降低对昂贵人工标注数据的依赖。
- 仅使用光流作为输入,实现强大的模拟到真实(Sim2Real)泛化能力,避免领域偏移问题。
- 证明仅从光流中通过深度排序的图层结构,即可有效学习非可视掩码预测。
提出的方法
- OCLR 模型采用基于Transformer的架构,使用可学习查询向量,为视频中每个物体预测非可视分割掩码和图层排序。
- 每个查询向量编码了物体完整的(非可视的)形状及其按深度排序的图层,从而在遮挡过程中保持一致的表示。
- 模型在通过形变物体、运动相机和非静态背景的图层组合生成的合成数据集上进行训练,以模拟真实世界中的多样性。
- 采用深度排序的图层机制,从非可视预测中重建可见掩码,利用遮挡线索推断深度顺序。
- 推理时适应(test-time adaptation)引入来自自监督DINO模型的外观特征,进一步提升在真实数据上的性能。
- 模型利用光流的不连续性检测物体边界,并在部分遮挡情况下仍能学习时间一致性。
实验结果
研究问题
- RQ1仅在合成光流数据上进行训练的模型,能否有效学习发现并分割多个运动物体的非可视掩码?
- RQ2此类模型在部分遮挡和相互遮挡条件下,能否保持物体恒常性和时间上形状的一致性?
- RQ3仅使用光流的模型方法是否能有效泛化到真实世界视频分割基准,而无需微调?
- RQ4使用自监督外观特征进行推理时适应,能在多大程度上提升模型在真实数据上的性能?
- RQ5分层的、以物体为中心的表示能否从光流中的遮挡模式中推断出深度顺序?
主要发现
- OCLR 模型在仅使用合成数据训练的情况下,于 DAVIS、MoCA、SegTrack 和 FBMS-59 基准上均达到最先进性能,mIoU 分数分别为:DAVIS 55.1、MoCA 54.5、SegTrackv2 55.7。
- 通过使用 DINO 特征进行推理时适应后,模型在 DAVIS 上达到 64.4 的 mIoU,MoCA 上达到 65.2,SegTrackv2 上达到 63.6,优于多个有监督方法。
- 模型成功学习了物体恒常性,在物体长时间被遮挡的情况下仍能保持非可视掩码的一致性。
- 模型能从光流中的遮挡模式准确预测深度顺序,从而实现可见掩码的正确图层组合。
- 合成数据生成流程有效覆盖了真实世界中的各种变化,包括多个形变物体、运动重叠和相机运动。
- 模型从合成数据到真实数据的泛化能力极强,由于仅使用光流作为输入模态,表现出极小的 Sim2Real 差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。