[论文解读] Learning to Segment Moving Objects in Videos
本文提出了一种新颖的视频移动物体分割方法,通过从光流边界生成逐帧的基于运动的物体提议(MOPs),并利用双路卷积神经网络(MOD)对提议进行排序。该方法通过在轨迹亲和力上进行随机游走,将排名靠前的提议扩展为时空管状结构,在 VSB100 和 Moseg 基准测试中实现了最先进性能,相较于静态提议方法,检测率提升了 7%。
We segment moving objects in videos by ranking spatio-temporal segment proposals according to "moving objectness": how likely they are to contain a moving object. In each video frame, we compute segment proposals using multiple figure-ground segmentations on per frame motion boundaries. We rank them with a Moving Objectness Detector trained on image and motion fields to detect moving objects and discard over/under segmentations or background parts of the scene. We extend the top ranked segments into spatio-temporal tubes using random walkers on motion affinities of dense point trajectories. Our final tube ranking consistently outperforms previous segmentation methods in the two largest video segmentation benchmarks currently available, for any number of proposals. Further, our per frame moving object proposals increase the detection rate up to 7\% over previous state-of-the-art static proposal methods.
研究动机与目标
- 通过利用运动线索生成更准确、更具区分度的物体提议,以提升视频物体分割性能。
- 通过直接使用光流边界进行提议生成,解决静态边界检测器在复杂场景中的局限性。
- 开发一种可训练的、与类别无关的物体度检测器,以区分运动物体与静态背景及过/欠分割区域。
- 通过结合提议排序与基于密集轨迹的时空管状结构生成,弥合运动分割与跟踪之间的差距。
- 通过基于学习到的运动物体度分数对管状结构进行排序,实现在极少提议数量下的高分割精度。
提出的方法
- 通过在光流幅值导出的运动边界上应用多种前景-背景分割方法,生成逐帧的运动物体提议(MOPs)。
- 利用在光流上训练的边界检测器检测运动边界,避免与静态边界融合,从而减少漏光伪影。
- 在图像和光流场上训练双路卷积神经网络(MOD),以预测每个提议的“运动物体度”分数,从而过滤误报。
- 通过在基于跨帧密集点轨迹计算的运动亲和力上进行随机游走,将排名靠前的 MOPs 扩展为三维时空管状结构。
- 通过与超体素的重叠将轨迹聚类映射到像素管状结构,确保时间维度上的空间一致性。
- 将管状结构的得分聚合为其生命周期内所有物体度分数之和,以偏好更长、更稳定的管状结构。
实验结果
研究问题
- RQ1与静态提议方法相比,基于运动的物体提议是否能提升对运动物体的检测率?
- RQ2学习到的运动物体度检测器在过滤过分割、欠分割或背景提议方面是否有效?
- RQ3通过轨迹随机游走实现的时空管状结构扩展,在多大程度上能提升分割精度?
- RQ4直接使用光流边界(而不与静态边界融合)是否能提升复杂场景中提议的多样性与鲁棒性?
- RQ5一种与类别无关的双路卷积神经网络能否在不依赖物体类别先验知识的情况下,有效学习检测各类运动物体?
主要发现
- 所提出的 MOPs 相较于最先进静态提议方法,检测率最高提升 7%,尤其在 VSB100 等复杂场景中表现显著。
- 基于双路卷积神经网络的运动物体度检测器(MOD)在提议排序方面优于手工设计的显著性方法及其他多层物体度基线。
- 在 VSB100 数据集上,结合 GOPs 与 MOPs 显著提升了性能,尤其在静态边界检测器失效的场景中表现突出。
- 该方法在 VSB100 和 Moseg 基准测试中均达到最先进水平,且在所有提议数量下均保持一致的优越性。
- MOD 对管状结构生命周期内得分的聚合,提升了长期跟踪的稳定性,更偏好更长、更连贯的管状结构。
- 失败案例主要源于大运动或遮挡导致的时间碎片化,提示未来需引入链接启发式方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。