Skip to main content
QUICK REVIEW

[论文解读] A Transductive Approach for Video Object Segmentation

Yizhuo Zhang, Zhirong Wu|arXiv (Cornell University)|Apr 15, 2020
Advanced Neural Network Applications参考文献 47被引用 7
一句话总结

本文提出了一种简单、快速且高效的归纳方法,用于半监督视频实例分割,通过在时空嵌入空间中进行标签传播,无需依赖外部模块、数据集或网络架构修改。在 DAVIS 2017 验证集上达到 72.3% 的性能,在测试集上达到 63.1% 的性能,推理速度为 37 fps,为未来研究提供了强大且高效的基线。

ABSTRACT

Semi-supervised video object segmentation aims to separate a target object from a video sequence, given the mask in the first frame. Most of current prevailing methods utilize information from additional modules trained in other domains like optical flow and instance segmentation, and as a result they do not compete with other methods on common ground. To address this issue, we propose a simple yet strong transductive method, in which additional modules, datasets, and dedicated architectural designs are not needed. Our method takes a label propagation approach where pixel labels are passed forward based on feature similarity in an embedding space. Different from other propagation methods, ours diffuses temporal information in a holistic manner which take accounts of long-term object appearance. In addition, our method requires few additional computational overhead, and runs at a fast $\sim$37 fps speed. Our single model with a vanilla ResNet50 backbone achieves an overall score of 72.3 on the DAVIS 2017 validation set and 63.1 on the test set. This simple yet high performing and efficient method can serve as a solid baseline that facilitates future research. Code and models are available at \url{https://github.com/microsoft/transductive-vos.pytorch}.

研究动机与目标

  • 解决半监督视频实例分割问题,且不依赖于光流或实例分割等外部模块。
  • 利用时空体积中的长期时序依赖性和未标注结构,提升分割的一致性。
  • 开发一种兼具高效率与高性能的方法,作为未来研究的强基线。
  • 在无显式跟踪或平滑模块的情况下,确保在形变和遮挡下的时序稳定性和鲁棒性。

提出的方法

  • 该方法在时空图中执行标签传播,其中像素亲和度基于学习到的嵌入空间中的特征相似性计算得出。
  • 通过空间和运动先验建模局部依赖性,通过预训练的 ResNet-50 提供的外观特征建模全局依赖性。
  • 时序扩散在整个时间范围内从第一帧到当前帧整体进行,近期历史采用密集采样,远期历史采用稀疏采样。
  • 推理仅需通过主干网络的前向传播以及与缓存的历史嵌入进行点积运算,实现每帧恒定时间计算。
  • 该方法端到端训练,无需额外数据集、预训练或除标准 ResNet-50 外的架构修改。
  • 对学习到的基于相似性的光流应用空间平滑约束,但发现该操作会降低分割性能。

实验结果

研究问题

  • RQ1基于标签传播的简单归纳方法是否能在无外部模块的情况下实现视频实例分割的竞争力表现?
  • RQ2在时空体积中整体利用长期时序依赖性的效果如何?
  • RQ3此类方法是否能在保持时序一致性的同时实现高推理速度,并具备对遮挡的鲁棒性?
  • RQ4该模型在无显式光流监督的情况下,隐式学习运动线索的程度如何?

主要发现

  • 该方法在 DAVIS 2017 验证集上达到 72.3% 的总体得分,在测试集上达到 63.1%,优于许多无需外部模块的先前方法。
  • 在单张 Titan Xp GPU 上以 37 fps 的速度运行,显著快于大多数最先进方法,同时保持了具有竞争力的准确率。
  • 在 YouTube-VOS 验证集上,达到 67.8% 的总体得分,优于所有先前方法,仅除经过大量预训练的 STM 外。
  • 该模型展现出优越的时序稳定性,帧间预测保持一致,而如 PreMVOS 等方法则频繁出现身份切换问题。
  • 学习到的基于相似性的光流在物体上保持一致,但在背景上存在噪声,且添加显式平滑约束会降低分割性能。
  • 从 DAVIS 到 YouTube-VOS 的迁移学习可达到 67.4% 的总体得分,表明其具备强大的泛化能力,且无需微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。