Skip to main content
QUICK REVIEW

[论文解读] Collaborative Video Object Segmentation by Foreground-Background Integration

Zongxin Yang, Yunchao Wei|arXiv (Cornell University)|Mar 18, 2020
Visual Attention and Saliency Detection参考文献 44被引用 21
一句话总结

本文提出 CFBI,一种新颖的弱监督视频实例分割框架,通过联合学习前景与背景特征嵌入以减少背景混淆。通过将像素级与实例级嵌入结合使用协同集成器,并采用平衡的随机裁剪策略,CFBI 在无需微调或数据增强的情况下,在 DAVIS 2016 上达到 89.4%(J&F)的最先进性能,在 DAVIS 2017 上达到 81.9%,在 YouTube-VOS 上达到 81.4%。

ABSTRACT

This paper investigates the principles of embedding learning to tackle the challenging semi-supervised video object segmentation. Different from previous practices that only explore the embedding learning using pixels from foreground object (s), we consider background should be equally treated and thus propose Collaborative video object segmentation by Foreground-Background Integration (CFBI) approach. Our CFBI implicitly imposes the feature embedding from the target foreground object and its corresponding background to be contrastive, promoting the segmentation results accordingly. With the feature embedding from both foreground and background, our CFBI performs the matching process between the reference and the predicted sequence from both pixel and instance levels, making the CFBI be robust to various object scales. We conduct extensive experiments on three popular benchmarks, i.e., DAVIS 2016, DAVIS 2017, and YouTube-VOS. Our CFBI achieves the performance (J$F) of 89.4%, 81.9%, and 81.4%, respectively, outperforming all the other state-of-the-art methods. Code: https://github.com/z-x-yang/CFBI.

研究动机与目标

  • 为解决弱监督视频实例分割中的背景混淆问题,即相似背景物体误导前景预测。
  • 通过整合像素级与实例级特征嵌入,提升对物体尺度变化的鲁棒性。
  • 通过在训练过程中引入平衡的随机裁剪策略,消除模型对背景的训练偏差。
  • 通过隐式对比学习增强前景与背景特征之间的对比性。
  • 在无需微调或后处理的情况下,实现高精度与快速推理(5 FPS)。

提出的方法

  • 提出一种协同集成器,在像素与实例两个层级融合前景与背景嵌入的预测结果。
  • 引入多局部窗口匹配机制,提升连续帧之间局部特征的匹配能力,增强模型鲁棒性。
  • 采用实例级注意力机制,引导大尺度物体的分割,减少像素级多样性带来的噪声。
  • 在训练过程中采用平衡的随机裁剪策略,防止模型偏向背景特征。
  • 采用序列化训练策略,利用前一帧的预测掩码作为监督信号,提升时序一致性。
  • 通过带独立偏置项的距离度量,对前景与背景嵌入施加对比学习约束。

实验结果

研究问题

  • RQ1联合学习前景与背景嵌入是否能提升弱监督视频实例分割的分割精度?
  • RQ2整合像素级与实例级嵌入在应对物体尺度变化时,对模型鲁棒性有何影响?
  • RQ3当仅使用前景特征时,背景混淆对性能的损害程度如何?
  • RQ4平衡的随机裁剪训练策略是否能有效降低模型对背景特征的偏差?
  • RQ5多种嵌入类型协同集成在提升分割质量方面效果如何?

主要发现

  • CFBI 在 DAVIS 2016 上达到 89.4%(J&F),优于所有先前的最先进方法,且无需微调或数据增强。
  • 在 DAVIS 2017 上,CFBI 达到 81.9%(J&F),显著优于基线方法 FEELVOS(68.3%)。
  • 在 YouTube-VOS 上,CFBI 达到 81.4%(J&F),展现出在多样化视频分布上的强大泛化能力。
  • 在采用多尺度与翻转增强后,性能进一步提升至 DAVIS 2016 的 90.1%、DAVIS 2017 的 83.3%,以及 YouTube-VOS 的 82.7%。
  • 消融实验表明,若移除背景嵌入,性能将从 74.9% 下降至 70.9%,证明其在减少混淆中的关键作用。
  • 与动态分割头基线相比,采用多局部窗口与实例级注意力的协同集成器使性能提升 1.6%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。