Skip to main content
QUICK REVIEW

[论文解读] Learning Position and Target Consistency for Memory-based Video Object Segmentation

Li Hu, Peng Zhang|arXiv (Cornell University)|Apr 9, 2021
Visual Attention and Saliency Detection被引用 5
一句话总结

该论文提出LCM,一种新颖的基于记忆的半监督视频实例分割框架,通过位置一致性学习(位置引导模块,PGM)和目标一致性学习(目标关系模块,ORM)来提升性能。通过整合时空轨迹感知与实例级特征一致性,LCM在DAVIS和Youtube-VOS数据集上取得最先进结果,在DAVIS 2020半监督VOS挑战赛中排名第一,于DAVIS-2016数据集上达到90.7%的平均F值。

ABSTRACT

This paper studies the problem of semi-supervised video object segmentation(VOS). Multiple works have shown that memory-based approaches can be effective for video object segmentation. They are mostly based on pixel-level matching, both spatially and temporally. The main shortcoming of memory-based approaches is that they do not take into account the sequential order among frames and do not exploit object-level knowledge from the target. To address this limitation, we propose to Learn position and target Consistency framework for Memory-based video object segmentation, termed as LCM. It applies the memory mechanism to retrieve pixels globally, and meanwhile learns position consistency for more reliable segmentation. The learned location response promotes a better discrimination between target and distractors. Besides, LCM introduces an object-level relationship from the target to maintain target consistency, making LCM more robust to error drifting. Experiments show that our LCM achieves state-of-the-art performance on both DAVIS and Youtube-VOS benchmark. And we rank the 1st in the DAVIS 2020 challenge semi-supervised VOS task.

研究动机与目标

  • 解决仅依赖像素级相似性的基于记忆的VOS方法在外观变化、遮挡和干扰物情况下的性能局限。
  • 通过在整个视频序列中强制实施实例级一致性,提升对误差漂移的鲁棒性。
  • 利用时空运动轨迹以更可靠地实现分割,通过建模位置一致性。
  • 将全局记忆检索与局部位置及目标感知上下文融合相结合,以增强特征判别能力。
  • 在不牺牲推理速度的前提下,实现在标准VOS基准上的最先进性能。

提出的方法

  • LCM基于STM框架采用全局检索模块(GRM),在时空记忆中执行密集的像素级特征匹配。
  • 位置引导模块(PGM)学习位置响应图,通过建模运动轨迹先验来促进位置一致性。
  • 目标关系模块(ORM)从第一帧掩码中编码实例级关系,以在帧间保持目标一致性。
  • PGM与ORM被整合进记忆机制中,以优化注意力图并抑制外观相似的干扰物带来的误检。
  • 该框架采用三阶段训练策略:在ImageNet上进行预训练,施加时间限制进行训练,最后在视频序列上进行端到端微调。
  • 推理效率高,仅在单张P100 GPU上比STM增加6%的运行时间。

实验结果

研究问题

  • RQ1通过运动轨迹建模学习位置一致性是否能提升基于记忆的VOS的分割精度?
  • RQ2实例级特征关系是否能增强长视频序列中的目标一致性并减少误差漂移?
  • RQ3将像素级匹配与位置及目标感知上下文结合,是否能在标准基准上实现最先进性能?
  • RQ4与现有基于记忆和传播的算法相比,所提框架在精度和推理速度上的表现如何?
  • RQ5各组件(PGM、ORM、GRM)对整体性能的贡献如何?训练策略对结果的影响是什么?

主要发现

  • LCM在DAVIS-2016验证集上达到90.7%的平均F值,优于此前最先进方法KMN(90.5%)和STM(89.3%)。
  • 在DAVIS-2017验证集上,LCM在未进行预训练的情况下仍达到79.2%的平均交并比,展现出强大的泛化能力。
  • 消融实验表明,禁用PGM或ORM会使性能分别下降至77.8%和78.4%,证实二者关键作用。
  • GRM是基础模块——若移除它,性能降至67.5%,表明其对基于记忆检索的必要性。
  • 三阶段训练策略取得最佳性能(平均得分83.5%),优于跳过时序序列学习的策略。
  • 定性结果表明,LCM在处理遮挡、外观变化及相似物体混淆方面比STM更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。