Skip to main content
QUICK REVIEW

[论文解读] Efficient Regional Memory Network for Video Object Segmentation

Haozhe Xie, Hongxun Yao|arXiv (Cornell University)|Mar 24, 2021
Advanced Image and Video Retrieval Techniques参考文献 38被引用 9
一句话总结

该论文提出了一种新型的半监督视频实例分割方法——区域记忆网络(RMNet),通过在记忆中的物体区域与查询帧之间进行局部到局部的特征匹配,减少因相似物体带来的歧义性以及计算成本。通过利用光流进行区域追踪,并采用区域记忆读取器实现局部匹配,RMNet在DAVIS和YouTube-VOS数据集上实现了最先进性能,且推理速度显著提升。

ABSTRACT

Recently, several Space-Time Memory based networks have shown that the object cues (e.g. video frames as well as the segmented object masks) from the past frames are useful for segmenting objects in the current frame. However, these methods exploit the information from the memory by global-to-global matching between the current and past frames, which lead to mismatching to similar objects and high computational complexity. To address these problems, we propose a novel local-to-local matching solution for semi-supervised VOS, namely Regional Memory Network (RMNet). In RMNet, the precise regional memory is constructed by memorizing local regions where the target objects appear in the past frames. For the current query frame, the query regions are tracked and predicted based on the optical flow estimated from the previous frame. The proposed local-to-local matching effectively alleviates the ambiguity of similar objects in both memory and query frames, which allows the information to be passed from the regional memory to the query region efficiently and effectively. Experimental results indicate that the proposed RMNet performs favorably against state-of-the-art methods on the DAVIS and YouTube-VOS datasets.

研究动机与目标

  • 为解决时空记忆网络中全局到全局匹配的局限性,该方法可有效避免与相似物体的误匹配,并降低计算成本。
  • 通过聚焦于局部物体区域,提升在外观变化、遮挡和形变情况下的跟踪鲁棒性。
  • 通过仅在记忆帧和查询帧中包含目标物体的区域上限制注意力,降低特征匹配的计算复杂度。
  • 通过高效的区域追踪与局部匹配,提升推理速度,同时保持或提升分割精度。

提出的方法

  • 仅在历史帧中存储包含物体的区域的特征,构建区域记忆,避免无关背景特征的干扰。
  • 利用相邻帧之间的光流估计,将先前的掩码进行变形,以预测当前帧中查询区域的位置。
  • 采用基于光流的区域策略,根据变形后的掩码定义查询区域,相比静态或最佳匹配区域,可提升定位精度。
  • 引入区域记忆读取器,实现记忆帧与查询帧中对应物体区域之间的局部到局部特征匹配。
  • 采用轻量级的TinyFlowNet进行高效的光流估计,显著减少推理时间,同时不损失精度。
  • 通过区域特征之间的相似度分数分配分割标签,高分表示预测置信度高。

实验结果

研究问题

  • RQ1与全局到全局匹配相比,记忆帧与查询帧中物体区域之间的局部到局部匹配是否能有效减少因相似物体带来的歧义性?
  • RQ2将特征匹配限制在包含目标物体的区域,是否能提升计算效率与分割精度?
  • RQ3基于光流的区域预测方法在定位精度与鲁棒性方面,相较于以往方法表现如何?
  • RQ4像TinyFlowNet这样的轻量级光流网络,是否能在大幅降低推理时间的同时保持性能?
  • RQ5区域记忆与局部匹配对基准数据集上整体分割性能的贡献如何?

主要发现

  • RMNet在DAVIS 2017数据集上实现了0.810的平均JIoU与0.860的平均F-measure,优于当前最先进方法。
  • 所提出的区域记忆读取器将每帧的特征匹配时间减少至2.09ms(V100 GPU上),相比全局匹配提升了5.5倍。
  • 采用基于光流的区域进行查询区域预测,平均得分为0.835,优于先前区域(0.792)与最佳匹配区域(0.819)。
  • 将TinyFlowNet替换为FlowNet2-CSS或RAFT后,精度几乎保持不变(F-measure: 0.860 vs. 0.859),但使用TinyFlowNet的RMNet分别快6倍与16倍。
  • 消融实验证实,记忆帧与查询帧中均采用区域匹配(M.R. ✓, Q.R. ✓)时性能最高(平均得分0.835),证明了局部到局部匹配的有效性。
  • 该方法在物体形变与遮挡情况下表现出强鲁棒性,得益于局部化、光流引导的区域追踪,误差累积显著减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。