Skip to main content
QUICK REVIEW

[论文解读] Memory Aggregation Networks for Efficient Interactive Video Object Segmentation

Jiaxu Miao, Yunchao Wei|arXiv (Cornell University)|Mar 30, 2020
Visual Attention and Saliency Detection参考文献 30被引用 10
一句话总结

本文提出记忆聚合网络(MA-Net),一种统一且高效的交互式视频实例分割框架,将用户交互与时间传播整合到单一网络中,并共享特征提取。通过采用记忆聚合机制,保留先前交互轮次中的有用线索,MA-Net在DAVIS 2018验证集上实现了76.1%的J@60分数,达到当前最先进水平,且无需额外后处理或光流信息,性能优于先前方法超过2.7%。

ABSTRACT

Interactive video object segmentation (iVOS) aims at efficiently harvesting high-quality segmentation masks of the target object in a video with user interactions. Most previous state-of-the-arts tackle the iVOS with two independent networks for conducting user interaction and temporal propagation, respectively, leading to inefficiencies during the inference stage. In this work, we propose a unified framework, named Memory Aggregation Networks (MA-Net), to address the challenging iVOS in a more efficient way. Our MA-Net integrates the interaction and the propagation operations into a single network, which significantly promotes the efficiency of iVOS in the scheme of multi-round interactions. More importantly, we propose a simple yet effective memory aggregation mechanism to record the informative knowledge from the previous interaction rounds, improving the robustness in discovering challenging objects of interest greatly. We conduct extensive experiments on the validation set of DAVIS Challenge 2018 benchmark. In particular, our MA-Net achieves the J@60 score of 76.1% without any bells and whistles, outperforming the state-of-the-arts with more than 2.7%.

研究动机与目标

  • 解决现有双网络流水线在交互式视频对象分割中分别处理用户交互与时间传播所导致的效率低下问题。
  • 通过在各交互轮次间复用提取的像素嵌入,减少基于轮次的交互分割中的推理时间。
  • 通过聚合多轮先前交互中的有用知识,提升对具有挑战性的对象的分割鲁棒性与准确性。
  • 通过设计一种捕捉多轮用户反馈的记忆机制,消除对后处理或光流的依赖。

提出的方法

  • MA-Net将交互与传播统一于单一网络中,采用共享主干网络进行像素嵌入提取,实现在首轮之后的高效推理。
  • 其使用两个浅层卷积头:一个用于在标注(交互)帧上预测掩码,另一个用于将掩码传播至所有其他帧。
  • 全局记忆存储每轮的增强交互图,以保留长期用户反馈。
  • 局部记忆聚合来自最近R轮的、空间对齐的特征图,以提升对外观变化的鲁棒性。
  • 局部记忆采用大小为k的滑动窗口计算匹配图,其中k=12被选为在准确率与效率之间达到最优平衡。
  • 记忆聚合机制结合全局与局部图,以增强在遮挡和类别模糊等复杂场景下的分割准确率。

实验结果

研究问题

  • RQ1与解耦的交互与传播网络相比,统一的网络架构是否能提升基于轮次的交互式视频对象分割中的推理效率?
  • RQ2如何有效聚合多轮用户交互反馈,以随时间推移提升分割准确率?
  • RQ3在记忆机制中,使用近期交互轮次与远期轮次之间应如何权衡,以实现鲁棒分割?
  • RQ4轻量级记忆机制在不依赖光流或CRF后处理的情况下,能在多大程度上超越当前最先进方法?
  • RQ5局部窗口大小与记忆保留窗口(R)如何影响记忆聚合机制的性能?

主要发现

  • MA-Net在DAVIS 2018验证集上达到76.1%的J@60分数,无需任何额外优化技巧,性能优于当前最先进方法超过2.7%。
  • 模型在60秒内完成7轮交互,优于此前SOTA方法在相同时间内仅完成5轮的性能表现。
  • 消融实验表明,全局与局部记忆组件均显著提升性能,其中局部记忆在R=2时达到峰值准确率。
  • 若从全局记忆中移除增强图,AUC分数将从0.749降至0.744,证明其在保留用户反馈中的关键作用。
  • 最优局部窗口大小为k=12,该值在准确率与计算效率之间实现最佳平衡,过大或过小的值均会降低性能。
  • 定性结果表明,MA-Net能有效处理遮挡及包含同类别多个对象的复杂场景,尽管在相似部件之间可能存在轻微混淆。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。