Skip to main content
QUICK REVIEW

[论文解读] Motion-Attentive Transition for Zero-Shot Video Object Segmentation

Tianfei Zhou, Shunzhou Wang|arXiv (Cornell University)|Mar 9, 2020
Visual Attention and Saliency Detection参考文献 41被引用 10
一句话总结

本文提出 MATNet,一种用于零样本视频对象分割的新型双流编码器-解码器框架,通过运动注意转换(MAT)模块分层整合运动与外观特征。通过在每个残差阶段交错处理运动与外观信息,MATNet增强了时空表征学习,在 DAVIS-16、FBMS 和 Youtube-Objects 基准测试中均达到最先进性能,平均 JIoU 分数分别为 76.1%、76.1% 和 69.0%。

ABSTRACT

In this paper, we present a novel Motion-Attentive Transition Network (MATNet) for zero-shot video object segmentation, which provides a new way of leveraging motion information to reinforce spatio-temporal object representation. An asymmetric attention block, called Motion-Attentive Transition (MAT), is designed within a two-stream encoder, which transforms appearance features into motion-attentive representations at each convolutional stage. In this way, the encoder becomes deeply interleaved, allowing for closely hierarchical interactions between object motion and appearance. This is superior to the typical two-stream architecture, which treats motion and appearance separately in each stream and often suffers from overfitting to appearance information. Additionally, a bridge network is proposed to obtain a compact, discriminative and scale-sensitive representation for multi-level encoder features, which is further fed into a decoder to achieve segmentation results. Extensive experiments on three challenging public benchmarks (i.e. DAVIS-16, FBMS and Youtube-Objects) show that our model achieves compelling performance against the state-of-the-arts.

研究动机与目标

  • 为解决零样本视频对象分割中的挑战,即模型必须在无训练标注的情况下泛化到未见过的对象。
  • 克服传统双流网络将运动与外观独立处理的局限性,从而减少对外观线索的过拟合。
  • 建模运动与外观之间的分层、类生物启发式交互,模拟人类视觉系统的注意力机制。
  • 在运动模糊、形变和背景杂乱等挑战性条件下提升分割精度。

提出的方法

  • 提出一种新型运动注意转换(MAT)模块,构建非对称注意力机制,利用光流在每个卷积阶段引导选择性地优化外观特征。
  • 设计一种深度交错的双流编码器,使运动与外观特征在每个残差模块处融合,实现持续的跨模态交互。
  • 采用带有尺度敏感注意力(SSA)的桥接网络,自适应地选择并转换多层级编码器特征,以提升判别能力与尺度敏感性。
  • 在解码器中使用级联的边界感知优化(BAR)模块,利用多尺度特征并显式预测对象边界,以提升分割精度。
  • 在解码器中采用自顶向下的渐进式优化策略,利用 SSA 实现编码器与解码器在各尺度上的特征对齐。
  • 通过训练视频的真实掩码和帧对估计的光流,端到端训练模型。

实验结果

研究问题

  • RQ1能否以分层、多尺度的方式有效整合运动线索到基于外观的表征学习中,从而提升零样本视频对象分割性能?
  • RQ2在每个网络阶段进行交错的运动-外观交互,与双流架构中独立处理的方式相比,效果如何?
  • RQ3运动引导的注意力在多大程度上可减少由背景杂乱或视觉相似性引起的外观特征模糊性?
  • RQ4所提出的 MAT 模块是否能提升对视频序列中运动模糊、形变和尺度变化的鲁棒性?
  • RQ5带有尺度敏感注意力的桥接网络是否能增强编码器与解码器之间的特征迁移,从而实现更精确的边界定位?

主要发现

  • 在 FBMS 基准测试中,MATNet 实现了 76.1% 的平均 JIoU,比第二名方法(PDB)高出 2.1 个百分点。
  • 在 DAVIS-16 上,MATNet 达到 76.1% 的平均 JIoU,比第二名方法(AGNN)高出 1.7 个百分点。
  • 在 Youtube-Objects 上,MATNet 实现了 69.0% 的平均 JIoU,仅次于 AGS,且在大多数物体类别中均表现出一致的性能提升。
  • 消融实验表明,MAT 模块是最关键的组件,其移除或替换会导致性能显著下降。
  • 模型在运动模糊、物体形变和背景杂乱等挑战性因素下表现出强鲁棒性,DAVIS-16 和 Youtube-Objects 的定性结果已验证此结论。
  • 所提出的桥接网络结合尺度敏感注意力(SSA)显著改善了编码器与解码器之间的特征对齐,有助于实现更精细的边界预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。