Skip to main content
QUICK REVIEW

[论文解读] TransVOS: Video Object Segmentation with Transformers

Jianbiao Mei, Mengmeng Wang|arXiv (Cornell University)|Jun 1, 2021
Visual Attention and Saliency Detection参考文献 44被引用 14
一句话总结

TransVOS 提出了一种基于视觉变换器的半监督视频实例分割框架,通过单一的双路特征提取器联合建模空间与时间关系,参数量减少20%,在DAVIS和YouTube-VOS基准上整体J&F得分超越当前最先进方法2.4%。

ABSTRACT

Recently, Space-Time Memory Network (STM) based methods have achieved state-of-the-art performance in semi-supervised video object segmentation (VOS). A crucial problem in this task is how to model the dependency both among different frames and inside every frame. However, most of these methods neglect the spatial relationships (inside each frame) and do not make full use of the temporal relationships (among different frames). In this paper, we propose a new transformer-based framework, termed TransVOS, introducing a vision transformer to fully exploit and model both the temporal and spatial relationships. Moreover, most STM-based approaches employ two separate encoders to extract features of two significant inputs, i.e., reference sets (history frames with predicted masks) and query frame (current frame), respectively, increasing the models' parameters and complexity. To slim the popular two-encoder pipeline while keeping the effectiveness, we design a single two-path feature extractor to encode the above two inputs in a unified way. Extensive experiments demonstrate the superiority of our TransVOS over state-of-the-art methods on both DAVIS and YouTube-VOS datasets.

研究动机与目标

  • 解决现有时空记忆(STM)方法在视频实例分割中难以完全建模空间与时间关系的局限性。
  • 通过用统一的双路特征提取器替代双编码器结构,降低模型复杂度。
  • 利用视觉变换器中的自注意力机制捕捉帧间与帧内长距离依赖关系,提升分割精度。
  • 证明在STM类框架中动态记忆更新可能因传播低质量历史掩码而导致性能下降。
  • 建立一种轻量化但高效的架构,在不增加参数量或推理成本的前提下保持高性能。

提出的方法

  • 提出一种基于视觉变换器的架构,通过双路输入流统一处理参考帧(含预测掩码)和查询帧。
  • 设计一种双路特征提取器,分别处理RGB帧和参考帧的预测掩码,实现在不使用拼接或孪生共享的情况下高效融合特征。
  • 采用带有自注意力机制的变换器解码器,对跨帧及每帧内所有像素的依赖关系进行建模,同时捕捉空间与时间关系。
  • 通过查询帧特征与参考帧特征之间的交叉注意力,利用全局上下文预测精确的分割掩码。
  • 利用视觉变换器主干网络的特征图生成注意力图,实现对时序与空间相关区域的关注。
  • 通过直接将预测掩码输入特征提取器中的专用路径,避免掩码变形与填充引起的错位问题。

实验结果

研究问题

  • RQ1视觉变换器是否能在不依赖独立编码器的前提下,有效建模视频实例分割中的空间与时间关系?
  • RQ2统一的双路特征提取器在准确率与参数效率方面是否优于传统的双编码器或孪生架构?
  • RQ3与STM基模型中的标准注意力模块相比,引入变换器解码器在掩码预测方面有何提升?
  • RQ4仅使用第一帧和前一帧作为参考输入,与维持周期性更新的动态记忆库相比,性能有何差异?
  • RQ5通过双路结构直接融合预测掩码与RGB特征,是否优于拼接或残差连接方式?

主要发现

  • TransVOS 仅使用第一帧和前一帧作为参考,在DAVIS 17验证集上达到76.4%的J&F得分,较STM提升2.4个百分点。
  • 与独立双编码器设置相比,双路特征提取器使模型参数量减少20%,同时J&F得分提升7.8个百分点。
  • 与直接将掩码乘以编码特征的方式相比,采用双路特征提取器使J&F得分提升15.1%。
  • 移除变换器解码器后,J&F得分下降1.2个百分点,证实其对最优性能的必要性。
  • 如STM中每5帧更新一次动态记忆,会导致性能下降,原因在于低质量历史预测的传播。
  • 所提方法在整体J&F得分上分别较KMN和CFBI提升0.4%,展现出在基准数据集上的强大泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。