Skip to main content
QUICK REVIEW

[论文解读] SiamMask: A Framework for Fast Online Object Tracking and Segmentation

Weiming Hu, Qiang Wang|arXiv (Cornell University)|Jul 5, 2022
Visual Attention and Saliency Detection被引用 7
一句话总结

SiamMask 提出了一种实时、单边界框初始化的框架,通过多任务孪生网络联合执行视觉目标跟踪与视频实例分割。通过在离线预训练阶段联合训练分类、边界框回归和二值分割任务,该方法在无需在线适应或昂贵后处理的情况下,实现了 55 FPS 的推理速度,并在跟踪与分割基准上均达到最先进性能。

ABSTRACT

In this paper we introduce SiamMask, a framework to perform both visual object tracking and video object segmentation, in real-time, with the same simple method. We improve the offline training procedure of popular fully-convolutional Siamese approaches by augmenting their losses with a binary segmentation task. Once the offline training is completed, SiamMask only requires a single bounding box for initialization and can simultaneously carry out visual object tracking and segmentation at high frame-rates. Moreover, we show that it is possible to extend the framework to handle multiple object tracking and segmentation by simply re-using the multi-task model in a cascaded fashion. Experimental results show that our approach has high processing efficiency, at around 55 frames per second. It yields real-time state-of-the-art results on visual-object tracking benchmarks, while at the same time demonstrating competitive performance at a high speed for video object segmentation benchmarks.

研究动机与目标

  • 通过在统一框架下联合处理两项任务,弥合实时视觉目标跟踪与高精度视频实例分割之间的差距。
  • 通过引入像素级分割,提升传统仅输出边界框的全卷积孪生跟踪器的表征能力。
  • 在仅使用单一简单初始化的前提下,实现 55 FPS 的实时性能,同时在跟踪与分割基准上保持高精度。
  • 通过级联模型设计,将框架扩展至多目标跟踪与分割,而无需每序列适应或微调。
  • 证明在训练阶段引入分割监督的端到端多任务学习,可实现无需在线更新的强在线推理性能。

提出的方法

  • 提出一种具有三个并行分支的孪生网络架构:分类分支(用于目标定位)、边界框回归分支(通过 RPN 实现)以及类别无关的二值分割分支(用于像素级掩码预测)。
  • 使用联合损失函数在大规模数据集(如 YouTube-VOS)上进行离线预训练,该损失函数聚合分类、回归与分割损失,实现端到端训练。
  • 使用共享的主干卷积神经网络提取模板帧(第一帧)与搜索区域(当前帧)的特征,随后通过各分支的任务特定头网络进行处理。
  • 推理过程中,仅由分类分支确定目标位置;分割分支为得分最高的区域生成最终的二值掩码。
  • 通过级联两个 SiamMask 模型实现多目标跟踪,其中第二个模型基于第一个模型的分割输出结果来跟踪目标。
  • 通过完全依赖离线多任务预训练,避免在线适应,从而实现仅用单个边界框初始化即可实现实时推理。

实验结果

研究问题

  • RQ1全卷积孪生网络能否在保持实时推理速度的同时,扩展为生成高精度像素级分割掩码?
  • RQ2在分类、回归与分割任务上进行联合训练,是否能相比单任务孪生跟踪器提升跟踪与分割性能?
  • RQ3仅使用单一简单边界框初始化,是否可同时支持高精度跟踪与详细分割,而无需在线适应?
  • RQ4所提出的多任务框架在标准视觉目标跟踪与视频实例分割基准上的表现如何?
  • RQ5该框架能否通过极少的架构修改实现多目标跟踪与分割,且无需微调?

主要发现

  • SiamMask 在单张消费级 GPU 上实现了 55 FPS 的推理速度,是目前报道中速度最快的 VOS 方法。
  • 在 VOT-2018 基准上,SiamMask 在实时视觉目标跟踪任务中建立了新的最先进水平,其精度超越了现有实时跟踪器。
  • 在 DAVIS-2016 与 DAVIS-2017 基准上,SiamMask 在视频实例分割任务中表现具有竞争力,尽管速度极快,仍位列顶尖方法之中。
  • 定性结果表明,该模型在复杂形变、运动模糊、光照变化及背景杂波等挑战性场景下泛化能力出色。
  • SiamMask 的两阶段变体成功实现了多目标跟踪与分割,通过级联推理展示了良好的可扩展性。
  • SiamMask 在未使用光流、数据增强或微调的情况下仍取得优异性能,而这些技术通常为最先进 VOS 方法所必需。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。