Skip to main content
QUICK REVIEW

[论文解读] MAST: A Memory-Augmented Self-supervised Tracker

Zihang Lai, Erika Lu|arXiv (Cornell University)|Feb 18, 2020
Video Surveillance and Tracking Methods参考文献 71被引用 8
一句话总结

MAST 提出了一种基于记忆增强的自监督跟踪器,在无需任何人工标注数据的情况下,于密集跟踪基准上实现了最先进性能。通过优化重建损失并整合自粗到精的记忆机制,MAST 在 DAVIS-2017 上超越先前自监督方法 15%,在 YouTube-VOS 上超越 17%,达到与监督方法相当的性能,并展现出对未见物体类别的优越零样本泛化能力。

ABSTRACT

Recent interest in self-supervised dense tracking has yielded rapid progress, but performance still remains far from supervised methods. We propose a dense tracking model trained on videos without any annotations that surpasses previous self-supervised methods on existing benchmarks by a significant margin (+15%), and achieves performance comparable to supervised methods. In this paper, we first reassess the traditional choices used for self-supervised training and reconstruction loss by conducting thorough experiments that finally elucidate the optimal choices. Second, we further improve on existing methods by augmenting our architecture with a crucial memory component. Third, we benchmark on large-scale semi-supervised video object segmentation(aka. dense tracking), and propose a new metric: generalizability. Our first two contributions yield a self-supervised network that for the first time is competitive with supervised methods on standard evaluation metrics of dense tracking. When measuring generalizability, we show self-supervised approaches are actually superior to the majority of supervised methods. We believe this new generalizability metric can better capture the real-world use-cases for dense tracking, and will spur new interest in this research direction.

研究动机与目标

  • 通过改进训练目标和网络架构,弥合自监督与监督密集跟踪之间的性能差距。
  • 通过新颖的记忆增强机制,缓解长序列中的跟踪漂移问题,该机制可存储和检索关键帧特征。
  • 提出一种新的评估指标——泛化能力,以更准确反映在分布外物体类别上的实际性能。
  • 证明自监督学习可生成无需语义标注的鲁棒、通用的跟踪表征。
  • 验证自监督模型在未见物体类别上的泛化能力优于许多监督模型。

提出的方法

  • 通过大量消融实验,重新评估并优化自监督训练目标,特别是重建损失。
  • 引入一个存储关键帧特征的记忆库,以实现长距离上下文访问,从而缓解跟踪漂移。
  • 采用两阶段注意力机制:先粗略搜索,再进行细粒度匹配,以高效检索相关记忆特征。
  • 采用自粗到精的策略,在访问记忆特征时平衡精度与计算效率。
  • 在大规模未剪辑视频数据集上端到端训练模型,无需任何实例级标注。
  • 利用对比学习和特征重建,学习具有判别性与泛化能力的像素级跟踪表征。

实验结果

研究问题

  • RQ1在密集跟踪中,哪些自监督训练目标和重建损失能取得最佳性能?
  • RQ2记忆机制如何提升自监督跟踪在长期跟踪中的鲁棒性并减少漂移?
  • RQ3在自监督跟踪器中,选择和访问记忆帧的最优策略是什么?
  • RQ4在真实场景中,自监督模型是否能比监督模型更好地泛化到未见物体类别?
  • RQ5所提出的泛化能力指标与标准指标相比,在评估真实世界跟踪性能时表现如何?

主要发现

  • 在 YouTube-VOS 上,MAST 实现了 64.2% 的平均 JIoU,相比之前最佳自监督方法(46.6%)提升了 17.6%,并超越了大多数监督基线模型。
  • 在 DAVIS-2017 上,MAST 实现了 64.2% 的平均 JIoU,相比先前自监督方法相对提升 15%,性能与监督模型相当。
  • 在 YouTube-VOS 上,MAST 在已见与未见类别之间的泛化差距仅为 0.4,显著低于基线模型的平均值 11.5。
  • 即使未经微调,MAST 在未见类别上的表现仍比 2018 年 YouTube-VOS 挑战赛冠军(PreMVOS)高出 3.9%,展现出强大的零样本泛化能力。
  • 该模型性能与 OSVOS 和 STM 等监督方法相当,但无需任何实例级标注或领域自适应。
  • 消融实验确认,短期记忆与长期记忆对最优性能均至关重要,验证了记忆增强架构设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。