Skip to main content
QUICK REVIEW

[论文解读] MAVOT: Memory-Augmented Video Object Tracking

Boyu Liu, Yanzhao Wang|arXiv (Cornell University)|Nov 26, 2017
Video Surveillance and Tracking Methods参考文献 15被引用 8
一句话总结

MAVOT 提出了一种单次、基于记忆增强的视频目标跟踪框架,通过外部记忆模块存储并更新前景目标与背景的长期特征。通过在无需反向传播的情况下检索和更新该记忆,MAVOT 在遮挡、运动变化和显著外观差异下均表现出鲁棒性,在 VOT-2016 基准测试中,遮挡鲁棒性排名第二,运动变化准确性排名第一。

ABSTRACT

We introduce a one-shot learning approach for video object tracking. The proposed algorithm requires seeing the object to be tracked only once, and employs an external memory to store and remember the evolving features of the foreground object as well as backgrounds over time during tracking. With the relevant memory retrieved and updated in each tracking, our tracking model is capable of maintaining long-term memory of the object, and thus can naturally deal with hard tracking scenarios including partial and total occlusion, motion changes and large scale and shape variations. In our experiments we use the ImageNet ILSVRC2015 video detection dataset to train and use the VOT-2016 benchmark to test and compare our Memory-Augmented Video Object Tracking (MAVOT) model. From the results, we conclude that given its oneshot property and simplicity in design, MAVOT is an attractive approach in visual tracking because it shows good performance on VOT-2016 benchmark and is among the top 5 performers in accuracy and robustness in occlusion, motion changes and empty target.

研究动机与目标

  • 解决在线学习在视频目标跟踪中的局限性,如训练数据有限、通过反向传播实现的适应速度慢,以及缺乏长期记忆。
  • 通过保持目标和背景特征的持久记忆,克服因近期干扰(如部分或完全遮挡)导致的误差累积和混淆。
  • 在无需类别特定预训练或大量微调的情况下,实现通用目标跟踪的单次学习。
  • 通过建模前景和背景上下文,提升在尺度和形状大幅变化、光照变化及相机运动等挑战性场景下的跟踪性能。

提出的方法

  • 将深度卷积神经网络(CNN)与外部记忆模块结合,以随时间存储目标对象和背景的演化特征。
  • 利用记忆检索根据与存储特征的相似性对每帧中的候选区域进行评分,实现上下文感知的跟踪决策。
  • 通过当前帧中预测的目标区域特征,以增量方式更新记忆模块,实现对外观变化的适应。
  • 采用全卷积操作实现快速推理,避免在线反向传播,从而实现实时性能。
  • 利用 ImageNet ILSVRC2015 视频数据集进行预训练,实现对多样化目标类别的类别无关跟踪。
  • 为前景和背景分别维护独立的记忆嵌入,以提升在复杂场景中的区分度和鲁棒性。

实验结果

研究问题

  • RQ1基于记忆增强的深度学习框架是否能在无需在线反向传播的情况下实现鲁棒的单次视频目标跟踪?
  • RQ2外部记忆模块在复杂视觉条件下是否能有效维持长期的目标和背景表征?
  • RQ3单次跟踪器在遮挡和运动变化场景下,其性能在多大程度上可超越最先进在线学习跟踪器?
  • RQ4与仅关注前景的方法相比,在记忆中同时建模前景和背景是否能提升跟踪精度和鲁棒性?
  • RQ5一种无需在线微调的简单端到端可训练架构,是否能在 VOT-2016 等标准基准上实现具有竞争力的性能?

主要发现

  • MAVOT 在 VOT-2016 基准测试中,遮挡鲁棒性排名第二,运动变化准确性排名第一,表明其在复杂跟踪场景中具有强大韧性。
  • 在检测运动变化和目标缺失情况下的准确性排名第一,表明其在动态和模糊条件下具有高度可靠性。
  • 尽管是无需在线反向传播的单次跟踪器,MAVOT 在单张 NVIDIA GTX 1060 GPU 上实现了 5fps 的推理速度,表明其具备实时可行性。
  • 模型在长序列中保持了稳定的性能,在 'road'(558 帧)和 'girl'(1500 帧)等序列中成功在完全遮挡后恢复跟踪。
  • 在 'fish4' 等复杂场景中,面对低光照条件和高背景相似性,MAVOT 的准确性优于其他最先进跟踪器。
  • 在 VOT-2016 挑战赛中,MAVOT 在 71 个参赛者中综合排名第 16 位,考虑到其设计简洁且采用单次学习,这一成绩表现强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。