Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Deep Representation Learning for Real-Time Tracking

Ning Wang, Wengang Zhou|arXiv (Cornell University)|Jul 22, 2020
Video Surveillance and Tracking Methods参考文献 76被引用 7
一句话总结

本文提出了一种用于实时视觉追踪的无监督深度表征学习方法,通过仅使用未标注视频从零开始训练孪生相关滤波网络。通过强制正向与反向追踪轨迹之间的一致性,该方法在无需任何真实标注的情况下学习到鲁棒的特征表示,实现了与完全监督基线相当的追踪精度,同时保持了实时推理速度。

ABSTRACT

The advancement of visual tracking has continuously been brought by deep learning models. Typically, supervised learning is employed to train these models with expensive labeled data. In order to reduce the workload of manual annotations and learn to track arbitrary objects, we propose an unsupervised learning method for visual tracking. The motivation of our unsupervised learning is that a robust tracker should be effective in bidirectional tracking. Specifically, the tracker is able to forward localize a target object in successive frames and backtrace to its initial position in the first frame. Based on such a motivation, in the training process, we measure the consistency between forward and backward trajectories to learn a robust tracker from scratch merely using unlabeled videos. We build our framework on a Siamese correlation filter network, and propose a multi-frame validation scheme and a cost-sensitive loss to facilitate unsupervised learning. Without bells and whistles, the proposed unsupervised tracker achieves the baseline accuracy as classic fully supervised trackers while achieving a real-time speed. Furthermore, our unsupervised framework exhibits a potential in leveraging more unlabeled or weakly labeled data to further improve the tracking accuracy.

研究动机与目标

  • 开发一种视觉追踪方法,通过利用未标注视频数据消除对昂贵人工标注的依赖。
  • 基于双向运动一致性,使用自监督学习从零开始训练深度追踪器。
  • 在不依赖预训练模型或标注数据的情况下,实现与完全监督追踪器相当的实时性能。
  • 探索利用大规模弱标注或未标注数据进行无监督表示学习在视觉追踪中的潜力。

提出的方法

  • 该方法基于正向与反向追踪之间轨迹一致性的自监督损失,训练孪生相关滤波网络。
  • 引入多帧验证方案以提升时间稳定性,并在无监督训练过程中减少误报。
  • 设计了一种代价敏感损失,以惩罚不一致的反向追踪,特别是在目标丢失或遮挡的情况下。
  • 追踪器在第一帧的高熵图像区域初始化,避免使用人工边界框标注。
  • 该框架完全以无监督方式运行,训练过程中未使用任何真实标签。
  • 该方法在标准基准(OTB-2015、VOT2018)上进行评估,并与完全监督及最先进追踪器进行比较。

实验结果

研究问题

  • RQ1是否可以仅使用未标注视频、无需任何人工标注边界框,从零开始有效训练视觉追踪器?
  • RQ2强制正向与反向追踪轨迹之间的一致性是否能带来鲁棒且泛化能力强的特征表示?
  • RQ3无监督学习是否能在精度和速度方面实现与完全监督方法相当的追踪性能?
  • RQ4在遮挡、运动模糊和光照变化等挑战性视觉条件下,该方法表现如何?

主要发现

  • 所提出的无监督追踪器在OTB-2015基准上实现了与SiamFC和CFNet等经典完全监督追踪器相当的基线精度。
  • 无监督LUDT追踪器在性能上优于最先进方法,在OTB-2015上的AUC指标比ECO高出0.9%,且完全未使用标注数据。
  • LUDT+变体通过引入在线模型更新进一步提升了性能,并在追踪精度上超越了ECO。
  • 在背景杂波、部分遮挡和运动模糊等挑战性场景中,该方法表现出强鲁棒性,定性评估中优于DSST和SiamFC。
  • 消融研究证实,多帧验证和代价敏感损失显著提升了训练稳定性和追踪精度。
  • 特征可视化与属性分析表明,无监督特征具有判别性且泛化能力良好,但在光照变化、遮挡和快速运动方面仍存在性能差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。