Skip to main content
QUICK REVIEW

[论文解读] Transferring Rich Feature Hierarchies for Robust Visual Tracking

Naiyan Wang, Siyi Li|arXiv (Cornell University)|Jan 19, 2015
Video Surveillance and Tracking Methods参考文献 37被引用 290
一句话总结

本文提出 SO-DLT,一种深度学习追踪器,通过迁移丰富的预训练 CNN 特征实现鲁棒的视觉追踪。通过在 ImageNet 检测数据上预训练 CNN 以实现目标定位(而非图像重建),并使用像素级概率图输出,该方法实现了结构化、可扩展的追踪,并支持在线微调,在基准测试中达到 0.602 的 AUC,较最先进追踪器提升 10%以上。

ABSTRACT

Convolutional neural network (CNN) models have demonstrated great success in various computer vision tasks including image classification and object detection. However, some equally important tasks such as visual tracking remain relatively unexplored. We believe that a major hurdle that hinders the application of CNN to visual tracking is the lack of properly labeled training data. While existing applications that liberate the power of CNN often need an enormous amount of training data in the order of millions, visual tracking applications typically have only one labeled example in the first frame of each video. We address this research issue here by pre-training a CNN offline and then transferring the rich feature hierarchies learned to online tracking. The CNN is also fine-tuned during online tracking to adapt to the appearance of the tracked target specified in the first video frame. To fit the characteristics of object tracking, we first pre-train the CNN to recognize what is an object, and then propose to generate a probability map instead of producing a simple class label. Using two challenging open benchmarks for performance evaluation, our proposed tracker has demonstrated substantial improvement over other state-of-the-art trackers.

研究动机与目标

  • 为解决视觉追踪中训练数据标注不足的问题,通常每段视频仅有一个标注帧。
  • 克服先前基于 CNN 的追踪器依赖图像重建或分类的局限性,这些方法不适合追踪这种基于结构化定位的任务。
  • 通过利用丰富、面向目标定位的特征迁移学习,提升在外观变化(如光照、尺度、遮挡)下的追踪鲁棒性。
  • 通过在追踪过程中对预训练 CNN 进行微调,实现实时在线适应,最小化漂移和过拟合。
  • 开发一种结构化输出的 CNN,预测像素级目标概率,相比分类或回归方法能更好地捕捉空间一致性。

提出的方法

  • 在 ImageNet 检测数据上预训练 CNN,学习目标定位而非图像重建,为目标存在性建立强归纳偏置。
  • 使用全卷积网络输出像素级概率图,表示每个像素属于目标对象的可能性。
  • 应用基于像素级图的结构化损失函数,以保持空间结构并提升定位精度。
  • 将预训练的 CNN 迁移至在线追踪任务,并使用首帧的边界框和后续帧实时微调。
  • 实施分阶段微调策略,以稳定更新过程,减少遮挡或外观变化时的漂移。
  • 在推理阶段使用像素级图,即使在大幅外观变化下也能实现鲁棒检测。

实验结果

研究问题

  • RQ1能否有效将大规模检测数据上预训练的 CNN 特征迁移至视觉追踪任务,且仅需极少标注数据?
  • RQ2与基于分类或回归的方法相比,使用像素级概率图作为输出是否能提升追踪鲁棒性?
  • RQ3对预训练 CNN 进行在线微调是否能缓解模型漂移并适应追踪过程中的外观变化?
  • RQ4该方法在极端外观变化(如遮挡、光照变化、大幅尺度或旋转变化)下的表现如何?
  • RQ5对于非刚性形变物体,该追踪器能否在边界框重叠率较差的指标下保持高精度?

主要发现

  • 所提出的 SO-DLT 追踪器在标准基准测试中达到 0.602 的 AUC,显著优于之前最先进追踪器(0.529)。
  • 在非刚性物体追踪数据集上,SO-DLT 的平均中心像素误差为 21.69,优于 TGPR(77.88)和 PixelTracker(79.26)。
  • SO-DLT 在包含大幅光照变化、非平面旋转和尺度变化的挑战性序列中成功追踪目标,漂移极小。
  • 得益于分阶段微调机制,追踪器在目标重新出现后能有效纠正漂移,保持鲁棒性能。
  • 视觉结果表明,该方法在多样化场景下均表现出一致的追踪性能,包括高度形变的物体(如跳水运动员和滑雪者)。
  • 失败案例主要源于外观相似的干扰物或初始边界框不精确,提示在特征不变性和初始化方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。