Skip to main content
QUICK REVIEW

[论文解读] Robust Tracking Using Region Proposal Networks

Jimmy Ren, Zhiyang Yu|arXiv (Cornell University)|May 30, 2017
Video Surveillance and Tracking Methods参考文献 18被引用 4
一句话总结

本文提出RPN2T,一种新颖的视觉追踪方法,利用预训练区域建议网络(RPN)的顶层特征,无需模型集成或特征工程。通过引入一种新型损失函数,联合优化分类准确率与边界框质量,该方法在OTB50、OTB100和VOT2016基准上实现了最先进性能,优于现有的基于CNN的和手工设计特征的追踪器。

ABSTRACT

Recent advances in visual tracking showed that deep Convolutional Neural Networks (CNN) trained for image classification can be strong feature extractors for discriminative trackers. However, due to the drastic difference between image classification and tracking, extra treatments such as model ensemble and feature engineering must be carried out to bridge the two domains. Such procedures are either time consuming or hard to generalize well across datasets. In this paper we discovered that the internal structure of Region Proposal Network (RPN)'s top layer feature can be utilized for robust visual tracking. We showed that such property has to be unleashed by a novel loss function which simultaneously considers classification accuracy and bounding box quality. Without ensemble and any extra treatment on feature maps, our proposed method achieved state-of-the-art results on several large scale benchmarks including OTB50, OTB100 and VOT2016. We will make our code publicly available.

研究动机与目标

  • 消除基于CNN的视觉追踪中对模型集成和人工特征工程的需求。
  • 探究预训练RPN顶层特征是否可作为视觉追踪的强判别性表征。
  • 发现一种损失函数,通过联合优化分类与定位任务,充分释放RPN特征在追踪中的潜力。
  • 使用单一统一模型在标准基准上实现最先进性能,无需领域特定的微调。

提出的方法

  • 利用预训练RPN的顶层特征图(原用于目标检测)作为追踪任务的主干特征表示。
  • 提出一种新型联合损失函数,同时优化分类准确率与边界框回归质量,使特征更契合追踪目标。
  • 采用单一RPN模型同时完成区域建议与追踪任务,避免使用多个网络或特征融合策略。
  • 在推理阶段应用先前工作(如[20])中的标准在线模型更新协议,实现长期与短期适应。
  • 采用轻量化网络架构,显著小于先前最先进追踪器中使用的VGG基模型。
  • 在OTB50、OTB100和VOT2016上使用标准评估协议,未引入额外数据增强或领域特定调优。

实验结果

研究问题

  • RQ1能否在无需额外训练或特征工程的情况下,有效重用预训练RPN的顶层特征用于视觉追踪?
  • RQ2在目标检测与视觉追踪目标存在差异的背景下,何种损失函数设计可充分释放RPN特征的判别潜力?
  • RQ3使用RPN特征的单一统一模型是否能在标准基准上超越现有的基于CNN的和手工设计特征的追踪器?
  • RQ4所提方法在遮挡、光照变化和姿态变化等多样化挑战性场景中是否保持鲁棒性?

主要发现

  • RPN2T在OTB50和OTB100上实现了最先进性能,优于手工特征方法及其他基于CNN的追踪器。
  • 在VOT2016上,RPN2T取得了0.335的最高期望平均重叠(EAO)得分,在所有评估方法中排名第一。
  • 在VOT2016上,RPN2T实现了具有竞争力的准确率(ACC = 0.54)与鲁棒性(ROB = 0.87),尽管网络更小,仍优于C-COT与TCNN在EAO指标上的表现。
  • 在OTB100的挑战性场景中,RPN2T在全部八个类别中均表现出更优的鲁棒性,持续优于所有基线方法。
  • 所提出的联合损失函数至关重要——若直接使用RPN特征而无该损失函数,则无法获得良好结果,证明其对释放特征潜力的必要性。
  • 该方法在GTX Titan X GPU上实现了约2 FPS的推理速度,表明其在实际应用中的可行性,尽管尚未针对速度进行优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。