QUICK REVIEW
[论文解读] Deep Tracking: Visual Tracking Using Deep Convolutional Networks
Meera Hahn, Si Chen|arXiv (Cornell University)|Dec 13, 2015
Video Surveillance and Tracking Methods参考文献 10被引用 11
一句话总结
本文提出 Deep Tracking (DT),一种利用预训练深度卷积神经网络从双流架构中提取联合外观与运动特征的视觉跟踪方法。通过结合预训练卷积神经网络(CNN)的特征与在线支持向量机(SVM)分类及自适应模型更新,DT 在基准数据集上实现了最先进性能,在 Visual Tracker Benchmark 和 ALOV++ 上的 F-score 分别优于现有跟踪器 4.28% 和 2.77%。
ABSTRACT
In this paper, we study a discriminatively trained deep convolutional network for the task of visual tracking. Our tracker utilizes both motion and appearance features that are extracted from a pre-trained dual stream deep convolution network. We show that the features extracted from our dual-stream network can provide rich information about the target and this leads to competitive performance against state of the art tracking methods on a visual tracking benchmark.
研究动机与目标
- 为解决视觉跟踪中持续存在的挑战,如遮挡、光照变化、尺度变化和运动模糊,采用深度特征进行处理。
- 探究预训练深度特征相较于手工设计特征(如 HoG 或 SIFT)是否能提升跟踪的鲁棒性与准确性。
- 开发一种高效、在线的跟踪流水线,利用有限的训练数据实现实时自适应。
- 通过双流 CNN 架构实现运动与外观线索的有效融合,并结合自适应模型更新。
提出的方法
- 该跟踪器使用预训练的 ImageNet CNN(受 Krizhevsky 等人启发)从外观流和运动流中提取深度特征。
- 通过在目标跟踪位置周围进行数据增强(旋转、平移)在 N 帧内收集正负样本,实验中 N=4。
- 将 CNN 第二个全连接层的特征输入 SVM 分类器,用于候选边界框的在线训练与分类。
- 通过三层次全连接头在视频特定数据上微调模型,实现特征与分类器的联合学习,提升效率。
- 使用光流增强运动流表征,提升对突发运动变化和遮挡的鲁棒性。
- 跟踪器采用自适应模型更新机制:运动流每 4 帧更新一次,外观流每 50 帧更新一次,或在置信度低于 0.85 时更新。
实验结果
研究问题
- RQ1与传统手工设计特征相比,双流 CNN 中的预训练深度特征是否能提升视觉跟踪性能?
- RQ2外观与运动特征的融合在处理遮挡和光照变化方面有多有效?
- RQ3在仅使用有限视频特定数据的情况下,对预训练 CNN 进行在线微调,能否保持跟踪精度与效率?
- RQ4基于置信度阈值(0.85)的自适应模型更新机制,如何提升对目标形变与外观变化的鲁棒性?
- RQ5在不重新训练模型的前提下,通过多尺度测试,尺度变化能被多大程度地管理?
主要发现
- Deep Tracker (DT) 在 Visual Tracker Benchmark 上取得 65.92 的 F-score,优于 Struck(55.19)和 SCM(61.64)至少 4.28 个百分点。
- 在 ALOV++ 基准上,DT 取得 68.96 的 F-score,超过 Struck 的 66.00,提升 2.77 个百分点。
- DT 在多种挑战性场景下表现优异,包括遮挡、快速运动、背景杂波和光照变化。
- 与传统手工设计特征相比,使用预训练深度特征显著提升了跟踪的鲁棒性。
- 基于置信度阈值(0.85)的自适应模型更新机制,有效应对突发遮挡与外观变化,且未出现过拟合。
- 通过每帧使用 20 种不同尺度的多尺度测试,实现了高效的尺度处理,无需穷举采样,降低了计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。