[论文解读] Deep Motion Features for Visual Tracking
本文提出将从预训练光流网络中学习到的深层运动特征,与手工设计的特征及深层RGB外观特征在基于判别相关滤波器(DCF)的跟踪框架中进行融合。该融合显著提升了跟踪性能,在OTB-2015、Temple-Color和VOT-2015数据集上均达到最先进水平,相较于仅使用外观特征的基线方法,平均重叠精度提升3.4%;在OTB-2015和Temple-Color数据集上分别提升6.8%和5.8%。
Robust visual tracking is a challenging computer vision problem, with many real-world applications. Most existing approaches employ hand-crafted appearance features, such as HOG or Color Names. Recently, deep RGB features extracted from convolutional neural networks have been successfully applied for tracking. Despite their success, these features only capture appearance information. On the other hand, motion cues provide discriminative and complementary information that can improve tracking performance. Contrary to visual tracking, deep motion features have been successfully applied for action recognition and video classification tasks. Typically, the motion features are learned by training a CNN on optical flow images extracted from large amounts of labeled videos. This paper presents an investigation of the impact of deep motion features in a tracking-by-detection framework. We further show that hand-crafted, deep RGB, and deep motion features contain complementary information. To the best of our knowledge, we are the first to propose fusing appearance information with deep motion features for visual tracking. Comprehensive experiments clearly suggest that our fusion approach with deep motion features outperforms standard methods relying on appearance information alone.
研究动机与目标
- 探究从光流数据中学习到的深层运动特征对视觉跟踪性能的影响。
- 探讨深层运动特征是否能为基于外观的特征提供互补信息。
- 在基于DCF的跟踪框架中,开发并评估结合手工特征、深层RGB特征与深层运动特征的融合策略。
- 证明运动线索可提升在遮挡、旋转和背景杂波等复杂跟踪场景下的鲁棒性。
- 在无需为运动特征额外标注训练数据的情况下,实现在标准基准数据集上的最先进性能。
提出的方法
- 利用在UCF101数据集上预训练的卷积神经网络(C3D)进行动作识别,从光流输入中提取深层运动特征。
- 在连续帧之间进行光流估计,以生成深层运动网络的输入。
- 在基于判别相关滤波器(DCF)的检测跟踪框架中,将深层运动特征与手工HOG特征及深层RGB特征进行融合。
- 采用基于DCF的跟踪器,通过联合优化多种特征类型的融合特征表示,实现分类得分的联合优化。
- 利用FFT实现DCF框架中的高效训练与推理,从而支持实时性能。
- 使用预训练网络提取外观与运动特征,无需在跟踪数据上进行微调,最大限度减少额外训练需求。
实验结果
研究问题
- RQ1能否在大规模视频动作识别数据集上预训练的深层运动特征,通过与外观特征融合,提升视觉跟踪性能?
- RQ2在跟踪任务中,深层运动特征与手工特征及深层RGB特征相比,其判别能力如何?
- RQ3在哪些跟踪场景(如遮挡、旋转、模糊)下,深层运动特征能带来最显著的性能提升?
- RQ4外观与运动特征的融合是否能在多样化的基准数据集中持续优于仅使用外观特征的基线方法?
- RQ5深层运动特征是否能增强在平面外旋转和背景杂波等复杂跟踪条件下的鲁棒性?
主要发现
- 在OTB-2015数据集上,手工HOG、深层RGB与深层运动特征的融合实现了84.1%的平均重叠精度,较仅使用外观特征的基线方法(77.3%)提升了3.4%。
- 在OTB-2015数据集上,所提方法的成功图AUC达到67.4%,较DeepSRDCF基线(64.3%)高出2.9个百分点。
- 在Temple-Color数据集上,该方法实现了71.2%的平均重叠精度,较DeepSRDCF基线(65.4%)提升5.8%。
- 在VOT-2015数据集上,该方法实现了0.58的准确率和0.92的鲁棒性,优于当前最准确(RAJSSC)和最鲁棒(EBT)的先前方法。
- 基于属性的分析显示,在形变(+6.4%)、视野外(+6.1%)和非平面旋转(+4.7%)场景下均有显著提升,证明了运动线索在复杂条件下的价值。
- 该方法在OTB-2015数据集的全部11项属性上均实现性能提升,证实了运动特征与外观线索具有良好的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。