[论文解读] Deep Learning of Appearance Models for Online Object Tracking
本文提出了一种基于深度学习的在线目标跟踪器,通过在CNN中引入贝叶斯损失层,联合学习外观模型与判别性特征。通过结合ImageNet上的离线预训练、首帧微调以及网络和高斯分布参数的迭代在线自适应,该跟踪器在标准基准测试中实现了最先进性能,在定位精度和遮挡、外观变化等场景下的鲁棒性方面优于非深度学习与深度学习跟踪器。
This paper introduces a novel deep learning based approach for vision based single target tracking. We address this problem by proposing a network architecture which takes the input video frames and directly computes the tracking score for any candidate target location by estimating the probability distributions of the positive and negative examples. This is achieved by combining a deep convolutional neural network with a Bayesian loss layer in a unified framework. In order to deal with the limited number of positive training examples, the network is pre-trained offline for a generic image feature representation and then is fine-tuned in multiple steps. An online fine-tuning step is carried out at every frame to learn the appearance of the target. We adopt a two-stage iterative algorithm to adaptively update the network parameters and maintain a probability density for target/non-target regions. The tracker has been tested on the standard tracking benchmark and the results indicate that the proposed solution achieves state-of-the-art tracking results.
研究动机与目标
- 解决正样本极少且外观动态变化的在线目标跟踪挑战。
- 通过深度特征提升在遮挡、光照变化和视角变化下的跟踪鲁棒性。
- 开发统一的深度神经网络框架,实现目标特定外观模型的在线学习。
- 通过端到端可训练的深度特征与自适应参数更新,克服手工设计特征的局限性。
- 通过在CNN特征上使用高斯混合模型建模目标与背景外观分布,实现高精度定位。
提出的方法
- 跟踪器使用预训练的CNN(如GoogLeNet)进行通用特征提取,并在物体性检测任务上进行离线微调,以获得通用物体表征。
- 在在线阶段,网络通过目标首帧的边界框进一步微调,以适应目标特定外观。
- 在fc7层之上添加一个具有高斯分布的贝叶斯损失层,用于建模正样本(目标)与负样本(背景)的特征分布。
- 跟踪器采用两阶段迭代算法:首先,使用固定的网络权重更新高斯参数;然后,通过跟踪误差的反向传播更新网络权重。
- 在每一帧中,通过计算目标与背景分布之间的似然比对候选位置进行评分,选择得分最高的位置作为预测目标。
- 通过采样少量正负样本块进行在线自适应,实现对外观变化的持续学习。
实验结果
研究问题
- RQ1带有贝叶斯损失层的深度CNN能否有效建模目标与背景外观分布以实现在线跟踪?
- RQ2在大规模数据集上预训练并结合首帧微调,如何在正样本极少的情况下提升跟踪性能?
- RQ3对网络权重与高斯参数的迭代在线自适应是否能增强对遮挡与外观变化的鲁棒性?
- RQ4在定位精度与成功率方面,该方法与最先进深度与非深度跟踪器相比表现如何?
- RQ5联合学习深度特征与概率外观模型是否优于仅依赖深度特征或手工特征的方法?
主要发现
- 该跟踪器在OTB-2013基准测试中取得0.841的精度得分与0.613的成功得分,优于KCF、Struck与TLD等非深度学习跟踪器。
- 在大多数属性(包括尺度变化与低分辨率)上,其精度与成功得分均超过最先进的深度学习跟踪器FCNT与SO-DLT。
- 在目标出视野(OV)场景中表现出优越的定位精度,即使在长期遮挡下仍能保持较高的重叠率。
- 在形变(DEF)与遮挡(OCC)属性上表现强劲,表明通过鲁棒的特征学习有效应对了外观变化。
- 预训练深度特征与基于高斯分布建模的迭代在线自适应相结合,相比仅使用多层卷积的模型具有更好的泛化能力。
- 尽管在某些情况下精度较低,但其成功得分仍高于HDT与HCFT,表明在复杂条件下具有更优的定位稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。