[论文解读] Learning Feature Embeddings for Discriminant Model based Tracking
该论文提出 DCFST,一种新颖的端到端深度学习框架,将可微分的闭式判别模型求解器(岭回归)集成到卷积神经网络中,以学习用于在线判别跟踪的最优特征嵌入。通过避免传统相关滤波器的负边界效应并支持端到端训练,DCFST 在六个基准测试中实现了最先进(SOTA)的精度,同时运行速度超过实时要求。
After observing that the features used in most online discriminatively trained trackers are not optimal, in this paper, we propose a novel and effective architecture to learn optimal feature embeddings for online discriminative tracking. Our method, called DCFST, integrates the solver of a discriminant model that is differentiable and has a closed-form solution into convolutional neural networks. Then, the resulting network can be trained in an end-to-end way, obtaining optimal feature embeddings for the discriminant model-based tracker. As an instance, we apply the popular ridge regression model in this work to demonstrate the power of DCFST. Extensive experiments on six public benchmarks, OTB2015, NFS, GOT10k, TrackingNet, VOT2018, and VOT2019, show that our approach is efficient and generalizes well to class-agnostic target objects in online tracking, thus achieves state-of-the-art accuracy, while running beyond the real-time speed. Code will be made available.
研究动机与目标
- 为解决在线判别训练跟踪器中使用的次优特征嵌入问题,这些特征通常源自预训练的 ImageNet 特征。
- 通过用直接可微分优化替代循环采样,消除基于相关滤波器的跟踪器(如 KCF 和 CFNet)固有的负边界效应。
- 通过将闭式可微分求解器集成到 CNN 中,实现特征嵌入与判别模型的端到端训练。
- 通过修改收缩损失以处理跟踪样本中前景-背景类别不平衡问题,提升训练的泛化能力和收敛性。
- 建立一个简单但强大的视觉跟踪基线,实现高精度与实时效率。
提出的方法
- 将可微分的闭式判别模型求解器(岭回归)作为可学习层集成到 CNN 中,支持特征嵌入的端到端训练。
- 利用 Woodbury 恒等式在反向传播过程中高效求解高维岭回归问题,保持计算效率。
- 应用经过修改的收缩损失(源自深度回归)以缓解因跟踪样本中前景-背景极端不平衡导致的收敛问题。
- 在图像对(支持图像与查询图像)上进行网络训练,以学习使判别模型在测试图像上预测最优的特征嵌入。
- 在支持图像和查询图像中均对目标周围进行真实且密集的采样,为判别模型提供丰富的监督信号。
- 通过从测试图像中提取学习到的特征嵌入,并应用训练好的岭回归模型来预测目标位置,实现在线跟踪。
实验结果
研究问题
- RQ1可微分的闭式判别模型求解器能否被有效集成到 CNN 中,以学习用于在线跟踪的最优特征嵌入?
- RQ2用直接优化替代循环采样是否能消除负边界效应并提升跟踪精度?
- RQ3特征嵌入与判别模型的端到端训练是否能带来在未见物体类别上的更好泛化能力和鲁棒性?
- RQ4修改后的收缩损失在处理类别不平衡的跟踪样本时,如何改善训练收敛性和模型泛化能力?
- RQ5所提出的框架能否在保持实时推理速度的同时实现最先进性能?
主要发现
- 在 OTB2015 上,DCFST-18 的平均 AUC 得分为 63.4%,分别优于 DiMP-18(61.0%)和 ATOM(58.3%)2.4% 和 5.1%。
- 在 GOT10k 上,DCFST-18 在重叠阈值 0.5 下的成功率为 71.6%,分别高于 DiMP-18(67.2%)和 ATOM(63.4%)4.4% 和 8.2%。
- 在 TrackingNet 上,DCFST-18 的平均 AUC 达到 73.9%,分别超过 DiMP-18(72.3%)和 ATOM 1.6% 和 3.6%。
- 在 VOT2018 上,DCFST-18 和 DCFST-50 的 EAO 分数分别为 0.416 和 0.452,分别优于 DiMP-18(0.410)和 DiMP-50(0.447)1.4% 和 1.2%。
- 在 VOT2019 上,DCFST-18 在完整挑战和实时挑战中的 EAO 分别为 0.361 和 0.317,分别优于 ATOM 6.9% 和 7.7%,尽管其主干网络更小(ResNet-18)。
- DCFST-18 在所有三个基准测试(OTB2015、GOT10k、VOT2019)中均持续优于 SiamRPN++,即使 SiamRPN++ 使用更深的主干网络(ResNet-50)和更多训练数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。