[论文解读] Non-sparse Linear Representations for Visual Tracking with Online Reservoir Metric Learning
本文提出了一种基于在线马氏距离度量学习与时间加权蓄水池采样技术的快速且鲁棒的视觉追踪方法,采用非稀疏线性表示。通过用闭式最小二乘解替代计算成本高昂的ℓ₁-正则化优化,并引入能捕捉特征维度间相关性的判别性度量,该追踪器在效率和应对外观变化的鲁棒性方面均表现出色,在具有挑战性的序列上优于当前最先进方法。
Most sparse linear representation-based trackers need to solve a computationally expensive L1-regularized optimization problem. To address this problem, we propose a visual tracker based on non-sparse linear representations, which admit an efficient closed-form solution without sacrificing accuracy. Moreover, in order to capture the correlation information between different feature dimensions, we learn a Mahalanobis distance metric in an online fashion and incorporate the learned metric into the optimization problem for obtaining the linear representation. We show that online metric learning using proximity comparison significantly improves the robustness of the tracking, especially on those sequences exhibiting drastic appearance changes. Furthermore, in order to prevent the unbounded growth in the number of training samples for the metric learning, we design a time-weighted reservoir sampling method to maintain and update limited-sized foreground and background sample buffers for balancing sample diversity and adaptability. Experimental results on challenging videos demonstrate the effectiveness and robustness of the proposed tracker.
研究动机与目标
- 解决视觉追踪中ℓ₁-正则化稀疏线性表示带来的高计算成本问题。
- 通过度量学习捕捉特征维度之间的相关性信息,提升判别能力。
- 在实时追踪的内存约束下,实现实时在线度量学习。
- 通过维护有限大小的前景与背景缓冲区,平衡在线学习中的样本多样性与自适应能力。
- 开发一种可扩展的实时视觉追踪框架,在外观变化、遮挡和姿态变化下仍保持鲁棒性。
提出的方法
- 该追踪器基于最小二乘优化问题的非稀疏线性表示,可实现闭式解,从而实现快速推理。
- 采用在线近邻比较方式学习马氏距离度量,以增强前景与背景特征之间的判别能力。
- 将度量学习整合进线性表示优化过程中,以提升目标与背景的分离效果。
- 采用时间加权蓄水池采样方法,维护动态的、有限大小的前景与背景样本缓冲区,赋予近期观测更高的重要性。
- 利用顺序矩阵运算,高效地更新闭式解,实现对新数据的实时适应。
- 理论上证明该方法可通过有限数量样本近似全批量度量学习。
实验结果
研究问题
- RQ1非稀疏线性表示结合闭式解是否能在显著更快的速度下实现与ℓ₁-正则化稀疏表示相当或更优的精度?
- RQ2在线马氏度量学习是否通过捕捉特征间相关性,有效提升追踪鲁棒性?
- RQ3时间加权蓄水池采样是否能有效维持在线度量学习中样本的多样性与自适应能力?
- RQ4在外观变化、遮挡和姿态变化等挑战性条件下,所提追踪器的性能表现如何?
- RQ5所提方法是否具备足够的可扩展性与效率,适用于实时视觉追踪应用?
主要发现
- 在CLE基准的13个视频序列中,该追踪器在10个序列上取得了最高的成功率,优于当前最先进方法。
- 当缓冲区大小约为300样本时性能趋于稳定,表明高性能并不需要极大的内存缓冲区。
- 该追踪器的运行时间与粒子数呈次线性关系,而粒子滤波方法则不然,因此效率显著更高。
- 无需特征分解的度量学习方法性能接近计算成本高昂的逐步特征分解方法。
- 将度量学习集成到线性表示中可有效提升追踪精度,尤其在外观发生剧烈变化的序列中表现更优。
- 时间加权蓄水池采样有效维持了样本的相关性,近期样本获得更高权重,从而增强了对动态变化的适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。