Skip to main content
QUICK REVIEW

[论文解读] Recurrent Filter Learning for Visual Tracking

Tianyu Yang, Antoni B. Chan|arXiv (Cornell University)|Aug 13, 2017
Video Surveillance and Tracking Methods参考文献 39被引用 10
一句话总结

本文提出了一种新型视觉追踪框架——循环滤波学习(RFL),该框架利用卷积LSTM在无需在线微调的情况下实时生成特定于目标的滤波器。通过将目标样本通过保留空间结构的循环网络进行处理,RFL在OTB100和VOT2016/2017基准上实现了最先进性能,兼具高速度与对外观变化的强鲁棒性。

ABSTRACT

Recently using convolutional neural networks (CNNs) has gained popularity in visual tracking, due to its robust feature representation of images. Recent methods perform online tracking by fine-tuning a pre-trained CNN model to the specific target object using stochastic gradient descent (SGD) back-propagation, which is usually time-consuming. In this paper, we propose a recurrent filter generation methods for visual tracking. We directly feed the target's image patch to a recurrent neural network (RNN) to estimate an object-specific filter for tracking. As the video sequence is a spatiotemporal data, we extend the matrix multiplications of the fully-connected layers of the RNN to a convolution operation on feature maps, which preserves the target's spatial structure and also is memory-efficient. The tracked object in the subsequent frames will be fed into the RNN to adapt the generated filters to appearance variations of the target. Note that once the off-line training process of our network is finished, there is no need to fine-tune the network for specific objects, which makes our approach more efficient than methods that use iterative fine-tuning to online learn the target. Extensive experiments conducted on widely used benchmarks, OTB and VOT, demonstrate encouraging results compared to other recent methods.

研究动机与目标

  • 通过消除推理过程中基于SGD的适应需求,解决基于CNN的追踪器在线微调效率低下的问题。
  • 提升在通用视觉追踪中对光照变化、遮挡和快速运动等外观变化的鲁棒性。
  • 通过在RNN中用特征图处理替代向量化输入,保留目标对象的空间结构。
  • 通过在LSTM记忆单元中采用全卷积结构,实现平移不变的追踪。
  • 开发一种前馈式、端到端可训练的追踪器,通过循环滤波生成保持高精度与高速度。

提出的方法

  • 采用卷积LSTM,其中输入、隐藏、细胞和输出状态均为特征图而非向量,以保留空间结构。
  • 使用独立的编码器(E-CNN和S-CNN)分别从样本图像和搜索图像中提取特征,权重可共享或独立。
  • 将LSTM中的全连接层替换为2D卷积,以保持空间关系并提高内存效率。
  • 通过卷积LSTM生成目标特定滤波器,随后将其作为核应用于与下一帧特征图的相关运算。
  • 利用专用的初始化网络初始化LSTM记忆状态,以提升追踪精度与收敛速度。
  • 在离线预训练阶段以端到端方式训练整个网络,避免推理过程中的在线适应。

实验结果

研究问题

  • RQ1能否有效将循环神经网络适配为在无需在线微调的情况下生成视觉追踪的目标特定滤波器?
  • RQ2通过特征图在LSTM输入中保留空间结构,与向量化表示相比,对追踪性能有何影响?
  • RQ3使用具有空间感知记忆单元的卷积LSTM在多大程度上提升了对外观变化和运动的鲁棒性?
  • RQ4在标准基准上,所提出的RFL框架与最先进追踪器相比,在精度、速度和失败率方面表现如何?
  • RQ5初始化网络以及E-CNN与S-CNN之间的权重共享对整体追踪性能的贡献是什么?

主要发现

  • 在OTB100基准上,RFL的AUC得分为0.601,成功率达0.460,优于包括KCF和DSST在内的多种最先进方法。
  • 在VOT2016上,RFL取得最佳精度排名(1.72)和具有竞争力的EAO(0.2222),失败率为3.07,表明其具有强鲁棒性。
  • 在VOT2017上,RFL在基线实验中平均重叠度为0.48,在无监督实验中为0.23,实时速度达15.01 fps。
  • 消融实验表明,E-CNN与S-CNN之间权重共享会使性能下降8–10%;而使用初始化网络与卷积LSTM则显著提升性能。
  • 定性结果表明,与DSST、SiamFC和KCF相比,RFL在涉及快速运动、目标离屏和光照变化的挑战性序列中表现更优。
  • OTB100的成功率曲线显示,RFL在全部六个挑战属性上表现最佳或相当,尤其在快速运动和离屏场景中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。