[论文解读] Learning Tracking Representations via Dual-Branch Fully Transformer Networks
该论文提出DualTFR,一种类似Siamese的双分支全Transformer网络,通过自注意力机制直接学习视觉追踪表征,无需依赖CNN进行特征提取。通过在每个分支中使用局部注意力块(LAB)和全局注意力块(GAB),并在最后一层引入单一交叉注意力块(CAB),该模型在GOT-10k和VOT2020基准上实现了最先进性能,同时在单张GPU上保持约40 fps的实时推理速度。
We present a Siamese-like Dual-branch network based on solely Transformers for tracking. Given a template and a search image, we divide them into non-overlapping patches and extract a feature vector for each patch based on its matching results with others within an attention window. For each token, we estimate whether it contains the target object and the corresponding size. The advantage of the approach is that the features are learned from matching, and ultimately, for matching. So the features are aligned with the object tracking task. The method achieves better or comparable results as the best-performing methods which first use CNN to extract features and then use Transformer to fuse them. It outperforms the state-of-the-art methods on the GOT-10k and VOT2020 benchmarks. In addition, the method achieves real-time inference speed (about $40$ fps) on one GPU. The code and models will be released.
研究动机与目标
- 探究视觉Transformer是否能通过直接匹配学习特征,超越基于CNN的特征提取器在视觉目标追踪中的表现。
- 设计一种轻量化、高效的双分支Transformer架构,避免依赖CNN,同时保持高精度和实时速度。
- 验证纯Transformer-based特征学习在追踪中的有效性,尤其与混合的'CNN+Transformer'流水线进行对比。
- 为端到端Transformer-based追踪提供关于模块设计、预训练和注意力机制的实证洞察。
提出的方法
- 将模板图像和搜索图像划分为非重叠的图像块,并应用双分支Transformer架构,通过每个分支内的自注意力机制提取特征。
- 在高分辨率特征图上使用局部注意力块(LAB)进行早期特征提取,在低分辨率特征图上使用全局注意力块(GAB)进行长距离依赖建模。
- 在最后一层引入单一交叉注意力块(CAB),用于融合模板分支与搜索分支的特征,增强判别性表征。
- 在每个token上附加分类头和回归头,直接预测目标存在性与边界框大小。
- 通过仅在低分辨率特征上应用全局注意力,优化推理速度,降低FLOPs,同时保持精度。
- 从零开始训练或使用ImageNet进行预训练,以评估预训练对性能和收敛的影响。
实验结果
研究问题
- RQ1全Transformer架构是否能在视觉目标追踪中超越主流的'CNN+Transformer'方法?
- RQ2当直接应用于图像块而无CNN监督时,自注意力机制在追踪中的特征提取是否有效?
- RQ3如何配置局部、全局和交叉注意力块,以在精度与推理速度之间取得最佳平衡?
- RQ4与从零开始训练相比,ImageNet预训练对全Transformer追踪模型有多关键?
- RQ5基于注意力的特征融合(CAB)是否显著优于传统的相关性融合方法?
主要发现
- DualTFR在VOT2020基准上实现了新的SOTA EAO得分0.528,优于现有方法,包括STARK和TransT。
- 在GOT-10k基准上,当在ImageNet上预训练时,DualTFR达到73.5%的AO得分,显著优于使用深度可分离相关性替代交叉注意力时的51.2%得分。
- 该模型在单张NVIDIA 2080Ti GPU上运行速度约为40 fps,展示了其具备实时推理能力。
- 消融实验表明,使用全局注意力块(GAB)可使AO从42.1%提升至46.1%,加入交叉注意力块后性能进一步提升至48.5%。
- ImageNet预训练至关重要:从零开始训练时性能从73.5%降至48.5%,表明预训练为全Transformer流水线提供了关键的归纳偏置。
- 该模型参数量为44.1M,FLOPs为18.9G,在VOT2020上的精度优于STARK(42.4M参数,18.5G FLOPs),证明了其更优的精度-效率权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。