[论文解读] Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers
本文提出了一种新型框架——孪生自然语言追踪器(Siamese Natural Language Tracker, SNLT),通过孪生自然语言区域提议网络(SNL-RPN)和动态模态融合,将自然语言描述整合到孪生视觉追踪器中。通过利用视觉-语言对齐和基于熵的加权机制,SNLT在LaSOT数据集上使孪生追踪器的性能提升了3–7个百分点,优于所有先前的自然语言追踪器,同时在单张GPU上实现50 FPS的推理速度。
We propose a novel Siamese Natural Language Tracker (SNLT), which brings the advancements in visual tracking to the tracking by natural language (NL) descriptions task. The proposed SNLT is applicable to a wide range of Siamese trackers, providing a new class of baselines for the tracking by NL task and promising future improvements from the advancements of Siamese trackers. The carefully designed architecture of the Siamese Natural Language Region Proposal Network (SNL-RPN), together with the Dynamic Aggregation of vision and language modalities, is introduced to perform the tracking by NL task. Empirical results over tracking benchmarks with NL annotations show that the proposed SNLT improves Siamese trackers by 3 to 7 percentage points with a slight tradeoff of speed. The proposed SNLT outperforms all NL trackers to-date and is competitive among state-of-the-art real-time trackers on LaSOT benchmarks while running at 50 frames per second on a single GPU.
研究动机与目标
- 通过利用孪生追踪器的最新进展,弥合视觉追踪与基于自然语言(NL)描述的追踪之间的差距。
- 解决在不依赖孤立的NL专用模型的前提下提升基于自然语言的追踪性能的挑战。
- 开发一种可泛化、实时的框架,统一视觉与语言模态,用于目标追踪。
- 通过孪生追踪架构的持续进步,为未来自然语言追踪的改进提供支持。
- 证明SNLT优于现有自然语言追踪器,并与最先进的实时视觉追踪器性能相当。
提出的方法
- 提出一种孪生自然语言区域提议网络(SNL-RPN),与孪生追踪器共享特征提取结构,并将自然语言嵌入作为卷积核使用。
- 引入一种动态聚合模块,根据预测熵对视觉与语言分支的预测结果进行融合,以提升鲁棒性。
- 在视觉与语言分支中使用共享主干网络(如SiamRPN++),实现端到端训练。
- 在模板与搜索特征之间使用互相关或深度可分离互相关运算,并将自然语言嵌入作为可学习卷积核注入。
- 在公式(4)中应用基于熵的加权机制,动态地为不确定性较低的模态分配更高置信度。
- 使用共享特征训练SNL-RPN,并在带有自然语言标注的追踪数据集上微调语言编码器(如BERT、HGLMM)。
实验结果
研究问题
- RQ1孪生视觉追踪器能否在不牺牲实时性能的前提下,被增强以实现基于自然语言描述的追踪?
- RQ2在模糊或遮挡场景下,如何实现视觉与语言模态的动态融合以提升追踪鲁棒性?
- RQ3孪生追踪架构的进展能在多大程度上迁移到基于自然语言的追踪任务中?
- RQ4在孪生架构中将语言嵌入作为卷积核使用,是否能在多样化的追踪基准上带来一致的性能提升?
- RQ5模态不确定性(通过熵衡量)与追踪精度之间有何关联?其能否指导最优的模态融合?
主要发现
- SNLT在LaSOT基准上使基线孪生追踪器(SiamFC、SiamRPN、SiamRPN++)的精度提升了3–7个百分点。
- SNLT在LaSOT测试集上优于所有先前的自然语言追踪器,包括Feng [14] 和 Li [26]。
- SNLT在单张NVIDIA 2080 Ti GPU上实现了超过50帧每秒的推理速度,适用于实时应用。
- 基于熵的动态聚合模块显著提升了鲁棒性,尤其在遮挡或外观变化低的场景下表现更优。
- 使用HGLMM生成句子嵌入的模型性能优于基于GloVe的模型,表明视觉特定预训练具有优势。
- 消融实验表明,SNLT的学习能力超越了简单的类别标签,展现出比基线SiamRPN++更丰富的语义理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。