[论文解读] Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and Benchmark
本文提出了 TNL2K,一个大规模的自然语言引导目标跟踪基准,包含 2,000 个视频序列,配有密集的语言描述和边界框标注。该研究提出了一种自适应局部-全局搜索算法(AdaSwitcher),整合了视觉、语言和历史线索,在该基准上实现了最先进性能,联合边界框与语言跟踪设置下的成功率为 0.370,精度为 0.355。
Tracking by natural language specification is a new rising research topic that aims at locating the target object in the video sequence based on its language description. Compared with traditional bounding box (BBox) based tracking, this setting guides object tracking with high-level semantic information, addresses the ambiguity of BBox, and links local and global search organically together. Those benefits may bring more flexible, robust and accurate tracking performance in practical scenarios. However, existing natural language initialized trackers are developed and compared on benchmark datasets proposed for tracking-by-BBox, which can't reflect the true power of tracking-by-language. In this work, we propose a new benchmark specifically dedicated to the tracking-by-language, including a large scale dataset, strong and diverse baseline methods. Specifically, we collect 2k video sequences (contains a total of 1,244,340 frames, 663 words) and split 1300/700 for the train/testing respectively. We densely annotate one sentence in English and corresponding bounding boxes of the target object for each video. We also introduce two new challenges into TNL2K for the object tracking task, i.e., adversarial samples and modality switch. A strong baseline method based on an adaptive local-global-search scheme is proposed for future works to compare. We believe this benchmark will greatly boost related researches on natural language guided tracking.
研究动机与目标
- 为解决传统基于边界框的目标跟踪方法存在的局限性,如初始化模糊性和对外观变化处理能力差的问题。
- 通过使用自然语言描述而非边界框进行目标初始化,实现更灵活且准确的跟踪。
- 建立一个专门用于语言引导跟踪的基准,因为现有基准不适用于评估语言引导跟踪的性能。
- 提供一种强大且可适应的基线方法,结合局部与全局搜索策略,利用视觉、语言和历史线索。
- 在对抗样本、模态切换(RGB/热成像)和外观变化等挑战性条件下,评估跟踪的鲁棒性。
提出的方法
- 提出 TNL2K,一个新基准,包含 2,000 个视频序列(1,300 个用于训练,700 个用于测试),每个序列均配有英文描述句子和目标对象的密集边界框标注。
- 设计一种自适应局部-全局搜索机制(AdaSwitcher),根据置信度分数和视觉定位质量动态选择局部或全局搜索。
- 整合多种输入模态:来自特征图的视觉特征、语言嵌入、预测边界框和用于异常检测的残差图像。
- 在 AdaSwitcher 中使用帧级注意力机制,以加权跟踪序列中每帧的重要性,提升对外观变化的鲁棒性。
- 将空间坐标作为视觉定位的关键组件,显著提升跟踪精度,如消融实验所示。
- 采用基于阈值的切换机制(最优阈值为 0.7),根据响应分数决定何时在局部与全局搜索模式之间切换。
实验结果
研究问题
- RQ1与传统的基于边界框的初始化相比,自然语言描述是否能提升跟踪的准确性和灵活性?
- RQ2语言与视觉特征的融合如何增强对外观变化和遮挡的鲁棒性?
- RQ3空间坐标和历史信息对视觉定位及跟踪性能有何影响?
- RQ4对抗样本和模态切换如何影响语言引导设置下的跟踪性能?
- RQ5自适应局部-全局搜索机制在语言引导跟踪中的最优配置是什么?
主要发现
- AdaSwitcher 基线在联合边界框与语言跟踪设置下,成功率为 0.370,精度为 0.355,优于仅使用边界框或仅使用语言的方法。
- 在视觉定位中引入空间坐标后,成功率从 0.344 提升至 0.353,精度从 0.355 提升至 0.362,表明其关键作用。
- 移除预测边界框或残差图像特征会使性能下降 0.01–0.015,表明其在失败检测和稳定性方面的重要性。
- AdaSwitcher 的最优切换阈值为 0.7,此时成功率(0.370)和精度(0.355)达到最高。
- SiamRCNN 在对抗样本和完全遮挡等挑战性属性上表现最佳,而专为攻击设计的 RTAA 在对抗样本上表现更差,凸显了检测能力的重要性。
- 消融实验确认,所有组件——边界框、响应分数、ResImg、ResMap 和语言——均对跟踪鲁棒性有显著贡献,完整模型性能最高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。