[论文解读] AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility
AVisT 提出了一项针对恶劣能见度条件下视觉目标跟踪的新基准,包含120个具有挑战性的视频序列,覆盖18种不同的场景,划分为五大属性——如浓雾、暴雨、伪装、低光照和小目标。尽管采用了在ImageNet-22k上预训练的最先进Transformer模型,最佳跟踪器的AUC仅达到56.0%,凸显了该基准的难度,也凸显了对鲁棒且泛化能力强的跟踪解决方案的迫切需求。
One of the key factors behind the recent success in visual tracking is the availability of dedicated benchmarks. While being greatly benefiting to the tracking research, existing benchmarks do not pose the same difficulty as before with recent trackers achieving higher performance mainly due to (i) the introduction of more sophisticated transformers-based methods and (ii) the lack of diverse scenarios with adverse visibility such as, severe weather conditions, camouflage and imaging effects. We introduce AVisT, a dedicated benchmark for visual tracking in diverse scenarios with adverse visibility. AVisT comprises 120 challenging sequences with 80k annotated frames, spanning 18 diverse scenarios broadly grouped into five attributes with 42 object categories. The key contribution of AVisT is diverse and challenging scenarios covering severe weather conditions such as, dense fog, heavy rain and sandstorm; obstruction effects including, fire, sun glare and splashing water; adverse imaging effects such as, low-light; target effects including, small targets and distractor objects along with camouflage. We further benchmark 17 popular and recent trackers on AVisT with detailed analysis of their tracking performance across attributes, demonstrating a big room for improvement in performance. We believe that AVisT can greatly benefit the tracking community by complementing the existing benchmarks, in developing new creative tracking solutions in order to continue pushing the boundaries of the state-of-the-art. Our dataset along with the complete tracking performance evaluation is available at: https://github.com/visionml/pytracking
研究动机与目标
- 解决现有数据集未能充分覆盖真实世界中恶劣能见度条件(如浓雾、暴雨、低光照)下视觉跟踪的综合性基准缺失问题。
- 提供一个多样化且具有挑战性的数据集,真实反映由严重天气、遮挡、伪装和成像效应导致的跟踪失败现象。
- 在多个属性上评估最先进跟踪器的性能,以揭示性能差距并指导未来研究。
- 通过强调超越当前基准的现实世界复杂性,建立视觉跟踪鲁棒性评估的新标准。
提出的方法
- 收集120个高分辨率视频序列,共包含80,000帧标注,涵盖42种不同的物体类别,覆盖18种不同的恶劣能见度场景。
- 将场景划分为五大属性:天气状况(如雾、雨、沙尘暴)、遮挡效应(如火焰、强光)、成像效应(如低光照)、目标效应(如小目标、干扰物)以及伪装。
- 采用人工标注的高精度真实标注边界框,确保所有序列的评估结果可靠。
- 使用标准指标,在完整数据集上对17个近期跟踪器(涵盖孪生网络、判别分类器和基于Transformer的模型)进行基准测试。
- 采用AUC(曲线下面积)和归一化精度评估性能,并按属性分析结果,以识别失败模式。
- 在ImageNet-1k和ImageNet-22k上对主干网络模型进行预训练,以评估预训练规模对恶劣条件下鲁棒性的影响。
实验结果
研究问题
- RQ1最先进视觉跟踪器在强调真实世界恶劣能见度条件(现有数据集未涵盖)的基准上表现如何?
- RQ2与ImageNet-1k相比,ImageNet-22k预训练在多大程度上提升了跟踪器在多样化恶劣能见度属性下的鲁棒性?
- RQ3哪些特定属性(如天气、伪装、低光照)对当前跟踪模型构成最大挑战?
- RQ4在恶劣能见度条件下,不同跟踪范式(孪生网络、判别分类器、Transformer)之间是否存在一致的性能差距?
- RQ5基于属性的分析能否揭示当前跟踪架构在面对特定能见度退化时的系统性弱点?
主要发现
- AVisT上表现最佳的跟踪器MixFormerL-22k的AUC仅为56.0%,远低于LaSOT(70.1%)和TrackingNet(83.9%)等成熟基准的得分,充分证实了AVisT的高难度。
- 在ImageNet-22k上预训练的基于Transformer的模型(如MixFormerL-22k)优于在ImageNet-1k上预训练的模型,尤其在天气状况和成像效应方面表现更优,但增益程度因属性而异。
- 没有单一跟踪器在所有属性上均优于其他模型;例如,ToMP-101在成像效应上的表现与使用更大主干网络的MixFormerL-22k相当。
- 孪生网络跟踪器(如SiamRPN++)的AUC得分约为38–39,而判别分类器(如KeepTrack)的得分达到约49.4,表明网络架构选择对鲁棒性有显著影响。
- ImageNet-22k预训练带来的性能提升在不同属性间表现不一致——在天气和成像效应上增益显著,但在遮挡效应上提升微乎其微。
- 基于属性的分析表明,当前跟踪器在伪装、小目标和复杂天气条件下表现最差,暴露出其在泛化能力和鲁棒性方面的关键缺陷。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。