Skip to main content
QUICK REVIEW

[论文解读] Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline

Pengyu Zhang, Jie Zhao|arXiv (Cornell University)|Apr 8, 2022
Video Surveillance and Tracking Methods被引用 9
一句话总结

本论文提出了VTUAV,一个大规模可见光-热成像无人机跟踪基准,包含500个高分辨率(1920×1080)的RGB-T序列,总计170万帧,支持短时跟踪、长时跟踪和实例分割。论文提出了一种分层多模态融合跟踪器(HMFT),整合了图像级、特征级和决策级融合,在多个基准上实现了新的最先进性能,尤其在长时跟踪任务中,MSR达到46.1%,MPR达到53.6%。

ABSTRACT

With the popularity of multi-modal sensors, visible-thermal (RGB-T) object tracking is to achieve robust performance and wider application scenarios with the guidance of objects' temperature information. However, the lack of paired training samples is the main bottleneck for unlocking the power of RGB-T tracking. Since it is laborious to collect high-quality RGB-T sequences, recent benchmarks only provide test sequences. In this paper, we construct a large-scale benchmark with high diversity for visible-thermal UAV tracking (VTUAV), including 500 sequences with 1.7 million high-resolution (1920 $ imes$ 1080 pixels) frame pairs. In addition, comprehensive applications (short-term tracking, long-term tracking and segmentation mask prediction) with diverse categories and scenes are considered for exhaustive evaluation. Moreover, we provide a coarse-to-fine attribute annotation, where frame-level attributes are provided to exploit the potential of challenge-specific trackers. In addition, we design a new RGB-T baseline, named Hierarchical Multi-modal Fusion Tracker (HMFT), which fuses RGB-T data in various levels. Numerous experiments on several datasets are conducted to reveal the effectiveness of HMFT and the complement of different fusion types. The project is available at here.

研究动机与目标

  • 为解决RGB-T跟踪中配对训练数据严重缺乏的问题,构建一个大规模、多样化、高分辨率的基准。
  • 支持在短时跟踪、长时跟踪和实例分割任务上对RGB-T跟踪器进行全面评估。
  • 在帧级和序列级提供细粒度的、由粗到精的属性标注,以支持针对特定挑战的跟踪器开发。
  • 设计一种新型、鲁棒的RGB-T跟踪基线(HMFT),实现多模态信息在多个层次上的有效融合。

提出的方法

  • 构建VTUAV,一个大规模基准,包含500个多样化无人机序列,170万帧高分辨率(1920×1080)的RGB-T图像对,涵盖多样化的场景与挑战。
  • 提出一种分层多模态融合框架(HMFT),统一整合图像融合、特征融合与决策融合,用于RGB-T跟踪。
  • 采用由粗到精的属性标注方案,在帧级和序列级标注13种挑战类型(如遮挡、光照变化、运动模糊)。
  • 为短时跟踪(HMFT)和长时跟踪(HMFT_LT)设计HMFT的不同变体,分别引入重新检测机制与记忆机制。
  • 采用多阶段融合策略:早期融合(图像级)、中期特征融合,以及晚期融合(决策级)结合自适应融合模块。
  • 在多个基准(GTOT、RGBT210、RGBT234、VTUAV)上评估HMFT,使用标准化指标,包括MSR、MPR和EAO。

实验结果

研究问题

  • RQ1所提出的HMFT跟踪器在多样化跟踪场景下,与当前最先进RGB-T跟踪器相比,其精度与鲁棒性如何?
  • RQ2不同融合策略(图像级、特征级、决策级)对RGB-T跟踪性能的贡献程度如何?
  • RQ3所提出的VTUAV基准能否支持对RGB-T跟踪器在短时跟踪、长时跟踪和分割任务上的全面评估?
  • RQ4由粗到精的属性标注在支持特定挑战的跟踪器开发方面是否有效?

主要发现

  • HMFT_LT在长时跟踪任务上达到新的SOTA性能,MSR为46.1%,MPR为53.6%,分别较之前最佳跟踪器FSRPN提升14.7%和17.0%。
  • 所提出的HMFT基线在长时跟踪子集上实现35.5% MSR和41.4% MPR,证明了分层融合在多级融合中的有效性。
  • 图像级融合(CIF)和特征级融合(DFF)分别在MSR上较单模态DiMP提升3.2%和4.4%;结合自适应决策融合(ADF)后,MSR和MPR进一步提升2.6%和2.7%。
  • 在VTUAV-V子集(仅可见光)上,基于Transformer的跟踪器如STARK实现64.9% SR和75.3% PR,凸显注意力机制在视觉跟踪中的优势。
  • 长时跟踪器(LTMU、GlobalTrack、SPLT)在长时评估中显著优于其他模型,归因于其重新检测与记忆机制,验证了这些组件的重要性。
  • 消融实验表明,采用自适应加权的决策融合(ADF)至关重要;若简单平均互补与判别分支的响应,则性能反而下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。