Skip to main content
QUICK REVIEW

[论文解读] LaSOT: A High-quality Large-scale Single Object Tracking Benchmark

Heng Fan, Hexin Bai|arXiv (Cornell University)|Sep 8, 2020
Video Surveillance and Tracking Methods参考文献 90被引用 14
一句话总结

LaSOT 引入了一个大规模、高质量的单目标视觉跟踪基准,包含 1,550 个视频,涵盖 85 种不同的物体类别,共超过 387 万帧密集标注。该基准通过两种评估协议——完全重叠和单次示例——实现了对长期跟踪的稳健评估,表明当前跟踪器在处理未见目标和长序列方面仍有显著的提升空间。

ABSTRACT

Despite great recent advances in visual tracking, its further development, including both algorithm design and evaluation, is limited due to lack of dedicated large-scale benchmarks. To address this problem, we present LaSOT, a high-quality Large-scale Single Object Tracking benchmark. LaSOT contains a diverse selection of 85 object classes, and offers 1,550 totaling more than 3.87 million frames. Each video frame is carefully and manually annotated with a bounding box. This makes LaSOT, to our knowledge, the largest densely annotated tracking benchmark. Our goal in releasing LaSOT is to provide a dedicated high quality platform for both training and evaluation of trackers. The average video length of LaSOT is around 2,500 frames, where each video contains various challenge factors that exist in real world video footage,such as the targets disappearing and re-appearing. These longer video lengths allow for the assessment of long-term trackers. To take advantage of the close connection between visual appearance and natural language, we provide language specification for each video in LaSOT. We believe such additions will allow for future research to use linguistic features to improve tracking. Two protocols, full-overlap and one-shot, are designated for flexible assessment of trackers. We extensively evaluate 48 baseline trackers on LaSOT with in-depth analysis, and results reveal that there still exists significant room for improvement. The complete benchmark, tracking results as well as analysis are available at http://vision.cs.stonybrook.edu/~lasot/.

研究动机与目标

  • 解决深度学习时代视觉跟踪领域缺乏大规模、高质量基准的问题。
  • 提供一个专门用于训练和评估长期跟踪算法的平台,支持长时间视频序列。
  • 克服现有基准的局限性,如规模小、标注稀疏或半自动标注、视频长度短等问题。
  • 通过提供精确的逐帧标注和多样的挑战因素,实现对跟踪器的公平且可靠的评估。
  • 通过为每个视频引入语言规范,促进未来研究,探索语言引导的跟踪方法。

提出的方法

  • 从 85 种物体类别中精心挑选了 1,550 个视频,每个视频的每一帧均经过人工标注边界框。
  • 设计了两种评估协议:完全重叠(标准跟踪)和单次示例(零样本泛化),以支持灵活的基准测试。
  • 为每个视频添加自然语言描述,将视觉外观与语言上下文关联,以支持潜在的跨模态学习。
  • 通过人工标注确保高质量标注,避免先前数据集中使用的半自动或稀疏标注方法。
  • 选取了长视频序列(平均约 2,500 帧),以支持在真实世界挑战下对长期跟踪性能的评估。
  • 提供公开存储库,托管完整基准、跟踪结果和分析,供社区使用。

实验结果

研究问题

  • RQ1大规模、密集标注的基准是否能提升视觉跟踪评估的可靠性和公平性?
  • RQ2当前最先进跟踪器在复杂外观变化和目标重新出现的长期跟踪场景下表现如何?
  • RQ3对视频内容的语言描述在多大程度上能提升跟踪性能,或支持新型建模方法?
  • RQ4模型更新策略是否显著影响跟踪器鲁棒性,尤其是在单次示例或长期场景下?
  • RQ5更深的神经网络主干网络在单次示例协议中对未见目标的跟踪性能有何影响?

主要发现

  • LaSOT 包含 1,550 个视频,超过 387 万帧精确标注,是目前已知最大的密集标注跟踪基准。
  • 在单次示例协议中,使用 ResNet-50 的 DiMP 成功得分为 0.392,显著优于使用 AlexNet 的 SiamRPN++(0.245),凸显深层特征在零样本泛化中的重要性。
  • 所有跟踪器在使用更深主干网络(ResNet-50)时性能均得到提升,SiamRPN++ 在完全重叠评估中成功得分达 0.495(相比使用 AlexNet 的 0.433)。
  • 采用模型更新机制的跟踪器(如 DiMP、LTMU)表现优于未使用更新机制的跟踪器,在完全重叠协议中成功得分为 0.560,而 GlobalTrack 为 0.517。
  • 从 ResNet-18 到 AlexNet 的性能下降在单次示例协议中更为明显(下降 0.071),表明深层特征对未见目标的泛化至关重要。
  • 在 LaSOT 上对 48 种跟踪器的广泛评估揭示了显著的改进空间,尤其是在长期跟踪和零样本跟踪场景下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。