Skip to main content
QUICK REVIEW

[论文解读] VastTrack: Vast Category Visual Object Tracking

Liang Peng, Junyuan Gao|arXiv (Cornell University)|Mar 6, 2024
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

VastTrack 引入了一个大规模视觉目标跟踪基准,包含 2,115 个物体类别和 50,610 个视频序列,显著扩展了现有数据集的范围。它通过丰富的标注(包括边界框和语言描述)支持通用追踪器的训练与评估,表明当前追踪器在这一多样化、大规模基准上的表现欠佳,凸显了视觉追踪中泛化能力提升的迫切需求。

ABSTRACT

In this paper, we introduce a novel benchmark, dubbed VastTrack, towards facilitating the development of more general visual tracking via encompassing abundant classes and videos. VastTrack possesses several attractive properties: (1) Vast Object Category. In particular, it covers target objects from 2,115 classes, largely surpassing object categories of existing popular benchmarks (e.g., GOT-10k with 563 classes and LaSOT with 70 categories). With such vast object classes, we expect to learn more general object tracking. (2) Larger scale. Compared with current benchmarks, VastTrack offers 50,610 sequences with 4.2 million frames, which makes it to date the largest benchmark regarding the number of videos, and thus could benefit training even more powerful visual trackers in the deep learning era. (3) Rich Annotation. Besides conventional bounding box annotations, VastTrack also provides linguistic descriptions for the videos. The rich annotations of VastTrack enables development of both the vision-only and the vision-language tracking. To ensure precise annotation, all videos are manually labeled with multiple rounds of careful inspection and refinement. To understand performance of existing trackers and to provide baselines for future comparison, we extensively assess 25 representative trackers. The results, not surprisingly, show significant drops compared to those on current datasets due to lack of abundant categories and videos from diverse scenarios for training, and more efforts are required to improve general tracking. Our VastTrack and all the evaluation results will be made publicly available https://github.com/HengLan/VastTrack.

研究动机与目标

  • 为解决现有视觉追踪器因物体类别和训练序列多样性不足而导致的泛化能力有限的问题。
  • 开发一个支持仅视觉和视觉-语言追踪的基准,通过为视频添加语言描述实现。
  • 通过覆盖远超以往数据集的物体类别范围,实现对通用追踪性能更真实的评估。
  • 提供一个可扩展、高质量的数据集,以支持在大模型时代训练鲁棒且可泛化的深度学习追踪器。
  • 识别当前追踪器在多样化、大规模基准上评估时存在的性能差距,从而推动未来在泛化能力方面的研究。

提出的方法

  • VastTrack 基准通过从多样化现实场景中精选 50,610 个视频序列构建而成,涵盖 2,115 个不同的物体类别。
  • 所有视频均通过多轮人工检查进行精确边界框标注,以确保高质量的标注结果。
  • 为每个视频添加了语言描述,以支持视觉-语言追踪,提升数据集在多模态学习中的实用性。
  • 该数据集强调短时追踪,平均序列长度为 83 帧,尽管也适用于长时追踪研究。
  • 基准包含关于物体运动、尺寸变化以及相邻帧间 IoU 的全面统计,用于刻画追踪挑战。
  • 建立了评估协议,用于在 10 项属性上评估 25 种最先进追踪器,采用精度、归一化精度和成功度量指标。

实验结果

研究问题

  • RQ1当在远超当前标准的物体类别和序列数量的基准上评估时,现有视觉追踪器的性能如何下降?
  • RQ2视觉-语言标注在多大程度上提升了视觉追踪模型在多样化、真实世界视频序列上的鲁棒性和泛化能力?
  • RQ3在包含 2,115 个物体类别和 50K+ 个序列的数据集上测试时,与小型基准相比,追踪中浮现的关键挑战是什么?
  • RQ4稀有物体类别(在主要基准中此前未见过)如何影响追踪器性能,其难度受哪些因素影响?
  • RQ5在大规模追踪基准中引入语言描述,是否能带来更鲁棒和可泛化的追踪模型?

主要发现

  • 当前最先进追踪器在 VastTrack 上的表现相比现有基准出现显著下降,表明其对未见类别和多样化场景的泛化能力较差。
  • 稀有类别如 Aardwolf 的平均成功度(SUC)为 0.689,甚至超过某些常见类别(如 Actor 的 0.691),表明难度并非仅由类别频率决定。
  • 稀有类别如 Air Hockey 的性能极低(平均 SUC = 0.052),凸显了对不常见或视觉复杂的物体进行泛化追踪的挑战。
  • 数据集在物体运动、尺寸变化以及帧间 IoU 快速变化方面的高度多样性,导致了追踪难度增加,这在快速运动和大尺度变化等属性上表现明显。
  • 语言描述的引入为视觉-语言追踪开辟了新的研究方向,尽管当前模型在这一丰富标注的基准上表现有限。
  • 该基准的规模——50,610 个序列和 2,115 个类别——超过了现有数据集(如 GOT-10k 的 563 个类别和 TrackingNet 的 27 个类别),使其成为目前已知最大的视觉追踪基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。