[논문 리뷰] VastTrack: Vast Category Visual Object Tracking
VastTrack는 2,115개의 객체 카테고리와 50,610개의 영상 시퀀스를 포함하는 대규모 시각적 객체 추적 벤치마크를 도입하여 기존 데이터셋의 범위를 크게 확장한다. 풍부한 애너테이션(경계 상자 및 언어적 기술)을 통해 일반 목적 추적기의 훈련 및 평가를 가능하게 하며, 현재의 추적기가 이 다양하고 대규모의 벤치마크에서 성능이 열등함을 입증함으로써, 시각적 추적에서의 일반화 능력 향상의 필요성을 강조한다.
In this paper, we introduce a novel benchmark, dubbed VastTrack, towards facilitating the development of more general visual tracking via encompassing abundant classes and videos. VastTrack possesses several attractive properties: (1) Vast Object Category. In particular, it covers target objects from 2,115 classes, largely surpassing object categories of existing popular benchmarks (e.g., GOT-10k with 563 classes and LaSOT with 70 categories). With such vast object classes, we expect to learn more general object tracking. (2) Larger scale. Compared with current benchmarks, VastTrack offers 50,610 sequences with 4.2 million frames, which makes it to date the largest benchmark regarding the number of videos, and thus could benefit training even more powerful visual trackers in the deep learning era. (3) Rich Annotation. Besides conventional bounding box annotations, VastTrack also provides linguistic descriptions for the videos. The rich annotations of VastTrack enables development of both the vision-only and the vision-language tracking. To ensure precise annotation, all videos are manually labeled with multiple rounds of careful inspection and refinement. To understand performance of existing trackers and to provide baselines for future comparison, we extensively assess 25 representative trackers. The results, not surprisingly, show significant drops compared to those on current datasets due to lack of abundant categories and videos from diverse scenarios for training, and more efforts are required to improve general tracking. Our VastTrack and all the evaluation results will be made publicly available https://github.com/HengLan/VastTrack.
연구 동기 및 목표
- 기존 시각적 추적기의 일반화 능력 부족 문제를 해결하기 위해 객체 카테고리와 훈련 시퀀스의 다양성이 부족한 문제를 해결하고자 한다.
- 영상에 대한 언어적 기술을 포함시켜 시각 전용 및 시각-언어 추적 모두를 지원하는 벤치마크를 개발하고자 한다.
- 이전 데이터셋보다 훨씬 광범위한 객체 카테고리 범위를 커버함으로써 일반 추적 성능에 대한 보다 정직한 평가를 가능하게 하고자 한다.
- 대규모 모델 시대에 맞춰 확장 가능하고 고품질인 데이터셋을 제공하여 강력하고 일반화 가능한 딥 러닝 기반 추적기의 훈련을 지원하고자 한다.
- 다양하고 대규모의 벤치마크에서 현재 추적기의 성능 격차를 규명함으로써 향후 일반화 능력 향상을 위한 연구를 촉진하고자 한다.
제안 방법
- VastTrack 벤치마크는 다양한 실제 시나리오에서 유래한 50,610개의 영상 시퀀스를 정제하여 구축되었다. 이는 2,115개의 고유한 객체 카테고리를 포함한다.
- 모든 영상에 대해 고정밀 경계 상자를 확보하기 위해 다중 라운드의 검토를 거쳐 수작업으로 애너테이션을 수행하여 높은 품질의 애너테이션을 확보하였다.
- 시각-언어 추적을 지원하기 위해 각 영상에 언어적 기술을 추가하여 다중모odal 학습에 대한 데이터셋의 유용성을 향상시켰다.
- 평균 시퀀스 길이가 83프레임인 단기 추적을 중심으로 강조하였지만, 장기 추적 연구에도 적용 가능하다.
- 추적 과제의 특성을 기술하기 위해 물체 운동, 크기 변화, 인접 프레임 간의 IoU 등의 종합적 통계를 포함하였다.
- 정밀도, 정규화된 정밀도, 성공도를 사용하여 10개의 속성에서 25개의 최신 추적기 성능을 평가할 수 있도록 평가 프로토콜을 수립하였다.
실험 결과
연구 질문
- RQ1기존의 표준보다 훨씬 더 많은 객체 카테고리와 시퀀스를 포함한 벤치마크에서 평가할 경우, 현재의 시각적 추적기 성능가 어떻게 저하되는가?
- RQ2시각-언어 애너테이션은 다양한 실제 영상 시퀀스에서 시각적 추적 모델의 강건성과 일반화 능력을 어느 정도 향상시키는가?
- RQ3작은 데이터셋과 비교해 2,115개의 객체 카테고리와 50K+ 시퀀스를 포함한 데이터셋에서 테스트할 경우 나타나는 주요 추적 과제는 무엇인가?
- RQ4이전에 주요 벤치마크에서 볼 수 없었던 희귀 객체 카테고리가 추적기 성능에 어떤 영향을 미치며, 그 어려움을 결정짓는 요소는 무엇인가?
- RQ5대규모 추적 벤치마크에 언어적 기술을 포함시키면 더 강건하고 일반화 능력이 뛰어난 추적 모델을 도출할 수 있는가?
주요 결과
- 현재 최신 추적기들은 VastTrack에서 기존 벤치마크 대비 성능 저하를 보이며, 새로운 카테고리와 다양한 시나리오에 대한 일반화 능력이 열악함을 시사한다.
- 희귀 클래스인 Aardwolf의 평균 성공도(SUC)는 0.689이며, 일부 일반 클래스인 Actor(0.691)보다 높다. 이는 곤란도가 카테고리 빈도에 의해 결정되지 않음을 보여준다.
- Air Hockey와 같은 희귀 클래스의 성능은 매우 낮다(평균SUC = 0.052). 이는 드문 또는 시각적으로 복잡한 물체에 대한 일반화의 과제를 강조한다.
- 물체 운동의 다양성, 크기 변화, 인접 프레임 간의 IoU 급격한 변화 등으로 인해 추적 과제의 난이도가 증가하며, 이는 빠른 운동 및 대규모 척도 변화 속성에서 낮은 성능으로 확인된다.
- 언어적 기술의 포함은 시각-언어 추적 분야의 새로운 연구 방향을 가능하게 하였지만, 현재의 모델들은 이 풍부한 애너테이션을 가진 벤치마크에서 제한된 성능을 보였다.
- 50,610개의 시퀀스와 2,115개의 카테고리로 구성된 이 벤치마크의 규모는 기존 데이터셋(GOT-10k: 563개 카테고리, TrackingNet: 27개 카테고리)을 뛰어넘어 현재까지 알려진 가장 큰 시각적 추적 벤치마크이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.