Skip to main content
QUICK REVIEW

[논문 리뷰] LaSOT: A High-quality Large-scale Single Object Tracking Benchmark

Heng Fan, Hexin Bai|arXiv (Cornell University)|2020. 09. 08.
Video Surveillance and Tracking Methods참고 문헌 90인용 수 14
한 줄 요약

LaSOT는 85개의 다양한 객체 클래스에 걸쳐 총 1,550개의 영상과 387만 개 이상의 고밀도 애너테이션 프레임을 포함한 대규모 고품질 단일 객체 시각 추적 벤치마크를 도입한다. 이는 전반적 겹침 및 일회성 추적 프로토콜을 통해 장기 추적의 신뢰성 있는 평가를 가능하게 하며, 현재의 추적 알고리즘이 아직도 새로운 타깃이나 장시간 시퀀스를 다룰 때 향상 여지가 크다는 것을 입증한다.

ABSTRACT

Despite great recent advances in visual tracking, its further development, including both algorithm design and evaluation, is limited due to lack of dedicated large-scale benchmarks. To address this problem, we present LaSOT, a high-quality Large-scale Single Object Tracking benchmark. LaSOT contains a diverse selection of 85 object classes, and offers 1,550 totaling more than 3.87 million frames. Each video frame is carefully and manually annotated with a bounding box. This makes LaSOT, to our knowledge, the largest densely annotated tracking benchmark. Our goal in releasing LaSOT is to provide a dedicated high quality platform for both training and evaluation of trackers. The average video length of LaSOT is around 2,500 frames, where each video contains various challenge factors that exist in real world video footage,such as the targets disappearing and re-appearing. These longer video lengths allow for the assessment of long-term trackers. To take advantage of the close connection between visual appearance and natural language, we provide language specification for each video in LaSOT. We believe such additions will allow for future research to use linguistic features to improve tracking. Two protocols, full-overlap and one-shot, are designated for flexible assessment of trackers. We extensively evaluate 48 baseline trackers on LaSOT with in-depth analysis, and results reveal that there still exists significant room for improvement. The complete benchmark, tracking results as well as analysis are available at http://vision.cs.stonybrook.edu/~lasot/.

연구 동기 및 목표

  • 딥 러닝 시대에 걸쳐 시각 추적을 위한 대규모 고품질 벤치마크의 부족을 해결한다.
  • 장기 추적 알고리즘의 훈련과 평가를 위한 전용 플랫폼을 제공한다.
  • 기존 벤치마크의 한계, 즉 소규모, 희박하거나 반자동 애너테이션, 짧은 영상 길이 등의 문제를 해결한다.
  • 정확한 프레임별 애너테이션과 다양한 도전 과제 요소를 제공함으로써 추적 알고리즘의 공정하고 신뢰할 수 있는 평가를 가능하게 한다.
  • 각 영상에 대한 언어 기반 사양을 도입하여 향후 연구를 촉진하고 언어 유도 추적 모델링을 탐색할 수 있도록 한다.

제안 방법

  • 85개의 객체 클래스에서 유의미한 다양성을 확보한 총 1,550개의 영상 세트를 선별하였으며, 각 영상에 대해 모든 프레임에 대해 수작업으로 바운딩 박스를 애너테이션하였다.
  • 유연한 벤치마크 평가를 위해 두 가지 평가 프로토콜을 설계하였다: 전반적 겹침(표준 추적)과 일회성(제로샷 일반화)이다.
  • 시각적 외관과 언어적 맥락을 연결하기 위해 각 영상에 자연어 기반 설명을 애너테이션하였다.
  • 이전 데이터셋에서 사용된 반자동 또는 희박한 레이블링 방법을 피하기 위해 수작업 레이블링을 통해 고품질 애너테이션을 확보하였다.
  • 실제 환경 도전 과제 하에서 장기 추적 성능 평가를 지원하기 위해 장시간 영상 시퀀스(평균 약 2,500 프레임)를 선택하였다.
  • 공개 리포지토리를 제공하여 전체 벤치마크, 추적 결과 및 분석 자료를 커뮤니티가 사용할 수 있도록 하였다.

실험 결과

연구 질문

  • RQ1대규모 고밀도 애너테이션을 갖춘 벤치마크는 시각 추적 평가의 신뢰성과 공정성을 향상시킬 수 있는가?
  • RQ2현재 최고 수준의 추적 알고리즘은 복잡한 외관 변화와 타깃 재등장 상황에서 장기 추적 성능을 어떻게 발휘하는가?
  • RQ3영상 콘텐츠에 대한 언어 기반 설명이 추적 성능 향상이나 새로운 모델링 접근법을 가능하게 하는가?
  • RQ4모델 업데이트 전략은 특히 일회성 또는 장기 추적 환경에서 추적기의 강건성에 중대한 영향을 미치는가?
  • RQ5더 깊은 신경망 백본은 일회성 프로토콜에서 알려지지 않은 타깃을 대상으로 한 추적 성능에 어떤 영향을 미치는가?

주요 결과

  • LaSOT는 1,550개의 영상과 387만 개 이상의 정확한 애너테이션 프레임을 포함하여, 현재까지 알려진 바에서 가장 큰 고밀도 애너테이션 추적 벤치마크이다.
  • 일회성 프로토콜에서 ResNet-50를 사용한 DiMP는 SiamRPN++(AlexNet 기반)의 0.245보다 뚜렷이 높은 성공 점수 0.392를 기록하여 제로샷 일반화에 있어 깊이 있는 특징의 중요성을 입증한다.
  • 모든 추적 알고리즘에서 더 깊은 백본(ResNet-50)이 성능 향상에 기여하였으며, 전반적 겹침 평가에서 SiamRPN++는 AlexNet 대비 성공 점수 0.495(0.433)로 향상되었다.
  • 모델 업데이트 기능을 사용한 추적기(DiMP, LTMU)는 업데이트 기능이 없는 추적기보다 성능이 뛰어나 전반적 겹침 평가에서 성공 점수 0.560을 기록한 반면, GlobalTrack는 0.517을 기록하였다.
  • ResNet-18에서 AlexNet으로의 성능 저하 폭은 일회성 프로토콜에서 더 두드러졌으며(0.071 감소), 깊이 있는 특징이 새로운 타깃으로의 일반화에 핵심적임을 시사한다.
  • LaSOT에서 48개의 추적 알고리즘을 광범위하게 평가한 결과, 특히 장기 추적 및 제로샷 추적 환경에서 향상 여지가 뚜렷하게 남아 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.