Skip to main content
QUICK REVIEW

[논문 리뷰] GlobalTrack: A Simple and Strong Baseline for Long-term Tracking

Lianghua Huang, Xin Zhao|arXiv (Cornell University)|2019. 12. 18.
Video Surveillance and Tracking Methods참고 문헌 33인용 수 17
한 줄 요약

GlobalTrack는 순수한 전역 인스턴스 검색 기반으로 단순하면서도 강력한 장기 시각 추적 프레임워크를 제안한다. 시간적 일관성 가정에 의존하지 않으며, 온라인 학습, 궤적 정제, 스케일 스무딩 없이도 4개의 주요 벤치마크에서 최신 기술 수준 성능을 달성한다. 이는 추적 실패나 일시적 대상 유실 상황에서도 강건성을 유지한다. TrackingNet에서 75.4%의 정규화된 정밀도와 TLP에서 63.8%의 성공률을 기록한다.

ABSTRACT

A key capability of a long-term tracker is to search for targets in very large areas (typically the entire image) to handle possible target absences or tracking failures. However, currently there is a lack of such a strong baseline for global instance search. In this work, we aim to bridge this gap. Specifically, we propose GlobalTrack, a pure global instance search based tracker that makes no assumption on the temporal consistency of the target's positions and scales. GlobalTrack is developed based on two-stage object detectors, and it is able to perform full-image and multi-scale search of arbitrary instances with only a single query as the guide. We further propose a cross-query loss to improve the robustness of our approach against distractors. With no online learning, no punishment on position or scale changes, no scale smoothing and no trajectory refinement, our pure global instance search based tracker achieves comparable, sometimes much better performance on four large-scale tracking benchmarks (i.e., 52.1% AUC on LaSOT, 63.8% success rate on TLP, 60.3% MaxGM on OxUvA and 75.4% normalized precision on TrackingNet), compared to state-of-the-art approaches that typically require complex post-processing. More importantly, our tracker runs without cumulative errors, i.e., any type of temporary tracking failures will not affect its performance on future frames, making it ideal for long-term tracking. We hope this work will be a strong baseline for long-term tracking and will stimulate future works in this area. Code is available at https://github.com/huanglianghua/GlobalTrack.

연구 동기 및 목표

  • 장기 시각 추적에서 대상 유실과 급격한 운동을 다룰 수 있는 강력하고 단순한 기준 모델의 부족을 해결하기 위해.
  • 기존 추적기들이 제약을 받는 시간적 일관성 가정에 의존하지 않도록 하기 위해.
  • 온라인 적응 또는 후처리 없이 단일 쿼리 프레임만을 사용하여 전체 이미지의 다중 해상도 검색을 수행하는 추적기를 개발하기 위해.
  • 새로운 크로스-쿼리 손실 메커니즘을 통해 간섭 요소에 대한 강건성을 향상시키기 위해.
  • 누적 오류를 제거하여 임시 추적 실패로 인한 성능 저하 없이 안정적인 장기 추적 성능을 확보하기 위해.

제안 방법

  • Faster R-CNN 기반의 이단계 객체 검출에 기반하여, 쿼리 유도형 모듈인 QG-RPN(쿼리 유도형 RPN)과 QG-RCNN(쿼리 유도형 RCNN)을 도입한다.
  • 백본 및 ROI 수준에서 쿼리-검색 상관관계를 특징 맵에 인코딩하여 검출 과정을 쿼리 기반 인스턴스로 유도한다.
  • 동일한 이미지에 대한 다수의 쿼리에서 손실을 평균화하는 크로스-쿼리 손실을 사용하여 인스턴스 수준의 간섭 요소에 대한 강건성을 향상시킨다.
  • 초기 프레임을 쿼리로 사용하여 각 프레임에서 전체 이미지를 독립적으로 검색하고, 상위 1개 예측을 선택함으로써 추론을 수행한다.
  • 추적기 훈련 시 추가 정규화나 궤적 정제 없이 표준 Faster R-CNN 분류 및 국소화 손실을 사용한다.
  • OxUvA 벤치마크에서 상위 1개 점수를 임계값(τ=0.84)으로 설정하여 존재/유실 예측 메커니즘을 도입한다.

실험 결과

연구 질문

  • RQ1순수하게 전역 인스턴스 검색에 기반한 추적기가 시간적 일관성 가정에 의존하는 기존 방법보다 장기 추적에서 뛰어난 성능을 낼 수 있는가?
  • RQ2온라인 학습 없이도 장시간 영상에서 빈번한 대상 유실과 급격한 운동을 다룰 수 있는 단순한 추적기는 어떤 성능을 보이는가?
  • RQ3크로스-쿼리 손실이 시각 추적에서 간섭 요소에 대한 강건성을 얼마나 향상시킬 수 있는가?
  • RQ4전체 이미지 검색을 통해 누적 오류를 제거함으로써 더 신뢰할 수 있는 장기 추적 성능이 달성되는가?
  • RQ5궤적 정제나 스케일 스무딩 없이 최소한의 엔드 투 엔드 프레임워크가 여러 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • LaSOT에서 GlobalTrack는 AUC 52.1%를 기록했으며, ATOM(64.8% 정밀도)과 SiamRPN++(69.4% 정밀도)를 초월한다. ATOM 대비 2.2%p, SiamRPN++ 대비 3.6%p의 절대 정밀도 향상을 달성한다.
  • 매우 긴 TLP 벤치마크(평균 13,529 프레임)에서 GlobalTrack는 63.8%의 성공률을 기록했으며, 이는 다음으로 우수한 성능을 보인 SPLT 대비 약 11.1%p의 절대 성과 향상이다.
  • OxUvA에서 GlobalTrack는 테스트 세트에서 60.3%의 MaxGM, 개발 세트에서 63.9%의 MaxGM을 기록했으며, SiamFC+R 대비 각각 14.9%p, 24.2%p의 성능 향상을 보였다.
  • TrackingNet에서 GlobalTrack는 75.4%의 정규화된 정밀도와 70.4%의 성공률을 기록했으며, SiamRPN++(73.3% 성공)과 ATOM(70.3% 성공) 등 최고 성능의 방법들과 유사한 성능을 보였다.
  • 약 400프레임의 대상 유실이 발생한 장기 실패 케이스에서, GlobalTrack는 대상이 재등장하는 즉시 정확하게 재검색하여 높은 IoU를 유지했고, 모든 기준 모델은 실패했다.
  • 상위 1개 점수 임계값(τ=0.84)을 사용한 유사도 예측 모듈은 OxUvA에서 정확한 대상 존재/유무 감지 기능을 제공하며, 높은 MaxGM 점수 기여에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.