Skip to main content
QUICK REVIEW

[논문 리뷰] 1st Place Solution to ECCV-TAO-2020: Detect and Represent Any Object for Tracking

Fei Du, Bo Xu|arXiv (Cornell University)|2021. 01. 20.
Video Surveillance and Tracking Methods참고 문헌 13인용 수 12
한 줄 요약

이 논문은 ECCV-TAO-2020 트래킹 챌린지에서 1등을 차지한 솔루션을 제시하며, 1200개 이상의 카테고리에 걸쳐 어떤 객체든 추적할 수 있도록 카테고리에 관계없는 외관 특징을 사용하는 검출 및 표현 프레임워크를 제안한다. 최신 검출 모델(DetectoRS에 SENet-154 및 BAGS를 사용)을 활용하고, SOT 트랙잭션 20만 개를 기반으로 ReID 모델을 훈련시킴으로써, 1 FPS 추론 및 앙상블 및 후처리를 통해 TAO 검증 세트에서 57.72 mAP를 달성하였으며, 이는 장기간의, 개방형 어휘 추적에서 표준 MOT 기반 모델들을 크게 능가한다.

ABSTRACT

We extend the classical tracking-by-detection paradigm to this tracking-any-object task. Solid detection results are first extracted from TAO dataset. Some state-of-the-art techniques like extbf{BA}lanced- extbf{G}roup extbf{S}oftmax ( extbf{BAGS}\cite{li2020overcoming}) and DetectoRS\cite{qiao2020detectors} are integrated during detection. Then we learned appearance features to represent any object by training feature learning networks. We ensemble several models for improving detection and feature representation. Simple linking strategies with most similar appearance features and tracklet-level post association module are finally applied to generate final tracking results. Our method is submitted as extbf{AOA} on the challenge website. Code is available at https://github.com/feiaxyt/Winner_ECCV20_TAO.

연구 동기 및 목표

  • TAO 데이터셋에서 1200개 이상의 장기간 카테고리에 걸쳐 어떤 객체든 추적하는 문제를 해결하기 위해, 기존 MOT 프레임워크의 범위를 초월한다.
  • LVIS v1.0에서의 프리트레인 및 TAO에 대한 레이블 매핑을 통한 미세조정을 통해 희귀하고 장기간 카테고리에서의 검출 재현율을 향상시킨다.
  • 조명, 시점, 변형 변화 등 다양한 외관 변화를 감안한 다재다능한 객체 외관을 매칭할 수 있는 강력한 카테고리에 관계없는 외관 특징 표현을 개발한다.
  • 저프레임레이트, 고변동성 환경에서 실시간 추적의 한계를 극복하기 위해 1 FPS 추론 및 외관 전용 연결 기법을 사용한다.
  • 모델 앙상블 및 트랙렛 수준의 후처리 연계(POST-ASSOCIATION, PA) 모듈을 통해 트랙잭션을 통합하고 정밀도를 향상시킨다.

제안 방법

  • MMDetection를 사용하여 두 개의 검출 모델을 훈련: 하나는 DetectoRS와 SENet-154 백본을 사용하며, LVIS v1.0에서 BAGS 손실을 적용해 미세조정한 모델이며, 다른 하나는 오픈소스 BAGS를 사용한 모델.
  • synset 필드를 통한 v1.0에서 v0.5로의 LVIS 레이블 매핑을 적용하여 검출 레이블을 TAO의 애너테이션 체계와 일치시킨다.
  • SOT 데이터셋(YouTube-BB, GOT-10k, ImageNet VID)에서 유래한 20만 개의 트랙잭션을 기반으로 두 개의 ReID 모델을 훈련하여 카테고리에 관계없는 외관 특징을 학습한다.
  • 추적 중에 두 ReID 모델의 특징을 연결하여 분류 능력과 매칭 정확도를 향상시킨다.
  • 오차 누적을 줄이기 위해 1 FPS 추론 파이프라인을 사용하며, 기하학적 종속 방법(SORT 또는 최소비용 흐름) 대신 특징 기반 연결을 적용한다.
  • 트랙렛 수준의 후처리 연계(PA) 모듈을 적용하여 평균 외관 특징을 사용해 겹치지 않는 트랙렛을 재연결함으로써, 낮은 계산 비용으로도 mAP 향상을 달성한다.

실험 결과

연구 질문

  • RQ1카테고리에 관계없는 외관 특징을 사용하는 검출 및 표현 파이프라인은 개방형 어휘, 장기간 카테고리가 포함된 TAO 데이터셋에서 표준 MOT 기반 모델을 능가할 수 있는가?
  • RQ2검출 및 ReID 모델의 앙상블는 어떤 객체를 추적하는 데 있어 재현율과 mAP 향상에 얼마나 효과적인가?
  • RQ3저프레임레이트, 복잡한 영상 시퀀스에서 1 FPS 추론과 외관 전용 연결 기법은 고프레임레이트, 기하학적 종속 추적보다 더 나은 성능을 낼 수 있는가?
  • RQ4SOT 데이터에서 훈련된 ReID 모델은 TAO의 다양한 객체 카테고리에 얼마나 일반화되는가?
  • RQ5오라클 트랙을 사용할 경우 성능의 상한선은 무엇이며, 실용적인 시스템은 그에 얼마나 가까이 도달할 수 있는가?

주요 결과

  • LVIS v1.0에서 BAGS 손실을 적용해 미세조정한 검출 모델은 LVIS v0.5 검증 세트에서 39.70 mAP를 기록하여 기준 모델을 크게 능가했다.
  • Model-1-482(482개 TAO 카테고리로 필터링)를 사용해 1 FPS에서 ReID 특징을 적용함으로써, mAP를 SORT(30 FPS)의 14.80에서 25.53으로 향상시켰다.
  • Model-1과 Model-2의 검출 결과를 앙성하고, ReID1+ReID2 특징을 사용해 1 FPS에서 추론한 결과, TAO 검증 세트에서 mAP가 28.59로 상승했다.
  • PA 후처리 모듈을 적용함으로써 mAP는 29.27로 추가로 향상되었으며, 이는 트랙렛 연결을 개선하는 데 효과적임을 보여준다.
  • 오라클 트랙을 사용할 경우, Model-1과 Model-2의 검출 결과를 조합하여 57.72 mAP를 달성하였으며, 이는 이 방법의 강력한 상한선임을 시사한다.
  • 시아모이드 유사 외관 특징 모델은 ReID 기반 특징보다 성능이 열 劣하므로, ReID가 개방형 어휘 추적에 더 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.