Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Track Any Object

Achal Dave, Pavel Tokmakov|arXiv (Cornell University)|2019. 10. 25.
Video Surveillance and Tracking Methods참고 문헌 49인용 수 4
한 줄 요약

이 논문은 학습 가능한 객체 존재도 사전을 사용하여 카테고리에 종속되지 않은 객체 전용 추적기로 카테고리별 객체 검출기를 재사용하는 통합 프레임워크를 제안한다. 이미지 및 영상 데이터에서 동시 학습하고, 유연한 실시간 선형 템플릿 적응을 적용함으로써, 첫 번째 프레임에서 박스 수준의 지도만을 사용함에도 불구하고 높은 품질의 인스턴스 마스크를 제공하며, 최신의 추적 및 영상 객체 분할 성능을 달성한다.

ABSTRACT

Object tracking can be formulated as "finding the right object in a video". We observe that recent approaches for class-agnostic tracking tend to focus on the "finding" part, but largely overlook the "object" part of the task, essentially doing a template matching over a frame in a sliding-window. In contrast, class-specific trackers heavily rely on object priors in the form of category-specific object detectors. In this work, we re-purpose category-specific appearance models into a generic objectness prior. Our approach converts a category-specific object detector into a category-agnostic, object-specific detector (i.e. a tracker) efficiently, on the fly. Moreover, at test time the same network can be applied to detection and tracking, resulting in a unified approach for the two tasks. We achieve state-of-the-art results on two recent large-scale tracking benchmarks (OxUvA and GOT, using external data). By simply adding a mask prediction branch, our approach is able to produce instance segmentation masks for the tracked object. Despite only using box-level information on the first frame, our method outputs high-quality masks, as evaluated on the DAVIS '17 video object segmentation benchmark.

연구 동기 및 목표

  • 카테고리별 검출기에서 유도된 일반적인 객체 존재도 사전을 통합하여 일반적이고 사용자 초기화가 가능한 객체 추적 문제를 해결한다.
  • 유연하고 종단 간(end-to-end) 방식으로 분류 가능한 객체 템플릿을 학습하여, 혼동 요소 및 외관 변화에 대한 강건성을 향상시킨다.
  • 최소한의 지도 정보로도 단일 아키텍처에서 객체 검출, 단일 객체 추적, 영상 객체 분할을 통합한다.
  • 테스트 시퀀스에 대한 미세조정 없이도 대규모 추적 및 영상 분할 벤치마크에서 최고 성능을 달성한다.

제안 방법

  • 이미지(COCO)와 영상(OxUvA, GOT10k) 데이터셋에서 동시 학습함으로써, 카테고리별 마스크 R-CNN 검출기를 카테고리에 종속되지 않은 추적기로 재사용한다.
  • 첫 번째 프레임의 특징을 사용하여 객체와 배경, 혼동 요소를 분리하는 유연한 닫힌형 선형 분류기(T_d)를 도입한다.
  • 템플릿 임베딩을 사용해 유사도 맵을 계산하고, 이후 프레임의 특징을 재가중함으로써 정확한 객체 국소화를 가능하게 한다.
  • 첫 번째 프레임에서 박스 수준의 지도만을 사용하여도 인스턴스 및 영상 객체 분할을 가능하게 하기 위해 마스크 예측 헤드를 모델에 추가한다.
  • 장기적인 시퀀스에서 추적 일관성을 유지하기 위해 테스트 시에 단순한 시간적 히우리스틱을 적용한다.
  • 검출, 추적, 분할에 동일한 네트워크를 학습 및 배포하여 통합된 파ip라인을 구현한다.

실험 결과

연구 질문

  • RQ1카테고리에 종속되지 않은 사전 지식 없이도 카테고리별 검출기를 효과적으로 일반적이고 객체 중심의 추적기로 재사용할 수 있는가?
  • RQ2유연하고 실시간으로 적용 가능한 템플릿 적응 전략은 추적에서 혼동 요소 및 외관 변화에 대한 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3검출을 위해 훈련된 통합 모델이 추적 및 영상 객체 분할에서 최고 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4첫 번째 프레임에서 박스 수준의 지도만을 사용하여도 통합 아키텍처를 통해 고품질의 인스턴스 분할 마스크를 생성할 수 있는가?

주요 결과

  • OxUvA 벤치마크에서 장기 추적 성능이 최고 수준이며, 외부 데이터 없이도 이전 방법들을 능가한다.
  • GOT10k 벤치마크에서 외부 데이터를 사용하는 최신 기법들보다도 뛰어난 성능을 기록하며, 추적 정확도에서 뚜렷한 격차를 확보한다.
  • LTB35 데이터셋(VOT 2018 장기 도전 과제)에서 단일 모델과 하이퍼파라미터로 모든 실험에 적용했을 때 F-측정치가 61.2를 기록하며, 데이터셋에 특화된 튜닝이 필요한 이전 방법들을 능가한다.
  • DAVIS’17 영상 분할 벤치마크에서 평균 F-측정치 67.8과 평균 재결합 지수 59.2를 기록하여, 픽셀 수준의 마스크 지도나 종단 간 미세조정이 필요한 전용 방법들과 경쟁 가능한 성능을 보였다.
  • 첫 번째 프레임에서 박스 수준의 애너테이션만을 사용했음에도 불구하고 고품질의 분할 마스크를 생성했으며, F-측정치 감소율이 12.0이어서 외관 변화에 강건함을 시사한다.
  • 검출기로 사용했을 때 COCO 인스턴스 분할 mAP가 30.5를 기록하여, 추적 최적화를 위해 설계되었음에도 불구하고 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.