Skip to main content
QUICK REVIEW

[논문 리뷰] Tracking by Animation: Unsupervised Learning of Multi-Object Attentive Trackers

Zhen He, Jian Li|arXiv (Cornell University)|2018. 09. 10.
Video Surveillance and Tracking Methods참고 문헌 70인용 수 5
한 줄 요약

이 논문은 레이블이 없는 경계 상자 없이 복원 오차에서 학습하는 비지도, 엔드 투 엔드 프레임워크인 애니메이션을 통한 추적(TBA)을 제안한다. 데이터 연관성의 강건성을 향상시키기 위해 Reprioritized Attentive Tracking(RAT)을 도입하여, DukeMTMC와 같은 합성 및 실세계 데이터셋에서 경쟁적인 성능을 달성한다.

ABSTRACT

Online Multi-Object Tracking (MOT) from videos is a challenging computer vision task which has been extensively studied for decades. Most of the existing MOT algorithms are based on the Tracking-by-Detection (TBD) paradigm combined with popular machine learning approaches which largely reduce the human effort to tune algorithm parameters. However, the commonly used supervised learning approaches require the labeled data (e.g., bounding boxes), which is expensive for videos. Also, the TBD framework is usually suboptimal since it is not end-to-end, i.e., it considers the task as detection and tracking, but not jointly. To achieve both label-free and end-to-end learning of MOT, we propose a Tracking-by-Animation framework, where a differentiable neural model first tracks objects from input frames and then animates these objects into reconstructed frames. Learning is then driven by the reconstruction error through backpropagation. We further propose a Reprioritized Attentive Tracking to improve the robustness of data association. Experiments conducted on both synthetic and real video datasets show the potential of the proposed model. Our project page is publicly available at: https://github.com/zhen-he/tracking-by-animation

연구 동기 및 목표

  • 비용이 많이 드는 경계 상자 레이블이 필요한 감독 기반, 비엔드 투 엔드가 아닌 추적-감지(TBD) 방법의 한계를 해결하기 위해.
  • 레이블이 없는 데이터가 필요 없이 온라인 다중 객체 추적을 위한 엔드 투 엔드 비지도 학습을 가능하게 하기 위해.
  • 가림, 외관 변화, 배경 노이즈 상황에서 학습 가능한 주의 메커니즘을 통해 데이터 연관성의 강건성을 향상시키기 위해.
  • 백프로파게이션을 통해 추적과 복원이 함께 최적화되는 미분 가능하고 생성적 프레임워크를 개발하기 위해.

제안 방법

  • TBA 프레임워크는 먼저 입력 프레임에서 객체를 추적한 다음 이를 재구성된 프레임으로 애니메이션화하는 미분 가능한 신경망 모델을 사용한다.
  • 특징 추출 네트워크는 θ^feat로 매개변수화된 신경망을 사용하여 입력 프레임을 저차원 특징으로 압축한다.
  • I개의 신경 추적기로 구성된 추적기 어레이가 상태 벡터 h_t,i를 유지하며, θ^upd로 매개변수화된 신경망 NN^upd를 통해 새로운 Reprioritized Attentive Tracking(RAT) 메커니즘을 사용해 이를 업데이트한다.
  • 각 추적기는 공유 출력 네트워크 NN^out을 통해 출력을 생성하며, 신뢰도 점수와 공간적 특징을 포함한 중위 특징을 생성한다.
  • 렌더러는 학습 가능한 파rameter가 없는 방식으로 추적기 출력에서 입력 프레임을 재구성하며, 전체 시스템을 통해 역전파되는 픽셀 단위의 복원 오차에 의해 학습이 유도된다.
  • RAT는 반복적인 메모리 읽기와 쓰기 기반의 소프트 주의 메커니즘을 도입하며, 추적기들이 신뢰도에 따라 메모리를 우선순위 정렬하고 업데이트함으로써 중복 추적을 방지하고 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1복원 오차만을 학습 신호로 사용함으로써 엔드 투 엔드이며, 어떤 감독도 없이 다중 객체 추적을 학습할 수 있는가?
  • RQ2특히 가림과 외관 변화 상황에서 진정한 정체성이 없는 상황에서 데이터 연관성이 어떻게 강건하게 유지될 수 있는가?
  • RQ3RAT와 같은 학습 가능한 주의 메커니즘이 신뢰도와 메모리 상태에 따라 추적기 업데이트를 다이나믹하게 재우선순위 정렬함으로써 추적 성능을 향상시킬 수 있는가?
  • RQ4제안된 TBA 프레임워크는 레이블이 없는 경계 상자 없이도 합성 및 실세계 영상 데이터셋에 일반화되는가?

주요 결과

  • TBA 모델은 DukeMTMC 데이터셋에서 IDF1 점수 82.4, IDP 86.1, MOTA 79.6을 기록하며, 비지도 학습임에도 불구하고 몇 가지 지표에서 감독 기반 베이스라인을 초월하는 경쟁적인 추적 성능를 달성한다.
  • 합성된 Sprites-MOT 및 MNIST-MOT 데이터셋에서, 모델은 가림과 외관 변화에 대한 강력한 일반화 능력과 강건성을 보여준다.
  • RAT의 시각화 결과, 주의 가중치가 추적된 객체와 관련된 메모리 내용을 효과적으로 지우며, 중복 추적을 방지하고 연관 정확도를 향상시킨다.
  • DukeMTMC에서 TBA 모델은 비지도 방법 중 최고 성능을 기록하였으며, 1,026개의 주로 추적된(MT) 객체와 46개의 주로 실종된(ML) 객체를 기록하여 장기 추적 안정성이 뛰어나다는 것을 보여준다.
  • 제거 분석 결과, RAT는 표준 주의 메커니즘 대비 추적 방해 요소와 과적합을 줄이며 데이터 연관성의 강건성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.