[논문 리뷰] Online Multi-Object Tracking with Unsupervised Re-Identification Learning and Occlusion Estimation
이 논문은 추적 오차와 음영에 의한 객체 손실 문제를 해결하기 위해 비지도 재식별 학습과 음영 추정을 통합한 온라인 다중 객체 추적 프레임워크를 제안한다. 인접 프레임 간의 비지도 매칭 손실을 활용하고, 손실된 객체를 복구하기 위해 음영 맵을 예측함으로써, 정체성 레이블 없이도 최신 기술 수준의 성능을 달성하며, 사생활 검출을 사용한 MOT20에서 지도 기반 베이스라인을 능가한다.
Occlusion between different objects is a typical challenge in Multi-Object Tracking (MOT), which often leads to inferior tracking results due to the missing detected objects. The common practice in multi-object tracking is re-identifying the missed objects after their reappearance. Though tracking performance can be boosted by the re-identification, the annotation of identity is required to train the model. In addition, such practice of re-identification still can not track those highly occluded objects when they are missed by the detector. In this paper, we focus on online multi-object tracking and design two novel modules, the unsupervised re-identification learning module and the occlusion estimation module, to handle these problems. Specifically, the proposed unsupervised re-identification learning module does not require any (pseudo) identity information nor suffer from the scalability issue. The proposed occlusion estimation module tries to predict the locations where occlusions happen, which are used to estimate the positions of missed objects by the detector. Our study shows that, when applied to state-of-the-art MOT methods, the proposed unsupervised re-identification learning is comparable to supervised re-identification learning, and the tracking performance is further improved by the proposed occlusion estimation module.
연구 동기 및 목표
- 감지기에서 식별되지 않는 다수의 음영을 겪는 객체를 추적하는 데 어려움을 해결하기 위해, 온라인 다중 객체 추적에서 음영에 의한 객체 손실 문제를 해결한다.
- 인접 프레임 간의 외관 일관성 기반 비지도 학습 방식을 도입하여, 재식별에 필요한 고비용 정체성 레이블의 필요성을 제거한다.
- 음영 추정 모듈을 활용해 음영 위치를 예측함으로써, 음영으로 인해 손실된 객체를 사전에 복구한다.
- 지식 기반 Re-ID나 복잡한 데이터 파ip라인에 의존하지 않고도 실시간 온라인 추적 시스템의 추적 강건성과 정확도를 향상시킨다.
제안 방법
- 인접 프레임 간의 매칭 기반 손실을 사용하는 비지도 재식별 학습 모듈을 도입하여, 정체성 레이블이나 분류 헤드의 필요성을 제거한다.
- 손실 함수는 연속 프레임에서 동일 정체성의 특징 임bedding을 유사하게 만들고, 다른 정체성 또는 다른 시점의 특징은 서로 멀어지게 유도한다.
- 대조 학습을 활용한 시아모이 네트워크 아키텍처를 사용하여 정체성 감독 없이도 분류 가능한 특징을 학습한다.
- 현재 프레임 내 객체 간 잠재적 음영 위치를 나타내는 음영 맵을 예측하는 음영 추정 모듈을 제안한다.
- 예측된 음영 맵을 활용해, 재등장 시 객체의 가능성이 있는 위치를 추정함으로써 손실된 객체의 재식별을 유도한다.
- 두 모듈을 기존 온라인 MOT 프레임워크(예: FairMOT 및 CenterTrack)에 플러그 앤 플레이 방식으로 통합하여 엔드 투 엔드 훈련을 가능하게 한다.
실험 결과
연구 질문
- RQ1비지도 재식별 학습이 정체성 레이블이 없이도 지도 기반 Re-ID와 유사한 성능을 달성할 수 있는가?
- RQ2음영 위치를 예측하는 것이 감지기에서 빠진 고도로 음영화된 객체의 복구에 기여하는가?
- RQ3실시간 추론 제약 조건이 있는 온라인 추적 환경에서 제안된 프레임워크의 성능은 어떠한가?
- RQ4비지도 Re-ID와 음영 추정의 조합이 MOTA 및 IDF1과 같은 추적 메트릭스를 향상시키는가?
주요 결과
- 제안된 비지도 Re-ID 학습은 FairMOT에서 지도 기반 Re-ID와 유사한 성능을 달성하며, 사생활 검출을 사용한 MOT20에서 IDF1은 2.1% 낮지만 MOTA는 더 높다.
- 두 모듈을 모두 탑재한 CenterTrack 기반 추적기인 OTrack_ct는 공개 검출을 사용한 MOT17에서 베이스라인 CenterTrack 대비 MOTA를 2.4% 향상시키고, 사생활 검출을 사용한 경우 1.2% 향상시켰다.
- 음영 추정 모듈은 음영으로 인해 식별되지 않는 객체를 복구함으로써 거대한 오소거수(FN) 감소를 이끌어내어 성능 향상을 이룬다.
- 객체 재발견으로 인한 더 높은 오진수(FP)에도 불구하고, FN의 급격한 감소와 더 나은 재현율 덕분에 전체 추적 성능이 향상된다.
- 사생활 검출을 사용한 MOT20에서 OUTrack_fm는 더 적은 사전 훈련 데이터와 Re-ID에서 정체성 감독 없이도 FairMOT를 능가하는 성능을 보였다.
- CrowdHuman에서의 사전 훈련과 비지도 Re-ID 모듈의 특성 덕분에, 특히 군중 시나리오에서 우수한 일반화 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.