[논문 리뷰] IA-MOT: Instance-Aware Multi-Object Tracking with Motion Consistency
이 논문은 인스턴스 인식 특징과 운동 일관성을 융합하여 정확도를 향상시키는 새로운 인스턴스 인식 다중객체추적 프레임워크인 IA-MOT을 제안한다. 마스크 R-CNN의 변형체에 임bedding 헤드와 공간 주의 메커니즘을 적용하여 전경 인식 특징을 추출하고, 단기 검색 및 ReID를 통합한 허그리안 할당을 통해 가림을 처리함으로써, IA-MOT는 BMTT 챌린지 2020의 트랙 3에서 MOTS20 및 KITTI-MOTS 데이터셋을 통합하여 69.8 sMOTSA 점수를 기록하며 1등을 차지하였다.
Multiple object tracking (MOT) is a crucial task in computer vision society. However, most tracking-by-detection MOT methods, with available detected bounding boxes, cannot effectively handle static, slow-moving and fast-moving camera scenarios simultaneously due to ego-motion and frequent occlusion. In this work, we propose a novel tracking framework, called "instance-aware MOT" (IA-MOT), that can track multiple objects in either static or moving cameras by jointly considering the instance-level features and object motions. First, robust appearance features are extracted from a variant of Mask R-CNN detector with an additional embedding head, by sending the given detections as the region proposals. Meanwhile, the spatial attention, which focuses on the foreground within the bounding boxes, is generated from the given instance masks and applied to the extracted embedding features. In the tracking stage, object instance masks are aligned by feature similarity and motion consistency using the Hungarian association algorithm. Moreover, object re-identification (ReID) is incorporated to recover ID switches caused by long-term occlusion or missing detection. Overall, when evaluated on the MOTS20 and KITTI-MOTS dataset, our proposed method won the first place in Track 3 of the BMTT Challenge in CVPR2020 workshops.
연구 동기 및 목표
- 정기적인 가림과 함께 정적 및 이동 중인 카메라 환경에서의 추적 기반 검출 방법의 한계를 해결하기 위해.
- 배경 노이즈를 줄이기 위해 인스턴스 세그멘테이션 마스크를 특징 추출에 통합하여 추적의 강건성을 향상시키기 위해.
- 트랙 연관에서 객체 크기, 방향, 속도를 함께 고려하여 운동 일관성 모델링을 향상시키기 위해.
- 단기 검색 및 ReID 모듈을 통해 ID 스위치를 줄이고 놓친 검출을 복구하기 위해.
- 정적 및 동적 카메라 환경을 포함한 다양한 MOTS 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 다중 작업 손실 함수를 사용하여 검출, 세그멘테이션, 특징 임베딩을 동시에 최적화할 수 있도록, 추가적인 임베딩 헤드를 갖춘 수정된 마스크 R-CNN을 엔드 투 엔드로 훈련한다.
- 예측된 인스턴스 마스크에서 유도된 공간 주의 맵을 생성하고, 이를 임베딩 특징의 전경 영역에 가중치를 적용하여 인스턴스 인식 능력을 향상시킨다.
- 온라인 추적은 마스크 IoU, 임베딩 특징의 코사인 유사도, 운동 일관성을 조합한 기반으로 허그리안 알고리즘을 사용하여 검출을 연관시킨다.
- 단기 윈도우 내에서 객체 궤적을 기반으로 계산된 운동 벡터를 통해 운동 일관성을 모델링하고, 코사인 유사도를 사용해 트랙을 매칭한다.
- 단기 검색(STR) 모듈은 시간 윈도우 내에서 고립된 검출을 재연결하여 놓친 검출을 복구한다.
- 장기적인 가림 상황에서 ID 스위치를 해결하기 위해 객체 재식별(ReID)을 적용하여 장기간 간격 동안 특징을 매칭한다.
실험 결과
연구 질문
- RQ1세그멘테이션 마스크에서 유도된 인스턴스 인식 특징이 빈번한 가림과 카메라 운동이 있는 복잡한 상황에서 추적의 강건성을 향상시키는가?
- RQ2속도, 방향, 크기를 포함한 운동 일관성을 효과적으로 모델링하여 추적 기반 프레임워크에서 트랙 연관을 향상시킬 수 있는가?
- RQ3단기 검색 및 ReID 모듈이 장기적인 가림 상황에서 ID 스위치를 줄이고 놓친 검출을 복구하는 데 얼마나 효과적인가?
- RQ4통합된 프레임워크가 다양한 카메라 동작과 객체 유형을 가진 MOTS20 및 KITTI-MOTS와 같은 다양한 데이터셋에서 강력한 성능을 달성할 수 있는가?
- RQ5스페이셜 주의와 인스턴스 수준 특징 통합이 MOTS에서 표준 바운딩 박스 기반 특징 추출 방식보다 어떻게 비교되는가?
주요 결과
- IA-MOT는 통합된 MOTS20 및 KITTI-MOTS 데이터셋에서 69.8 sMOTSA 점수를 기록하여 BMTT 챌린지 2020 트랙 3에서 1등을 차지하였다.
- MOTS20 데이터셋에서 IA-MOT는 공개 검출기만을 사용하여 69.4 sMOTSA 점수를 기록했으며, 사전 검출기를 사용한 최고 성능 방법과 거의 유사한 성능을 달성하였다.
- KITTI-MOTS에서 IA-MOT는 차량 추적 과제에서 3위, 보행자 추적 과제에서 5위를 기록하여 다양한 객체 유형 간의 강력한 일반화 능력을 입증하였다.
- 스페이셜 주의 통합으로 전경 콘텐츠에 초점을 맞추고 임베딩 특징의 배경 노이즈를 줄여 특징 품질을 향상시켰다.
- 운동 일관성 모듈은 특히 고밀도 객체 및 빈번한 가림 상황에서 트랙 연관 정확도를 크게 향상시켰다.
- 단기 검색과 ReID의 조합은 특히 장기적인 가림 상황에서 ID 스위치를 효과적으로 줄이고 놓친 검출을 복구하는 데 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.