[논문 리뷰] Trajectory Factory: Tracklet Cleaving and Re-connection by Deep Siamese Bi-GRU for Multiple Object Tracking
이 논문은 장기적인 음영 또는 혼잡한 장면에서 잘못 추적된 궤적을 분리하고 재결합하기 위해 시アン드롬 양방향 GRU를 사용하는 트랙릿 기반 다중 객체 추적 방법을 제안한다. CNN로 추출한 외관 특징과 RNN 기반 운동 모델링을 활용함으로써, 정적 카메라 시퀀스에서 MOT16에서 MOTA를 48.2%로 향상시켜 이전 방법들을 능가한다.
Multi-Object Tracking (MOT) is a challenging task in the complex scene such as surveillance and autonomous driving. In this paper, we propose a novel tracklet processing method to cleave and re-connect tracklets on crowd or long-term occlusion by Siamese Bi-Gated Recurrent Unit (GRU). The tracklet generation utilizes object features extracted by CNN and RNN to create the high-confidence tracklet candidates in sparse scenario. Due to mis-tracking in the generation process, the tracklets from different objects are split into several sub-tracklets by a bidirectional GRU. After that, a Siamese GRU based tracklet re-connection method is applied to link the sub-tracklets which belong to the same object to form a whole trajectory. In addition, we extract the tracklet images from existing MOT datasets and propose a novel dataset to train our networks. The proposed dataset contains more than 95160 pedestrian images. It has 793 different persons in it. On average, there are 120 images for each person with positions and sizes. Experimental results demonstrate the advantages of our model over the state-of-the-art methods on MOT16.
연구 동기 및 목표
- 장기적인 음영이나 혼잡한 장면에서 추적 오차와 잘못된 연결으로 성능 저하가 발생하는 다중 객체 추적(MOT)의 과제를 해결한다.
- 감지 오류나 음영으로 인해 발생하는 잘못 추적된 트랙릿을 탐지하고 수정함으로써 궤적의 일관성을 향상시킨다.
- 외관과 운동 특징을 기반으로 동일 객체의 부분 트랙릿을 매칭하기 위해 깊이 있는 시앙드롬 양방향 GRU를 사용하여 강력한 트랙릿 재결합 메커니즘을 개발한다.
- 제안된 모델을 훈련하고 평가하기 위해 793명의 신원을 포함하는 총 95,160장의 보행자 이미지로 구성된 새로운 데이터셋을 구축한다.
- 특히 정적 카메라 시나리오에서 MOT16 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 비최대 억제(NMS)를 사용하여 고신뢰도 트랙릿 후보를 생성하고, 외관(CNN)과 운동(LSTM) 특징을 융합한다.
- 양방향 GRU를 적용하여 트랙릿 내의 분리 지점을 탐지하고, 음영으로 인한 잘못 추적 시 단일 트랙릿을 여러 부분 트랙릿으로 분리한다.
- 부분 트랙릿의 특징을 비교하고 유사도 점수를 계산하기 위해 깊이 있는 시앙드롬 양방향 GRU 네트워크를 사용하여 재결합 결정을 내린다.
- 넓은 잔차 네트워크(WRN)에서 추출한 128차원 CNN 특징을 기반으로 대비 및 검증 손실을 사용하여 시앙드롬 GRU를 훈련한다.
- 시간적 및 공간적 제약 조건을 적용하여 매칭된 부분 트랙릿을 재결합하고, 다항 곡선 피팅을 통해 궤적을 매끄럽게 정렬한다.
- MOT16, PathTrack, MARS에서 추출 및 융합한 데이터를 기반으로 총 95,160장의 보행자 이미지와 793명의 신원을 포함하는 새로운 훈련 데이터셋을 추출하고 생성한다.
실험 결과
연구 질문
- RQ1트랙릿 분리 기법은 장기적인 음영이나 혼잡한 장면에서 추적의 신뢰성을 어떻게 향상시킬 수 있는가?
- RQ2시앙드롬 양방향 GRU 아키텍처는 외관과 운동 특징을 기반으로 동일 객체의 부분 트랙릿을 효과적으로 재결합할 수 있는가?
- RQ3기존의 MOT 접근 방식에 비해 제안된 방법은 정체성 전환과 분할 현상을 어느 정도 감소시키는가?
- RQ4제안된 방법의 성능는 MOT16에서 정적 카메라 시퀀스와 이동 카메라 시퀀스 간에 어떻게 다를까?
- RQ5새로가서 구축한 트랙릿 이미지 데이터셋은 트랙릿 재결합 모델의 일반화 능력과 성능 향상에 기여하는가?
주요 결과
- 제안된 방법은 MOT16 벤치마크에서 MOTA 48.2%를 달성하여 정적 카메라 시퀀스에서 이전 최신 기술 수준의 방법들을 능가한다.
- MOT16-01 시퀀스에서 MOTA 42.5%를 기록하여 비교된 모든 방법들 중 1위를 차지한다.
- 모델은 IDF1을 향상시키고, 특히 장기적인 음영이 발생하는 시퀀스에서 정체성 전환과 분할 현상을 줄였다.
- 95,160장의 보행자 이미지와 793명의 신원을 포함하는 새로 구축한 데이터셋에서 시앙드롬 양방향 GRU 모델은 강력한 일반화 능력을 보였다.
- 정적 카메라 시퀀스에서 가장 우수한 성능을 보였으며(예: MOT16-03에서 MOTA 56.7%), 이동 카메라 시퀀스에서는 시간-공간 제약 조건이 적합하지 않아 성능이 저하되었다.
- 그림 5의 정성적 결과는 방법이 분리된 궤적을 성공적으로 재결합하고 혼잡한 장면에서 잡음 신호를 줄이는 데 효과적임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.