Skip to main content
QUICK REVIEW

[논문 리뷰] A unified neural network for object detection, multiple object tracking and vehicle re-identification

Yuhao Xu, Jiakui Wang|arXiv (Cornell University)|2019. 07. 08.
Video Surveillance and Tracking Methods참고 문헌 19인용 수 6
한 줄 요약

이 논문은 Faster R-CNN에 전용 트랙 브랜치를 추가하여 객체 검출, 다중 객체 추적, 차량 재식별을 동시에 수행하는 통합형 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 시간적으로 연결된 영상 프레임에서 RoI 특징을 활용하고 쌍체 손실을 사용해 훈련함으로써 AIC19 데이터셋에서 57.79%의 mAP를 달성하며 높은 추적 정확도를 보이며 계산 오버헤드를 줄이고 다중 작업 최적화를 가능하게 한다.

ABSTRACT

Deep SORT\cite{wojke2017simple} is a tracking-by-detetion approach to multiple object tracking with a detector and a RE-ID model. Both separately training and inference with the two model is time-comsuming. In this paper, we unify the detector and RE-ID model into an end-to-end network, by adding an additional track branch for tracking in Faster RCNN architecture. With a unified network, we are able to train the whole model end-to-end with multi loss, which has shown much benefit in other recent works. The RE-ID model in Deep SORT needs to use deep CNNs to extract feature map from detected object images, However, track branch in our proposed network straight make use of the RoI feature vector in Faster RCNN baseline, which reduced the amount of calculation. Since the single image lacks the same object which is necessary when we use the triplet loss to optimizer the track branch, we concatenate the neighbouring frames in a video to construct our training dataset. We have trained and evaluated our model on AIC19 vehicle tracking dataset, experiment shows that our model with resnet101 backbone can achieve 57.79 \% mAP and track vehicle well.

연구 동기 및 목표

  • 다중 객체 추적에서 검출기와 재식별 모델을 별도로 훈련할 경우 발생하는 비효율성과 최적 성능 달성의 어려움을 해결하기 위해.
  • 객체 검출, 추적, 재식별을 하나의 엔드 투 엔드 학습 가능한 네트워크로 통합하기 위해.
  • 검출기와 추적 브랜치 간 특징 공유를 통해 계산 비용을 줄이고 특징 학습을 향상시키기 위해.
  • 단일 이미지에서는 쌍체 샘플이 부족한 문제를 보완하기 위해 인접한 영상 프레임을 이용해 훈련 데이터를 구성하기 위해.
  • mAP, MOTA, 쌍 정확도 등의 지표를 사용해 AIC19 차량 추적 벤치마크에서 모델 성능을 평가하기 위해.

제안 방법

  • 검출기에서 추출한 RoI 특징 벡터를 입력으로 사용하는 추가적인 형제 트랙 브랜치를 Faster R-CNN에 추가하여 중복된 특징 추출을 방지한다.
  • 검출 및 추적 목표를 결합한 다중 작업 손실을 사용해 전체 네트워크를 엔드 투 엔드로 훈련한다.
  • 영상 시퀀스에서 인접한 프레임을 연결하여 훈련용 쌍체를 구성함으로써 쌍체 손실에 대한 양성 및 음성 샘플을 제공한다.
  • 트랙 브랜치에 쌍체 손실을 적용하여 재식별을 위한 분류 가능한 외관 임베딩을 학습한다.
  • 추론 중에는 IoU 기반 매칭과 투영 알고리즘을 사용하여 데이터 연동을 수행하며, 거리 임계값은 시나리오에 따라 조정된다.
  • 다중 카메라 평가 프로토콜을 사용하여 쌍 정확도를 활용해 서로 다른 카메라 시야 간 재식별 성능을 평가한다.

실험 결과

연구 질문

  • RQ1공유된 특징을 사용하는 통합형 엔드 투 엔드 네트워크로 객체 검출, 추적, 재식별을 동시에 최적화할 수 있는가?
  • RQ2단일 이미지에서는 충분한 양성/음성 쌍이 부족한데, 시간적으로 연결된 영상 프레임에서 쌍체 손실을 사용해 훈련하면 재식별 성능가 향상되는가?
  • RQ3검출기와 재-ID 모델을 별도로 훈련하는 것과 비교해, 엔드 투 엔드 다중 작업 학습이 mAP와 추적 정확도에 어떤 영향을 미치는가?
  • RQ4AIC19 데이터셋에서 달리된 차량만 레이블이 되어 있는 부분 레이블링 상황에서 모델은 어떻게 성능을 내는가?
  • RQ5단일 카메라와 다중 카메라 재식별 성능 간의 상호 교환 관계는 무엇이며, 임계값 설정이 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 통합 네트워크는 AIC19 차량 추적 데이터셋에서 57.79%의 mAP를 달성하여 부분 레이블링에도 불구하고 뛰어난 검출 성능을 보였다.
  • 단일 카메라 환경에서는 거리 임계값 0.343로 MOTA 8.10%와 쌍 정확도 99.84%를 달성했다.
  • 다중 카메라 환경에서는 거리 임계값 8.72로 78.54%의 쌍 정확도를 기록하여 카메라 간 시야 간의 강건성을 입증했다.
  • 제거 실험 결과, '끌어당김' 손실 성분을 제거하면 MOTA는 -1.80%로 감소하지만 쌍 정확도는 99.99%로 상승하여 최적화 과정에서의 상충 관계를 확인했다.
  • 검출기 가중치를 고정하면 MOTA는 10.94%로 상승하고 쌍 정확도는 99.43%로 유지되며, 검출기의 미세조정이 추적 강건성 향상에 기여함을 시사했다.
  • 오류 분석 결과, 부분 레이블링과 운동 모델링 부족이 다중 카메라 환경에서 특히 두드러지게 false positive 및 추적 오류를 유발하는 주요 원인임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.