Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple Pedestrians and Vehicles Tracking in Aerial Imagery: A Comprehensive Study

Seyed Majid Azimi, Maximilian Kraus|arXiv (Cornell University)|2020. 10. 19.
Video Surveillance and Tracking Methods참고 문헌 4인용 수 5
한 줄 요약

이 논문은 공중 영상에서 보행자와 차량의 다중 객체 추적을 향상시키기 위해 외관(Siamese 네트워크), 시간적(LSTM), 공간-그래프적(GCN) 특징을 융합하는 딥러닝 기반의 다중 객체 추적 프레임워크인 AerialMPTNet을 제안한다. 보행자 데이터셋에서는 최신 기술 수준의 성능을 달성하고 차량 데이터셋에서는 경쟁적인 결과를 보이며, L1 손실이 Huber 손실보다 우수하고 LSTM/GCN 모듈이 안정성을 향상시키며, SE 블록과 OHEM은 맥락에 따라 유의미한 이점을 보인다.

ABSTRACT

In this paper, we address various challenges in multi-pedestrian and vehicle tracking in high-resolution aerial imagery by intensive evaluation of a number of traditional and Deep Learning based Single- and Multi-Object Tracking methods. We also describe our proposed Deep Learning based Multi-Object Tracking method AerialMPTNet that fuses appearance, temporal, and graphical information using a Siamese Neural Network, a Long Short-Term Memory, and a Graph Convolutional Neural Network module for a more accurate and stable tracking. Moreover, we investigate the influence of the Squeeze-and-Excitation layers and Online Hard Example Mining on the performance of AerialMPTNet. To the best of our knowledge, we are the first in using these two for a regression-based Multi-Object Tracking. Additionally, we studied and compared the L1 and Huber loss functions. In our experiments, we extensively evaluate AerialMPTNet on three aerial Multi-Object Tracking datasets, namely AerialMPT and KIT AIS pedestrian and vehicle datasets. Qualitative and quantitative results show that AerialMPTNet outperforms all previous methods for the pedestrian datasets and achieves competitive results for the vehicle dataset. In addition, Long Short-Term Memory and Graph Convolutional Neural Network modules enhance the tracking performance. Moreover, using Squeeze-and-Excitation and Online Hard Example Mining significantly helps for some cases while degrades the results for other cases. In addition, according to the results, L1 yields better results with respect to Huber loss for most of the scenarios. The presented results provide a deep insight into challenges and opportunities of the aerial Multi-Object Tracking domain, paving the way for future research.

연구 동기 및 목표

  • 고해상도 공중 영상에서 작은 객체 크기, 가림, 높은 밀도로 인해 성능이 저하되는 다중 객체 추적의 과제를 해결하기 위해.
  • 공중 영상에 특화된 딥러닝 기반의 다중 객체 추적(MOT) 방법을 개발하여 외관, 시간적, 공간-그래프적 신호를 통합하기 위해.
  • 압축 및 자극(SE) 층과 온라인 하드 예외 마이닝(OHEM)과 같은 아키텍처 구성 요소가 공중 환경에서 회귀 기반 MOT에 미치는 영향을 평가하기 위해.
  • 손실 함수(L1 대비 Huber)의 영향을 분석하고 공중 MOT에서 정확도와 강인성에 미치는 영향을 평가하기 위해.
  • 세 가지 공중 MOT 데이터셋에서 기존 최신 기술(SOT 및 MOT 방법)의 포괄적 벤치마크와 분석을 제공하여 성능 격차와 연구 기회를 규명하기 위해.

제안 방법

  • AerialMPTNet은 객체 재식별을 위해 안정적인 외관 특징을 추출하기 위해 시아모이드 신경망(SNN)을 활용한다.
  • 장기 단기 기억(LSTM) 네트워크는 시간적 의존성을 모델링하고 객체 운동을 예측하여 시간에 따른 추적 안정성을 향상시킨다.
  • 그래프 컨volution 신경망(GCN)은 추적 중인 객체 간의 공간적 관계를 캡처하여 상호작용을 모델링하고 가림 상황 처리 능력을 향상시킨다.
  • SNN, LSTM, GCN 브랜치에서 유도된 특징을 후기 융합(early fusion)을 통해 융합하여 정확한 바운딩 박스 예측을 생성한다.
  • 압축 및 자극(SE) 모듈은 채널별 중요도에 따라 특징 맵을 재조정하여 표현 학습 능력을 향상시킨다.
  • 온라인 하드 예외 마이닝(OHEM)은 학습 중에 잘못 분류되거나 추적하기 어려운 샘플에 집중하여 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1외관, 시간적, 그래픽 모델링 구성 요소가 공중 영상에서 다중 객체 추적에 개별적으로나 종합적으로 어떻게 향상되는가?
  • RQ2압축 및 자극(SE) 층이 공중 추적 환경에서 회귀 기반 MOT 모델의 성능에 어떤 영향을 미치는가?
  • RQ3온라인 하드 예외 마이닝(OHEM)이 복잡한 공중 환경에서 AerialMPTNet의 강인성과 정확도에 어떤 영향을 미치는가?
  • RQ4L1 또는 Huber 손실 함수 중 어느 것이 공중 MOT에서 더 나은 추적 성능을 내며, 어떤 조건에서 유리한가?
  • RQ5AerialMPTNet은 공중 MOT 벤치마크에서 최신 기술 기반의 전통적 및 딥러닝 기반 추적 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • AerialMPTNet은 KIT AIS 및 AerialMPT 보행자 데이터셋에서 모두 최고의 MOTA를 기록했으며, 이는 이전 최고 성능 방법인 SMSOT-CNN보다 각각 16.2점과 23.4점 높은 수치이다.
  • KIT AIS 및 AerialMPT 데이터셋에서 각각 보행자 5.9%와 4.6% 더 추적하고, SMSOT-CNN 대비 5.2%와 6.8% 적게 보행자를 잃는다.
  • LSTM 및 GCN 모듈은 추적 성능을 크게 향상시키며, LSTM은 운동 예측 능력을 향상시키고 GCN은 공간 모델링을 통해 가림 처리 능력을 향상시킨다.
  • 압축 및 자극(SE) 및 온라인 하드 예외 마이닝(OHEM)은 일부 맥락에서는 성능을 향상시키지만 다른 맥락에선 성능 저하를 초래하여, 맥락에 따라 효과가 달라지는 것으로 나타났다.
  • 대부분의 시나리오에서 L1 손실이 Huber 손실보다 더 우수한 결과를 내며, 특히 MOTA와 MOTP 측면에서 유리하여 이 작업에 있어 선호되는 손실 함수로 간주된다.
  • 차량 추적에서는 AerialMPTNet이 경쟁적인 성능을 보였지만, Stacked-DCFNet과 CSRT가 MOTA와 MOTP에서 더 높은 성능을 기록했으며, CSRT는 최고의 MOTA 51.1을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.